Machine Learning & AI
Advanced

Layer Normalization

Normalizes across features within a single sample; standard in Transformers.

Formula

x^=xμσ2+ϵγ+β\hat{x}=\dfrac{x-\mu}{\sqrt{\sigma^2+\epsilon}}\,\gamma+\beta

Variables

\muFeature mean
\sigma^2Feature variance
\gamma,\betaLearned scale/shift

Example

Works per-sample, unlike batch norm

Did You Know?

Layer norm, not batch norm, is used in Transformers because it is independent of batch size.

Share this formula