Uma pilha, quatro alavancas, e uma reta em eixo logarítmico

O ganho de uma camada é g = n · sigma² · c, com c = 1/2 para a ReLU e c = 1 para a identidade. Como a acumulação é geométrica, a curva medida é uma reta neste eixo, e a linha tracejada é a previsão g^l. Comece pelos quatro botões; depois procure o sigma em que a reta vira de descendente para ascendente, e o que a largura pequena faz com o passeio em torno da previsão.

c da não linearidade
0,5
ganho previsto
1,000
ganho medido
segundo momento no fim

A curva cheia é medida, camada a camada, com o mesmo splitmix64 do C++23 do artigo. A tracejada é g^l. Quando as duas se separam, não é erro de nenhuma das duas: a previsão é sobre a esperança do ganho, e o que está desenhado é uma realização. Diminua a largura e o passeio aumenta.

As receitas, para esta largura

esquemasigmaganho com ReLUsegundo momento no fim

Repare que Xavier com ReLU dá ganho exatamente 1/2 em qualquer largura, e portanto 2^-L no fim — é a linha do artigo sobre o preço de errar o fator 2.