A leitura da NTM e a de uma cabeça de atenção são a mesma soma ponderada; o que muda é como o peso nasce. Na NTM, o cosseno elevado a β; na atenção, o produto interno. O cosseno divide pela norma da linha e o produto interno não, e o painel mede as duas consequências disso: o empate que nenhum β desfaz, e o argmax que muda de posição.
O critério é o de IL36: uma permutação sobrevive se, e somente se, ela preserva a matriz de estrutura da codificação. O passeio é lexicográfico e não sorteado, e a aritmética é inteira — inclusive na senoidal, cujas frequências são ternos de Pitágoras, de modo que o ponto do círculo é racional e a contagem é BigInt e não tolerância.
O modelo é declarado e conta multiplicações por passo. Nove peças do DNC são lineares em N — uma delas com um logaritmo dentro —, e a matriz de vínculos temporais é a única quadrática. A linha do KV cache é o custo da atenção no passo T, e onde ela cruza o total é o cruzamento.
Nove operações da NTM e do DNC contra o que a atenção tem no lugar. Clicar numa linha abre a conta que a justifica. Cinco não têm correspondente, e cada ausência remove um problema de treino que IL35 ou IL36 mediu.