1 / 10

Panorama

O que é um bloco Transformer

Um bloco, por dentro

A tese desta página: um Transformer é uma pilha de blocos idênticos, e o que muda entre eles é apenas o que cada um aprendeu a escrever no residual stream. Não há hierarquia declarada, nem módulo de sintaxe, nem módulo de semântica: há a mesma operação repetida, e uma esteira que atravessa tudo carregando as anotações acumuladas.
tudo nesta página é recalculado a partir dela

Explore cada etapa →

A matemática, num só lugar

As 4 contas que sustentam um bloco. Clique em qualquer uma para pular direto para a etapa que a explica.

Onde esta página começa

a fronteira com "Dentro de um LLM"

A etapa 4 daquela página mostra que existe atenção, com uma demonstração aproximada e sem fórmula: é a porta de entrada, e continua sendo o lugar certo para começar. Esta página mostra como a atenção funciona, com a conta rodando de verdade. Se você chegou aqui sem passar por lá e algo soar denso demais, o caminho de volta é aquele link.

Honestidade, antes de começar: as contas desta página rodam de verdade produto escalar, máscara, softmax, tudo calculado no seu navegador a partir da frase que você digitar. Mas os pesos são desenhados à mão, não extraídos de um modelo treinado. Escolhi quatro matrizes que produzem quatro comportamentos legíveis (vizinhança, token anterior, conteúdo, âncora) porque cabeças assim realmente aparecem em modelos reais e foram documentadas em trabalhos de interpretabilidade. Os padrões que você vai ver são plausíveis, não observados. Um modelo de verdade tem centenas de cabeças, a maioria sem interpretação simples nenhuma.