Pular para o conteúdo principal

Canto de Sabiá · Ensaio · Transformers

Attention Is All You Need: o dia em que a IA cansou da fila e decidiu prestar atenção

Durante muito tempo, as máquinas tentaram entender linguagem como quem enfrenta cartório em segunda-feira: uma palavra por vez, com esforço, drama e um leve desespero estatístico. Então surgiu o Transformer e disse, com elegância quase ofensiva: talvez não seja preciso sofrer em sequência para compreender uma frase inteira.

Atenção · Softmax · Seno e cosseno 14 min de leitura PT · EN · ES

IntroduçãoQuando um artigo não apenas explica uma ideia, mas muda o rumo da história

O artigo Attention Is All You Need, publicado em 2017, não foi só mais um texto técnico com título ousado. Ele apresentou o Transformer, uma arquitetura de redes neurais que trocou a dependência de recorrência por um mecanismo muito mais elegante: atenção (Vaswani et al., 2017).

Antes dele, os modelos dominantes em tarefas de linguagem viviam presos a estruturas recorrentes e, em alguns casos, convolucionais (Sutskever; Vinyals; Le, 2014; Gehring et al., 2017). Funcionavam? Sim. Eram respeitáveis? Também. Mas processavam informação como quem carrega mudança em escada apertada: devagar, suando e torcendo para não esquecer nada no caminho.

O Transformer surgiu com uma proposta quase insolente de tão brilhante: dispensar recorrência e convolução e organizar o processamento a partir de relações de atenção entre os elementos da sequência. Em outras palavras, a máquina deixaria de andar palavra por palavra como se estivesse cumprindo pena burocrática e passaria a olhar para a frase inteira com muito mais liberdade.

“A revolução não começou quando a máquina ficou mais rápida. Começou quando ela aprendeu a olhar para as relações certas.”

Esta página conta essa transformação em linguagem editorial, criativa e didática. O objetivo não é esvaziar a sofisticação do artigo, mas provar uma coisa muito importante: matemática, computação e elegância conceitual podem, sim, conversar com humor sem perder precisão.

Do sofrimento sequencial à atenção distribuída. A atenção já ajudava as redes recorrentes desde 2014 (Bahdanau; Cho; Bengio, 2014); em 2017 ela virou o centro de tudo, e a partir de 2018 vieram modelos como o BERT (Devlin et al., 2018).
2017O ano em que o Transformer foi apresentado ao mundo.
AtençãoO mecanismo central que substituiu recorrência e convolução no núcleo da proposta.
LegadoA base conceitual de grande parte da IA generativa e dos modelos de linguagem atuais.

Tópico 1Quando a IA ainda sofria para pensar em sequência

Antes do Transformer, a paisagem da modelagem de linguagem era dominada por arquiteturas que processavam sequências de maneira fortemente sequencial. As RNNs, suas variações mais sofisticadas, como as LSTMs, e também arquiteturas com convolução faziam um trabalho admirável, mas carregavam um limite estrutural: quanto maior a sequência, maior a tensão entre memória, tempo de treinamento e capacidade de capturar dependências distantes.

Em linguagem menos cerimoniosa: se uma palavra no começo da frase quisesse manter uma relação importante com uma palavra lá no fim, havia boa chance de essa informação chegar ao destino meio cansada, amarrotada e pedindo um copo d’água. O caminho era longo. O processamento era encadeado. A paralelização, limitada.

  • Processamento em sequência: cada posição depende do que veio antes.
  • Menos paralelização: nem tudo pode ser calculado ao mesmo tempo.
  • Caminhos longos entre informações distantes: aprender dependências longas fica mais difícil.
  • Treinamento mais custoso: mais tempo, mais limitações práticas, mais paciência forçada.
As redes anteriores eram competentes, mas trabalhavam como quem lê romance russo em pé no ônibus: com esforço real e dignidade questionável.

É aí que a genialidade do Transformer começa a aparecer. Ele não chega apenas para melhorar uma engrenagem. Ele chega para perguntar: e se o problema estiver no jeito inteiro como estamos organizando o pensamento da máquina? O próprio artigo mede isso: numa camada recorrente, o número de operações em sequência e o caminho entre duas palavras distantes crescem com o tamanho da frase; na self-attention, os dois são constantes.

A era anterior ao Transformer: muita inteligência, pouca liberdade computacional e um apego exagerado à fila.

Tópico 2O dia em que a atenção virou protagonista

O coração do artigo está numa frase que parece simples, mas detonou uma mudança histórica: o Transformer se baseia apenas em mecanismos de atenção. Sem recorrência. Sem convolução como eixo central. É o tipo de decisão que, quando dá certo, parece inevitável. Antes de dar certo, parecia ousadia de gente que não tem medo de mexer na fundação do prédio.

A arquitetura segue o formato encoder-decoder. O encoder transforma a sequência de entrada em representações contínuas; o decoder gera a saída passo a passo. O diferencial é que, dentro dessa estrutura, a lógica principal passa a ser a self-attention, pela qual cada posição da sequência pode se relacionar com todas as outras.

De forma intuitiva, cada palavra se comporta como se perguntasse: “quem nesta frase pode me ajudar a entender meu papel?”. Algumas respostas valem muito. Outras, menos. E sempre existe um elemento que contribui quase nada, como aquele colega de grupo que aparece só na foto final.

A festa da atenção, em diagrama: Q e K decidem o foco, a softmax distribui as probabilidades e V entrega o conteúdo.
Attention(Q, K, V) = softmax(QKᵀ / √dₖ) · V

A fórmula organiza uma dinâmica elegante entre queries, keys e values. A query expressa o que uma palavra busca; a key indica que tipo de informação outra palavra oferece; e o value carrega o conteúdo que pode ser aproveitado. A divisão por √dₖ evita que os produtos escalares fiquem grandes demais e “travem” a softmax. O resultado é um foco distribuído, eficiente e contextual.

E, como uma única cabeça de atenção seria pouco para um artigo dessa ambição, os autores avançam para a multi-head attention: em vez de um olhar só, o modelo usa vários olhares em paralelo (no artigo, 8 cabeças, cada uma com dimensão 64). Cada cabeça capta padrões diferentes: relações sintáticas, pistas semânticas, dependências mais próximas ou mais longas. É como organizar uma banca de especialistas e, pela primeira vez na história, a banca efetivamente ajudar.

h olhares em paralelo, cada um aprendendo um tipo diferente de relação, depois reunidos numa única representação.

Tópico 3A engenharia elegante por trás da ousadia

O que torna o artigo realmente memorável não é só a provocação teórica, mas a engenharia que sustenta a proposta. O Transformer não vive de slogan bonito: funciona porque foi desenhado com precisão. O encoder tem 6 camadas, e cada uma combina self-attention e uma rede feed-forward aplicada posição por posição. O decoder também tem 6 camadas e acrescenta uma atenção sobre a saída do encoder, além de uma máscara que impede o modelo de “espiar o futuro”.

Em resumo: nada de cola. Até a inteligência artificial precisou respeitar a ordem da prova.

Outro ponto crucial é o uso de conexões residuais e normalização de camada. Traduzindo sem perder a elegância: o modelo não sai empilhando operações e torcendo pelo melhor. Ele preserva caminhos de informação, estabiliza o treinamento e organiza a circulação dos sinais com uma disciplina arquitetônica admirável. É a diferença entre projetar um edifício com cálculo estrutural e tentar resolver tudo na base do “depois a gente vê”.

E chegamos a um dos detalhes mais bonitos do artigo: a codificação posicional. Como a arquitetura não usa recorrência, ela precisa de outra forma de representar a ordem. Afinal, em linguagem, ordem não é capricho decorativo: trocar posições muda sentido, intenção e às vezes até o nível de confusão social da frase. Os autores somam a cada palavra um padrão de posição feito de senos e cossenos:

PE(pos, 2i) = sin(pos / 100002i/d) · PE(pos, 2i+1) = cos(pos / 100002i/d)

A solução é elegante porque injeta informação posicional sem abandonar a lógica paralela da arquitetura. É quase poético: para ensinar ordem à máquina, o artigo convoca a trigonometria. A matemática, como sempre, chega silenciosa e resolve o que o drama do processamento não deu conta.

Codificação posicional: a trigonometria entrando em cena para impedir que a frase vire carnaval sintático.

A partir daí, o Transformer reúne três virtudes preciosas: melhor paralelização, caminhos mais curtos entre elementos distantes e maior adequação a grandes volumes de treinamento. Ele não é apenas rápido; é estruturalmente mais compatível com a escala da linguagem e da computação moderna.

Tópico 4Quando os resultados chegaram e mudou tudo

Toda proposta ousada precisa enfrentar o momento da verdade: funciona mesmo ou é só charme conceitual em embalagem premium? O artigo responde de forma direta, com resultados fortes em tradução automática. No WMT 2014 inglês-alemão, o Transformer grande alcançou 28,4 BLEU, superando os melhores resultados anteriores, inclusive de conjuntos de modelos. No inglês-francês, chegou a 41,8 BLEU, depois de treinar por 3,5 dias em 8 GPUs, uma fração do custo dos concorrentes.

Quando os números chegaram, a teoria deixou de ser ousadia acadêmica e virou mudança de era.
Pontuação BLEU no newstest2014 (Tabela 2 de Vaswani et al., 2017)
ModeloEN→DEEN→FR
ConvS2S Ensemble26,3641,29
GNMT+RL Ensemble26,341,16
Transformer (base)27,338,1
Transformer (big)28,441,8

E aqui mora a parte deliciosa da história científica: o ganho não foi só em qualidade. O modelo também se mostrou mais paralelizável e com custos de treinamento significativamente menores do que vários concorrentes (Wu et al., 2016; Gehring et al., 2017). Foi o equivalente acadêmico de chegar numa reunião, resolver o problema da empresa e ainda reorganizar a pauta. O artigo também mostrou boa generalização em outra tarefa, a análise sintática de frases em inglês, reforçando que o Transformer não era um truque específico para tradução.

O Transformer não venceu por moda. Venceu porque entregou uma combinação rara: elegância conceitual, engenharia sólida e estatística convincente.

FinalDa tradução automática ao presente da IA: o legado de uma ideia elegante

No fim das contas, Attention Is All You Need é mais do que um artigo técnico. É a narrativa de uma ruptura intelectual muito bem calculada: o momento em que a inteligência artificial percebe que talvez não precise caminhar palavra por palavra, como quem arrasta um piano por um corredor estreito, para compreender estruturas complexas da linguagem.

O Transformer mostrou que a máquina poderia distribuir foco, relacionar elementos e construir entendimento a partir dessas conexões. Isso encurtou caminhos, aumentou a eficiência e abriu espaço para uma nova era: já em 2018, o BERT usava o encoder do Transformer para aprender linguagem em larga escala (Devlin et al., 2018), e os modelos generativos de hoje ainda ecoam essa decisão fundadora.

A história do Transformer é simples de resumir e difícil de superar: a IA parou de sofrer em fila e aprendeu a prestar atenção.

E talvez seja por isso que esse artigo continua tão fascinante. Ele não nos entrega só uma resposta técnica; oferece uma lição conceitual poderosa: às vezes, o verdadeiro avanço não está em fazer mais do mesmo com mais força, mas em reorganizar o problema com mais inteligência.

AVM · Artefato Virtual Manipulável

Laboratório do Transformer

Quatro experimentos com a matemática do artigo original. Todos os números são calculados na hora, com as fórmulas do artigo; nada é sorteado.

Para ir mais fundo

Referências

  1. BAHDANAU, Dzmitry; CHO, Kyunghyun; BENGIO, Yoshua. Neural Machine Translation by Jointly Learning to Align and Translate. 2014. Disponível em: arxiv.org/abs/1409.0473.
  2. DEVLIN, Jacob; CHANG, Ming-Wei; LEE, Kenton; TOUTANOVA, Kristina. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. 2018. Disponível em: arxiv.org/abs/1810.04805.
  3. GEHRING, Jonas et al. Convolutional Sequence to Sequence Learning. 2017. Disponível em: arxiv.org/abs/1705.03122.
  4. SUTSKEVER, Ilya; VINYALS, Oriol; LE, Quoc V. Sequence to Sequence Learning with Neural Networks. 2014. Disponível em: arxiv.org/abs/1409.3215.
  5. VASWANI, Ashish et al. Attention Is All You Need. Advances in Neural Information Processing Systems, 2017. Disponível em: arxiv.org/abs/1706.03762.
  6. WU, Yonghui et al. Google’s Neural Machine Translation System: Bridging the Gap between Human and Machine Translation. 2016. Disponível em: arxiv.org/abs/1609.08144.
Continue explorando

Continue explorando inteligência artificial, matemática e inovação

Se você gosta de conteúdos que unem rigor conceitual, linguagem acessível e uma pitada de humor inteligente, este é apenas o começo. Aqui, a matemática não é enfeite, a tecnologia não é modismo e o conhecimento não precisa ser cinza para ser profundo.

Do Pí à IA · Matemática · História · IA