Pular para o conteúdo principal

Canto de Sabiá · IA generativa

O Coração Matemático da IA Generativa

Por que a IA generativa fascina, onde ela já chegou, que cuidados ela exige e, principalmente, qual é a conta que bate no coração dela: calcular a probabilidade da próxima palavra. No laboratório, você monta frases com uma pequena máquina de previsão.

Probabilidade · Softmax · Vetores 10 min de leitura PT · EN · ES

IntroduçãoUma revolução silenciosa

Em menos de uma década, assistimos a uma revolução silenciosa que mexeu nos limites que considerávamos firmes entre a criatividade humana e a capacidade computacional. A inteligência artificial generativa, sobretudo no processamento de linguagem natural, é uma força que desafia nossas ideias mais básicas sobre criatividade e até sobre inteligência.

Imagine um sistema que não apenas compreende a linguagem humana, mas produz textos tão elaborados que ficam difíceis de distinguir dos escritos por especialistas. Isso não é mais ficção: é uma realidade que se espalha por vários domínios, da literatura à ciência, do jornalismo ao ensino. Goodfellow, Bengio e Courville (2016), no livro Deep Learning, já dedicavam a parte final da obra aos modelos generativos profundos, máquinas que aprendem a produzir dados novos parecidos com aqueles que viram.

Parte 1O dia em que um robô escreveu no jornal

Em setembro de 2020, o jornal The Guardian publicou o artigo “A robot wrote this entire article. Are you scared yet, human?” (“Um robô escreveu este artigo inteiro. Já está com medo, humano?”), redigido pelo modelo GPT-3. O texto era coerente e fluente, argumentava sobre o papel da IA na sociedade e tinha nuances que muitos leitores acharam convincentes. Vale um detalhe que o próprio jornal registrou: o modelo produziu oito versões, e os editores montaram o artigo com os melhores trechos de cada uma, como fariam com um texto humano. O episódio virou um divisor de águas na percepção do público, uma mistura de fascínio, desorientação e até medo.

O fascínio tem base medida. No artigo que apresentou o GPT-3, os autores mostraram notícias curtas, escritas pelo modelo ou por jornalistas, a cerca de 80 pessoas por modelo. Diante do maior modelo, os participantes acertaram quem era a máquina em apenas 52% das vezes, praticamente o mesmo que chutar (Brown et al., 2020).

Parte 2Onde a IA generativa já chegou

Os Transformers mudaram o processamento de linguagem natural (Vaswani et al., 2017). Tunstall, von Werra e Wolf (2022), em Natural Language Processing with Transformers, mostram como usar essa arquitetura em classificação de textos, tradução e geração de linguagem, com a biblioteca Hugging Face e técnicas de ajuste fino. Jurafsky e Martin, em Speech and Language Processing, contam a evolução da área, dos métodos estatísticos ao aprendizado profundo, e explicam como o mecanismo de atenção melhorou a tradução automática.

Na educação, sistemas com IA podem oferecer explicações personalizadas, criar exemplos que fazem sentido no contexto do aluno e propor exercícios ajustados ao que cada um já sabe. Para que isso funcione bem, é preciso cuidar de questões éticas, da proteção dos dados dos estudantes à garantia de que o professor continue no centro das decisões pedagógicas.

Na indústria criativa, considerada um bastião da criatividade humana, roteiros, letras de música e até piadas já são gerados por IA. Em 2016, o curta-metragem Sunspring foi apresentado como o primeiro filme com roteiro escrito inteiramente por uma IA. O resultado era surreal e muitas vezes incoerente, mas mostrou como a máquina pode contribuir de formas inesperadas para o processo criativo.

No jornalismo, agências como a Associated Press e a Reuters usam sistemas automatizados para redigir relatórios financeiros e resumos esportivos a partir de grandes volumes de dados, em segundos. Isso levanta perguntas sobre o futuro da profissão e a natureza da reportagem.

Parte 3Fascínio e responsabilidade

O fascínio não pode esconder os desafios. A capacidade de gerar texto convincente em larga escala preocupa pela desinformação, pela manipulação da opinião pública e pelos riscos ao debate democrático; os próprios criadores do GPT-3 dedicaram uma seção do artigo aos possíveis usos indevidos. E a linha entre assistência criativa e substituição do trabalho humano fica cada vez mais fina.

Há também o risco de a IA amplificar vieses presentes nos dados com que aprendeu. Os autores do GPT-3 mediram isso: completando frases como “O [profissão] era um(a)…”, o modelo tendeu ao masculino em 83% das 388 profissões testadas, sobretudo em ocupações associadas a mais escolaridade (Brown et al., 2020). Esse é um risco real, que pede vigilância, estratégias de correção e diálogo entre desenvolvedores, educadores e formuladores de políticas públicas.

E há perguntas filosóficas. Se uma máquina produz um texto indistinguível do humano, ela “entende” o que escreve? Faz sentido falar em criatividade artificial? Longe de serem apenas acadêmicas, essas perguntas orientam como usamos e regulamos esses sistemas.

Parte 4O coração matemático

Como, exatamente, uma máquina sem compreensão no sentido humano produz um texto tão convincente? A resposta cabe numa frase: ela calcula, palavra por palavra, a probabilidade de cada continuação possível e escolhe uma. Vamos abrir essa frase em quatro partes.

1. Palavras viram números

O texto é cortado em pedaços chamados tokens (palavras ou partes de palavras), e cada token vira um vetor, uma lista de números. No Transformer original, cada vetor tem 512 números (Vaswani et al., 2017). Palavras usadas em contextos parecidos acabam com vetores parecidos.

2. A atenção mistura o contexto

Cada palavra compara o seu vetor com o das outras (um produto escalar), transforma as notas em porcentagens e mistura as informações de quem é mais relevante: Atenção(Q, K, V) = softmax(QKᵀ/√d)·V. Você pode ver essa conta funcionando no laboratório do Canto de Sabiá.

3. A próxima palavra é uma probabilidade

Depois de várias camadas, o modelo dá uma nota z para cada token do vocabulário. A softmax transforma essas notas em probabilidades que somam 100%: P(palavra) = e^z / Σ e^z. O Transformer usa exatamente essa função para “converter a saída em probabilidades do próximo token”. O modelo é autorregressivo: escolhe uma palavra, acrescenta ao texto e repete a conta para a seguinte.

4. A temperatura decide o quanto arriscar

Antes da softmax, as notas podem ser divididas por uma temperatura T. Com T baixa, a palavra mais provável domina e o texto fica previsível; com T alta, as chances se espalham e o texto fica mais variado (e mais sujeito a erros). Também é comum sortear só entre as palavras mais prováveis que, juntas, somam uma fração p da probabilidade (top-p); nos testes de viés do GPT-3, os autores usaram temperatura 1 e top-p 0,9.

A escala

O GPT-3 faz essa mesma conta com 175 bilhões de parâmetros, treinado com 300 bilhões de tokens, olhando até 2.048 tokens para trás. Foi essa escala que permitiu ao modelo aprender tarefas novas só com alguns exemplos no próprio prompt (Brown et al., 2020).

Considerações finaisEntre maravilhas e perigos

O fascínio pela IA generativa é múltiplo e profundo. De um lado, avanços que ampliam a criatividade e a produtividade humana e prometem soluções para desafios urgentes. De outro, questões éticas, filosóficas e práticas sem precedentes sobre a natureza da inteligência, os limites da automação e o papel da tecnologia no futuro da sociedade.

Estamos no limiar de uma era em que a fronteira entre o humano e o artificial fica cada vez mais difusa. Atravessá-la bem exige avanços técnicos, mas também reflexão e diálogo entre áreas. E começa por um gesto simples: entender que, no coração da máquina, não há mistério, e sim probabilidade, vetores e muitas contas.

AVM · Artefato Virtual Manipulável

Laboratório: a máquina da próxima palavra

Uma miniatura honesta de um modelo de linguagem. Ela aprendeu com 16 frases e olha só a última palavra; o GPT-3 olha até 2.048 tokens. Mas o último passo é o mesmo: notas, softmax, temperatura e sorteio.

Para ir mais fundo

Referências

  1. BROWN, Tom B. et al. Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 2020. Disponível em: arxiv.org/abs/2005.14165.
  2. GOODFELLOW, Ian; BENGIO, Yoshua; COURVILLE, Aaron. Deep Learning. Cambridge: MIT Press, 2016.
  3. JURAFSKY, Daniel; MARTIN, James H. Speech and Language Processing. 3. ed. (rascunho on-line). Disponível em: web.stanford.edu/~jurafsky/slp3.
  4. THE GUARDIAN. A robot wrote this entire article. Are you scared yet, human? The Guardian, Londres, 8 set. 2020. Disponível em: theguardian.com.
  5. TUNSTALL, Lewis; VON WERRA, Leandro; WOLF, Thomas. Natural Language Processing with Transformers. Sebastopol: O’Reilly Media, 2022.
  6. VASWANI, Ashish et al. Attention Is All You Need. Advances in Neural Information Processing Systems, 2017. Disponível em: arxiv.org/abs/1706.03762.
Continue no Canto de Sabiá

Da probabilidade à conversa

As AVAMIs usam essa mesma matemática para conversar com você sobre matemática, passo a passo. Comece pela Sigma, a porta de entrada para toda a matemática.

Do Pí à IA · Matemática · História · IA