O Coração Matemático da IA Generativa
Por que a IA generativa fascina, onde ela já chegou, que cuidados ela exige e, principalmente, qual é a conta que bate no coração dela: calcular a probabilidade da próxima palavra. No laboratório, você monta frases com uma pequena máquina de previsão.
IntroduçãoUma revolução silenciosa
Em menos de uma década, assistimos a uma revolução silenciosa que mexeu nos limites que considerávamos firmes entre a criatividade humana e a capacidade computacional. A inteligência artificial generativa, sobretudo no processamento de linguagem natural, é uma força que desafia nossas ideias mais básicas sobre criatividade e até sobre inteligência.
Imagine um sistema que não apenas compreende a linguagem humana, mas produz textos tão elaborados que ficam difíceis de distinguir dos escritos por especialistas. Isso não é mais ficção: é uma realidade que se espalha por vários domínios, da literatura à ciência, do jornalismo ao ensino. Goodfellow, Bengio e Courville (2016), no livro Deep Learning, já dedicavam a parte final da obra aos modelos generativos profundos, máquinas que aprendem a produzir dados novos parecidos com aqueles que viram.
Parte 1O dia em que um robô escreveu no jornal
Em setembro de 2020, o jornal The Guardian publicou o artigo “A robot wrote this entire article. Are you scared yet, human?” (“Um robô escreveu este artigo inteiro. Já está com medo, humano?”), redigido pelo modelo GPT-3. O texto era coerente e fluente, argumentava sobre o papel da IA na sociedade e tinha nuances que muitos leitores acharam convincentes. Vale um detalhe que o próprio jornal registrou: o modelo produziu oito versões, e os editores montaram o artigo com os melhores trechos de cada uma, como fariam com um texto humano. O episódio virou um divisor de águas na percepção do público, uma mistura de fascínio, desorientação e até medo.
O fascínio tem base medida. No artigo que apresentou o GPT-3, os autores mostraram notícias curtas, escritas pelo modelo ou por jornalistas, a cerca de 80 pessoas por modelo. Diante do maior modelo, os participantes acertaram quem era a máquina em apenas 52% das vezes, praticamente o mesmo que chutar (Brown et al., 2020).
Parte 2Onde a IA generativa já chegou
Os Transformers mudaram o processamento de linguagem natural (Vaswani et al., 2017). Tunstall, von Werra e Wolf (2022), em Natural Language Processing with Transformers, mostram como usar essa arquitetura em classificação de textos, tradução e geração de linguagem, com a biblioteca Hugging Face e técnicas de ajuste fino. Jurafsky e Martin, em Speech and Language Processing, contam a evolução da área, dos métodos estatísticos ao aprendizado profundo, e explicam como o mecanismo de atenção melhorou a tradução automática.
Na educação, sistemas com IA podem oferecer explicações personalizadas, criar exemplos que fazem sentido no contexto do aluno e propor exercícios ajustados ao que cada um já sabe. Para que isso funcione bem, é preciso cuidar de questões éticas, da proteção dos dados dos estudantes à garantia de que o professor continue no centro das decisões pedagógicas.
Na indústria criativa, considerada um bastião da criatividade humana, roteiros, letras de música e até piadas já são gerados por IA. Em 2016, o curta-metragem Sunspring foi apresentado como o primeiro filme com roteiro escrito inteiramente por uma IA. O resultado era surreal e muitas vezes incoerente, mas mostrou como a máquina pode contribuir de formas inesperadas para o processo criativo.
No jornalismo, agências como a Associated Press e a Reuters usam sistemas automatizados para redigir relatórios financeiros e resumos esportivos a partir de grandes volumes de dados, em segundos. Isso levanta perguntas sobre o futuro da profissão e a natureza da reportagem.
Parte 3Fascínio e responsabilidade
O fascínio não pode esconder os desafios. A capacidade de gerar texto convincente em larga escala preocupa pela desinformação, pela manipulação da opinião pública e pelos riscos ao debate democrático; os próprios criadores do GPT-3 dedicaram uma seção do artigo aos possíveis usos indevidos. E a linha entre assistência criativa e substituição do trabalho humano fica cada vez mais fina.
Há também o risco de a IA amplificar vieses presentes nos dados com que aprendeu. Os autores do GPT-3 mediram isso: completando frases como “O [profissão] era um(a)…”, o modelo tendeu ao masculino em 83% das 388 profissões testadas, sobretudo em ocupações associadas a mais escolaridade (Brown et al., 2020). Esse é um risco real, que pede vigilância, estratégias de correção e diálogo entre desenvolvedores, educadores e formuladores de políticas públicas.
E há perguntas filosóficas. Se uma máquina produz um texto indistinguível do humano, ela “entende” o que escreve? Faz sentido falar em criatividade artificial? Longe de serem apenas acadêmicas, essas perguntas orientam como usamos e regulamos esses sistemas.
Parte 4O coração matemático
Como, exatamente, uma máquina sem compreensão no sentido humano produz um texto tão convincente? A resposta cabe numa frase: ela calcula, palavra por palavra, a probabilidade de cada continuação possível e escolhe uma. Vamos abrir essa frase em quatro partes.
1. Palavras viram números
O texto é cortado em pedaços chamados tokens (palavras ou partes de palavras), e cada token vira um vetor, uma lista de números. No Transformer original, cada vetor tem 512 números (Vaswani et al., 2017). Palavras usadas em contextos parecidos acabam com vetores parecidos.
2. A atenção mistura o contexto
Cada palavra compara o seu vetor com o das outras (um produto escalar), transforma as notas em porcentagens e mistura as informações de quem é mais relevante: Atenção(Q, K, V) = softmax(QKᵀ/√d)·V. Você pode ver essa conta funcionando no laboratório do Canto de Sabiá.
3. A próxima palavra é uma probabilidade
Depois de várias camadas, o modelo dá uma nota z para cada token do vocabulário. A softmax transforma essas notas em probabilidades que somam 100%: P(palavra) = e^z / Σ e^z. O Transformer usa exatamente essa função para “converter a saída em probabilidades do próximo token”. O modelo é autorregressivo: escolhe uma palavra, acrescenta ao texto e repete a conta para a seguinte.
4. A temperatura decide o quanto arriscar
Antes da softmax, as notas podem ser divididas por uma temperatura T. Com T baixa, a palavra mais provável domina e o texto fica previsível; com T alta, as chances se espalham e o texto fica mais variado (e mais sujeito a erros). Também é comum sortear só entre as palavras mais prováveis que, juntas, somam uma fração p da probabilidade (top-p); nos testes de viés do GPT-3, os autores usaram temperatura 1 e top-p 0,9.
A escala
O GPT-3 faz essa mesma conta com 175 bilhões de parâmetros, treinado com 300 bilhões de tokens, olhando até 2.048 tokens para trás. Foi essa escala que permitiu ao modelo aprender tarefas novas só com alguns exemplos no próprio prompt (Brown et al., 2020).
Considerações finaisEntre maravilhas e perigos
O fascínio pela IA generativa é múltiplo e profundo. De um lado, avanços que ampliam a criatividade e a produtividade humana e prometem soluções para desafios urgentes. De outro, questões éticas, filosóficas e práticas sem precedentes sobre a natureza da inteligência, os limites da automação e o papel da tecnologia no futuro da sociedade.
Estamos no limiar de uma era em que a fronteira entre o humano e o artificial fica cada vez mais difusa. Atravessá-la bem exige avanços técnicos, mas também reflexão e diálogo entre áreas. E começa por um gesto simples: entender que, no coração da máquina, não há mistério, e sim probabilidade, vetores e muitas contas.
IntroductionA quiet revolution
In less than a decade, we have witnessed a quiet revolution that shifted limits we thought were firmly set between human creativity and computing power. Generative artificial intelligence, especially in natural language processing, is a force that challenges our most basic ideas about creativity and even about intelligence.
Imagine a system that not only understands human language but produces texts so elaborate that they are hard to tell apart from those written by experts. This is no longer fiction: it is a reality spreading across many fields, from literature to science, from journalism to teaching. Goodfellow, Bengio and Courville (2016), in the book Deep Learning, already devoted its final part to deep generative models, machines that learn to produce new data similar to what they have seen.
Part 1The day a robot wrote for a newspaper
In September 2020, The Guardian published the piece “A robot wrote this entire article. Are you scared yet, human?”, written by the GPT-3 model. The text was coherent and fluent, argued about the role of AI in society and had nuances many readers found convincing. One detail recorded by the newspaper itself is worth noting: the model produced eight versions, and the editors assembled the article from the best parts of each, as they would with a human text. The episode became a turning point in public perception, a mix of fascination, disorientation and even fear.
The fascination has a measured basis. In the paper that introduced GPT-3, the authors showed short news articles, written either by the model or by journalists, to about 80 people per model. Facing the largest model, participants identified the machine only 52% of the time, practically the same as guessing (Brown et al., 2020).
Part 2Where generative AI has already arrived
Transformers changed natural language processing (Vaswani et al., 2017). Tunstall, von Werra and Wolf (2022), in Natural Language Processing with Transformers, show how to use this architecture for text classification, translation and language generation, with the Hugging Face library and fine-tuning techniques. Jurafsky and Martin, in Speech and Language Processing, tell the field’s evolution, from statistical methods to deep learning, and explain how the attention mechanism improved machine translation.
In education, AI systems can offer personalised explanations, create examples that make sense in the student’s context and propose exercises tailored to what each one already knows. For this to work well, ethical issues must be addressed, from protecting students’ data to making sure the teacher stays at the centre of pedagogical decisions.
In the creative industry, long considered a bastion of human creativity, scripts, song lyrics and even jokes are already generated by AI. In 2016, the short film Sunspring was presented as the first film with a script written entirely by an AI. The result was surreal and often incoherent, but it showed how the machine can contribute to the creative process in unexpected ways.
In journalism, agencies such as the Associated Press and Reuters use automated systems to write financial reports and sports summaries from large volumes of data, in seconds. This raises questions about the future of the profession and the nature of reporting.
Part 3Fascination and responsibility
Fascination must not hide the challenges. The ability to generate convincing text at scale raises concerns about disinformation, manipulation of public opinion and risks to democratic debate; GPT-3’s own creators devoted a section of their paper to possible misuse. And the line between creative assistance and replacing human work keeps getting thinner.
There is also the risk that AI amplifies biases present in the data it learned from. GPT-3’s authors measured this: completing sentences such as “The [occupation] was a…”, the model leaned male for 83% of the 388 occupations tested, especially for occupations associated with more education (Brown et al., 2020). This is a real risk that calls for vigilance, mitigation strategies and dialogue among developers, educators and policymakers.
And there are philosophical questions. If a machine produces text indistinguishable from a human’s, does it “understand” what it writes? Does it make sense to speak of artificial creativity? Far from being merely academic, these questions shape how we use and regulate these systems.
Part 4The mathematical heart
How exactly does a machine without understanding in the human sense produce such convincing text? The answer fits in one sentence: it calculates, word by word, the probability of each possible continuation and picks one. Let’s open that sentence in four parts.
1. Words become numbers
Text is cut into pieces called tokens (words or parts of words), and each token becomes a vector, a list of numbers. In the original Transformer, each vector has 512 numbers (Vaswani et al., 2017). Words used in similar contexts end up with similar vectors.
2. Attention mixes the context
Each word compares its vector with the others’ (a dot product), turns the scores into percentages and blends the information from the most relevant ones: Attention(Q, K, V) = softmax(QKᵀ/√d)·V. You can watch this calculation at work in the Canto de Sabiá lab.
3. The next word is a probability
After many layers, the model gives a score z to every token in the vocabulary. The softmax turns these scores into probabilities that add up to 100%: P(word) = e^z / Σ e^z. The Transformer uses exactly this function to “convert the output to predicted next-token probabilities”. The model is autoregressive: it picks a word, appends it to the text and repeats the calculation for the next one.
4. Temperature decides how much to risk
Before the softmax, the scores can be divided by a temperature T. With low T, the most likely word dominates and the text becomes predictable; with high T, the chances spread out and the text becomes more varied (and more error-prone). It is also common to sample only among the most likely words that together add up to a fraction p of the probability (top-p); in GPT-3’s bias tests, the authors used temperature 1 and top-p 0.9.
The scale
GPT-3 does this same calculation with 175 billion parameters, trained on 300 billion tokens, looking back up to 2,048 tokens. That scale is what allowed the model to learn new tasks from just a few examples in the prompt itself (Brown et al., 2020).
Final thoughtsBetween wonders and dangers
The fascination with generative AI is manifold and deep. On one side, advances that expand human creativity and productivity and promise solutions to urgent challenges. On the other, unprecedented ethical, philosophical and practical questions about the nature of intelligence, the limits of automation and the role of technology in the future of society.
We stand on the threshold of an era in which the border between the human and the artificial becomes ever more blurred. Crossing it well requires technical progress, but also reflection and dialogue across fields. And it starts with a simple gesture: understanding that at the heart of the machine there is no mystery, but probability, vectors and a great many calculations.
IntroducciónUna revolución silenciosa
En menos de una década, presenciamos una revolución silenciosa que movió límites que creíamos firmes entre la creatividad humana y la capacidad computacional. La inteligencia artificial generativa, sobre todo en el procesamiento del lenguaje natural, es una fuerza que desafía nuestras ideas más básicas sobre la creatividad e incluso sobre la inteligencia.
Imagina un sistema que no solo comprende el lenguaje humano, sino que produce textos tan elaborados que cuesta distinguirlos de los escritos por especialistas. Ya no es ficción: es una realidad que se extiende por muchos ámbitos, de la literatura a la ciencia, del periodismo a la enseñanza. Goodfellow, Bengio y Courville (2016), en el libro Deep Learning, ya dedicaban la parte final de la obra a los modelos generativos profundos, máquinas que aprenden a producir datos nuevos parecidos a los que vieron.
Parte 1El día en que un robot escribió en el periódico
En septiembre de 2020, el periódico The Guardian publicó el artículo “A robot wrote this entire article. Are you scared yet, human?” (“Un robot escribió este artículo entero. ¿Ya tienes miedo, humano?”), redactado por el modelo GPT-3. El texto era coherente y fluido, argumentaba sobre el papel de la IA en la sociedad y tenía matices que muchos lectores consideraron convincentes. Vale un detalle que el propio periódico dejó registrado: el modelo produjo ocho versiones, y los editores armaron el artículo con los mejores fragmentos de cada una, como harían con un texto humano. El episodio marcó un antes y un después en la percepción del público, una mezcla de fascinación, desorientación e incluso miedo.
La fascinación tiene una base medida. En el artículo que presentó GPT-3, los autores mostraron noticias breves, escritas por el modelo o por periodistas, a unas 80 personas por modelo. Ante el modelo más grande, los participantes identificaron a la máquina solo el 52% de las veces, prácticamente lo mismo que adivinar (Brown et al., 2020).
Parte 2Adónde ya llegó la IA generativa
Los Transformers cambiaron el procesamiento del lenguaje natural (Vaswani et al., 2017). Tunstall, von Werra y Wolf (2022), en Natural Language Processing with Transformers, muestran cómo usar esta arquitectura en clasificación de textos, traducción y generación de lenguaje, con la biblioteca Hugging Face y técnicas de ajuste fino. Jurafsky y Martin, en Speech and Language Processing, cuentan la evolución del área, de los métodos estadísticos al aprendizaje profundo, y explican cómo el mecanismo de atención mejoró la traducción automática.
En la educación, los sistemas con IA pueden ofrecer explicaciones personalizadas, crear ejemplos que tengan sentido en el contexto del alumno y proponer ejercicios ajustados a lo que cada uno ya sabe. Para que esto funcione bien, hay que atender cuestiones éticas, desde la protección de los datos de los estudiantes hasta garantizar que el docente siga en el centro de las decisiones pedagógicas.
En la industria creativa, considerada un bastión de la creatividad humana, guiones, letras de canciones e incluso chistes ya se generan con IA. En 2016, el cortometraje Sunspring se presentó como la primera película con guion escrito íntegramente por una IA. El resultado era surrealista y muchas veces incoherente, pero mostró cómo la máquina puede contribuir de formas inesperadas al proceso creativo.
En el periodismo, agencias como Associated Press y Reuters usan sistemas automatizados para redactar informes financieros y resúmenes deportivos a partir de grandes volúmenes de datos, en segundos. Esto plantea preguntas sobre el futuro de la profesión y la naturaleza del reportaje.
Parte 3Fascinación y responsabilidad
La fascinación no puede ocultar los desafíos. La capacidad de generar texto convincente a gran escala preocupa por la desinformación, la manipulación de la opinión pública y los riesgos para el debate democrático; los propios creadores de GPT-3 dedicaron una sección del artículo a los posibles usos indebidos. Y la línea entre asistencia creativa y sustitución del trabajo humano es cada vez más fina.
Existe también el riesgo de que la IA amplifique sesgos presentes en los datos con los que aprendió. Los autores de GPT-3 lo midieron: al completar frases como “El/La [profesión] era un(a)…”, el modelo se inclinó hacia el masculino en el 83% de las 388 profesiones probadas, sobre todo en ocupaciones asociadas a más estudios (Brown et al., 2020). Es un riesgo real, que exige vigilancia, estrategias de corrección y diálogo entre desarrolladores, educadores y responsables de políticas públicas.
Y hay preguntas filosóficas. Si una máquina produce un texto indistinguible del humano, ¿“entiende” lo que escribe? ¿Tiene sentido hablar de creatividad artificial? Lejos de ser solo académicas, estas preguntas orientan cómo usamos y regulamos estos sistemas.
Parte 4El corazón matemático
¿Cómo, exactamente, una máquina sin comprensión en el sentido humano produce un texto tan convincente? La respuesta cabe en una frase: calcula, palabra por palabra, la probabilidad de cada continuación posible y elige una. Abramos esa frase en cuatro partes.
1. Las palabras se vuelven números
El texto se corta en trozos llamados tokens (palabras o partes de palabras), y cada token se convierte en un vector, una lista de números. En el Transformer original, cada vector tiene 512 números (Vaswani et al., 2017). Las palabras usadas en contextos parecidos terminan con vectores parecidos.
2. La atención mezcla el contexto
Cada palabra compara su vector con el de las demás (un producto escalar), convierte las notas en porcentajes y mezcla la información de las más relevantes: Atención(Q, K, V) = softmax(QKᵀ/√d)·V. Puedes ver esa cuenta funcionando en el laboratorio del Canto de Sabiá.
3. La próxima palabra es una probabilidad
Después de varias capas, el modelo da una nota z a cada token del vocabulario. La softmax convierte esas notas en probabilidades que suman 100%: P(palabra) = e^z / Σ e^z. El Transformer usa exactamente esta función para “convertir la salida en probabilidades del próximo token”. El modelo es autorregresivo: elige una palabra, la añade al texto y repite la cuenta para la siguiente.
4. La temperatura decide cuánto arriesgar
Antes de la softmax, las notas pueden dividirse por una temperatura T. Con T baja, la palabra más probable domina y el texto se vuelve predecible; con T alta, las probabilidades se reparten y el texto se vuelve más variado (y más propenso a errores). También es común sortear solo entre las palabras más probables que, juntas, suman una fracción p de la probabilidad (top-p); en las pruebas de sesgo de GPT-3, los autores usaron temperatura 1 y top-p 0,9.
La escala
GPT-3 hace esta misma cuenta con 175 mil millones de parámetros, entrenado con 300 mil millones de tokens, mirando hasta 2.048 tokens hacia atrás. Esa escala es la que le permitió aprender tareas nuevas solo con algunos ejemplos en el propio prompt (Brown et al., 2020).
Consideraciones finalesEntre maravillas y peligros
La fascinación por la IA generativa es múltiple y profunda. Por un lado, avances que amplían la creatividad y la productividad humanas y prometen soluciones a desafíos urgentes. Por otro, cuestiones éticas, filosóficas y prácticas sin precedentes sobre la naturaleza de la inteligencia, los límites de la automatización y el papel de la tecnología en el futuro de la sociedad.
Estamos en el umbral de una era en la que la frontera entre lo humano y lo artificial se vuelve cada vez más difusa. Cruzarla bien exige avances técnicos, pero también reflexión y diálogo entre áreas. Y empieza con un gesto sencillo: entender que, en el corazón de la máquina, no hay misterio, sino probabilidad, vectores y muchísimas cuentas.
Laboratório: a máquina da próxima palavra
Uma miniatura honesta de um modelo de linguagem. Ela aprendeu com 16 frases e olha só a última palavra; o GPT-3 olha até 2.048 tokens. Mas o último passo é o mesmo: notas, softmax, temperatura e sorteio.
Referências
- BROWN, Tom B. et al. Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 2020. Disponível em: arxiv.org/abs/2005.14165.
- GOODFELLOW, Ian; BENGIO, Yoshua; COURVILLE, Aaron. Deep Learning. Cambridge: MIT Press, 2016.
- JURAFSKY, Daniel; MARTIN, James H. Speech and Language Processing. 3. ed. (rascunho on-line). Disponível em: web.stanford.edu/~jurafsky/slp3.
- THE GUARDIAN. A robot wrote this entire article. Are you scared yet, human? The Guardian, Londres, 8 set. 2020. Disponível em: theguardian.com.
- TUNSTALL, Lewis; VON WERRA, Leandro; WOLF, Thomas. Natural Language Processing with Transformers. Sebastopol: O’Reilly Media, 2022.
- VASWANI, Ashish et al. Attention Is All You Need. Advances in Neural Information Processing Systems, 2017. Disponível em: arxiv.org/abs/1706.03762.
Da probabilidade à conversa
As AVAMIs usam essa mesma matemática para conversar com você sobre matemática, passo a passo. Comece pela Sigma, a porta de entrada para toda a matemática.
Do Pí à IA · Matemática · História · IA