A Arte de Sussurrar para as Máquinas e Desbloquear o Futuro da IA
Cinco técnicas que fazem a inteligência artificial generativa raciocinar, planejar, agir e colaborar: Chain of Thought, Tree of Thought, ReAct, DERA e RAG, cada uma conferida no artigo científico que a criou. Leia como funcionam e depois experimente todas no laboratório, com problemas de matemática.
IntroduçãoO prompt como portal
A inteligência artificial generativa (IAG) não é mais uma promessa distante: é uma força que redefine os limites da criatividade e da inovação. No coração dessa revolução está o prompt, o texto que abre a porta para o potencial de modelos como Claude, Gemini e ChatGPT. Dominar a arte de escrever bons prompts é a chave para obter textos que ressoam, imagens que inspiram e respostas que iluminam.
Por trás desses modelos está a arquitetura Transformer (Vaswani et al., 2017). E, desde o GPT-3, sabemos que um modelo grande consegue realizar uma tarefa nova apenas com instruções e alguns exemplos escritos no próprio prompt, sem nenhum treinamento extra: é o chamado aprendizado em contexto, ou few-shot (Brown et al., 2020). É por isso que a forma de escrever o prompt muda tanto o resultado.
A engenharia de prompts une ciência e arte. Ela vai além de formular perguntas: é um diálogo estratégico com a máquina, que a guia por um labirinto de possibilidades até um objetivo específico.
Este artigo apresenta cinco técnicas, cada uma conferida no artigo científico que a criou: Chain of Thought, Tree of Thought, ReAct, DERA e RAG. Cada uma tem uma aba no laboratório desta página, para você experimentar com problemas de matemática.
Técnica 1 · CoTChain of Thought: o raciocínio passo a passo
Imagine um mestre ensinando um aprendiz. Em vez de revelar só a resposta, ele percorre cada etapa e mostra a lógica por trás da solução. Essa é a essência da Cadeia de Pensamento: uma série de passos intermediários de raciocínio, escritos antes da resposta final (Wei et al., 2022).
A ideia conversa com a sala de aula. Em 1994, Chi e colegas pediram a estudantes do 8º ano que explicassem para si mesmos cada linha de um texto sobre o sistema circulatório; quem mais se autoexplicou aprendeu com mais compreensão (Chi et al., 1994). A CoT pede ao modelo o mesmo hábito.
Como funciona
Há dois jeitos de pedir. No artigo original, o prompt traz alguns exemplos já resolvidos passo a passo (few-shot), e o modelo imita esse formato na pergunta nova. Depois, Kojima et al. (2022) mostraram que muitas vezes basta acrescentar uma frase: “Vamos pensar passo a passo” (zero-shot).
Para que serve
Nos testes originais, a CoT melhorou o desempenho em aritmética, senso comum e raciocínio simbólico. Com apenas oito exemplos resolvidos, um modelo de 540 bilhões de parâmetros alcançou o melhor resultado da época no GSM8K, uma coleção de problemas de matemática do ensino básico. Já a frase de Kojima elevou o acerto do modelo InstructGPT de 17,7% para 78,7% no MultiArith.
Dois cuidados. O ganho aparece em modelos grandes, a partir de cerca de 100 bilhões de parâmetros; os pequenos escrevem passos fluentes, mas ilógicos. E a cadeia é uma janela para o raciocínio: se a resposta estiver errada, dá para achar o passo exato do erro.
Técnica 2 · ToTTree of Thought: várias linhas de raciocínio
A Árvore de Pensamento leva a CoT a um novo patamar. Em vez de seguir um único caminho, o modelo ramifica o raciocínio, como um explorador que mapeia um território desconhecido: propõe soluções parciais, avalia cada ramo e decide qual seguir, abandonando os que não levam a lugar nenhum (Yao et al., 2023b).
Como funciona
O prompt pede várias continuações possíveis, uma avaliação de cada uma e a continuação apenas das promissoras. Na versão original, o próprio modelo julga cada ramo como “certo”, “talvez” ou “impossível” e volta atrás quando um caminho não leva a nada.
Da árvore ao grafo
Besta et al. (2024) deram mais um passo com o Graph of Thoughts: os pensamentos viram vértices de um grafo e podem ser combinados, e não só ramificados. Para ordenar uma lista longa, por exemplo, o modelo ordena pedaços separados e depois junta os pedaços ordenados, como no merge sort. Na tarefa de ordenação, isso aumentou a qualidade em 62% em relação à ToT, com custo mais de 31% menor.
Para que serve
Quebra-cabeças, planejamento, redação e qualquer problema em que o primeiro caminho nem sempre é o certo. No laboratório, você joga o Jogo do 24, um dos testes do artigo original da ToT.
Técnica 3 · ReActReAct: raciocinar e agir, alternando
A CoT raciocina apenas com o que o modelo já sabe, e por isso pode inventar um fato no meio do caminho e carregar o erro até o fim. A ReAct (de Reasoning + Acting) junta pensar e agir: o modelo alterna um Pensamento, uma Ação (consultar uma fonte ou usar uma ferramenta) e a Observação que volta dessa ação, e só então pensa de novo (Yao et al., 2023a). É como um navegador experiente que ajusta as velas a cada mudança do vento: o plano é atualizado a cada nova informação.
Como funciona
No artigo original, o modelo consultava a Wikipédia com três ações: buscar[entidade], que traz as primeiras frases da página; procurar[termo], que encontra a próxima frase com aquele termo, como um Ctrl+F; e finalizar[resposta].
Para que serve
Consultando fontes, a ReAct reduziu a alucinação e a propagação de erros da CoT em perguntas que exigem combinar vários fatos (HotpotQA) e em checagem de fatos (FEVER). Em tarefas interativas, como agir numa casa simulada (ALFWorld) e comprar numa loja virtual (WebShop), superou métodos de imitação e de aprendizado por reforço em 34 e 10 pontos percentuais, com apenas um ou dois exemplos no prompt. E a trajetória fica legível: dá para ver por que o modelo fez cada coisa.
Uma variante: ReWOO
Alternar tem um custo: o modelo é chamado de novo depois de cada observação. A ReWOO (Reasoning WithOut Observation) separa as fases: escreve o plano inteiro primeiro, com lacunas (#E1, #E2…) para os resultados, deixa as ferramentas trabalharem e só no fim junta tudo. Num teste de perguntas com várias etapas, gastou cerca de cinco vezes menos tokens (Xu et al., 2023). O preço: se uma busca falhar, o plano não se corrige sozinho. No laboratório, você compara as duas.
Técnica 4 · DERADERA: resolver problemas pelo diálogo
Em muitos cenários, a solução está na colaboração. A DERA (Dialog-Enabled Resolving Agents) organiza um diálogo entre dois agentes (Nair et al., 2023). O Decisor escreve a primeira versão e tem a palavra final. O Pesquisador lê essa versão, procura o que falta ou está errado e aponta as discrepâncias. Nenhum dos dois conhece a resposta ideal: a qualidade nasce da conversa.
Como funciona
A cada observação do Pesquisador, o Decisor aceita ou recusa, sempre com um motivo; ele nunca é obrigado a concordar. As sugestões aceitas vão para um bloco de anotações compartilhado. A conversa termina quando o Pesquisador fica satisfeito (ou num limite de turnos; no artigo, 15), e o Decisor reescreve a resposta usando as anotações.
Para que serve
O artigo testou a DERA na saúde: resumos de consultas médicas, planos de cuidado e perguntas de medicina. Nos resumos, médicos preferiram a versão final da DERA em 90% dos casos. A mesma ideia aparece em técnicas parentes. Na Self-Refine, um único modelo gera, critica a própria resposta e a reescreve, em ciclos (Madaan et al., 2023). Na Chain-of-Verification, o modelo rascunha, planeja perguntas de verificação, responde a cada uma separadamente e só então escreve a versão final (Dhuliawala et al., 2023). No laboratório, a dupla corrige uma conta de geometria.
Técnica 5 · RAGRAG: buscar antes de responder
Um modelo de linguagem guarda o que aprendeu nos próprios parâmetros, a sua memória paramétrica. Mas não sabe dizer de onde tirou cada fato e fica desatualizado quando o mundo muda. A Geração Aumentada por Recuperação junta a essa memória uma memória não paramétrica: um índice de documentos que pode ser consultado na hora (Lewis et al., 2020).
Como funciona
No artigo original, um recuperador transforma a pergunta e cada documento em vetores e busca os mais próximos num índice de 21 milhões de trechos da Wikipédia, com cerca de 100 palavras cada. Os melhores trechos são concatenados à pergunta, e um gerador escreve a resposta. Hoje, a mesma ideia é aplicada direto no prompt: buscar, colar os trechos e pedir a resposta com base neles.
Para que serve
Nos testes originais, as respostas com RAG saíram mais específicas, variadas e corretas do que as de um modelo só com memória paramétrica. E há uma vantagem prática: para atualizar o conhecimento, basta trocar o índice, sem treinar o modelo de novo. Os autores perguntaram quem ocupava cargos de líderes mundiais: com o índice da Wikipédia de 2018, o modelo acertou 68% dos líderes de 2018; com o índice antigo, de 2016, só 4%. Serve para pesquisa, jornalismo, atendimento e educação personalizada.
Considerações finaisUma arte em evolução
Nesta jornada, vimos como CoT, ToT, ReAct e DERA permitem que os modelos de IAG vão além da geração de texto e passem a raciocinar, planejar, agir, colaborar e resolver problemas complexos, e como a RAG amplia o que eles sabem com informações de fontes externas.
A engenharia de prompts não é uma ciência exata, mas uma arte em constante evolução. À medida que os modelos se tornam mais sofisticados, novas técnicas vão surgir e desafiar o que hoje parece certo.
O futuro da engenharia de prompts está na colaboração: profissionais de tecnologia, pesquisadores, linguistas, psicólogos, filósofos, artistas e professores precisam unir forças para explorar as dimensões éticas, sociais e criativas da IAG e garantir que ela seja usada de forma responsável e benéfica para a humanidade.
IntroductionThe prompt as a gateway
Generative artificial intelligence is no longer a distant promise: it is a force redefining the limits of creativity and innovation. At the heart of this revolution lies the prompt, the text that opens the door to the potential of models such as Claude, Gemini and ChatGPT. Mastering the art of writing good prompts is the key to texts that resonate, images that inspire and answers that illuminate.
Behind these models lies the Transformer architecture (Vaswani et al., 2017). And since GPT-3 we have known that a large model can perform a new task from instructions and a few examples written in the prompt itself, with no extra training: this is called in-context learning, or few-shot learning (Brown et al., 2020). That is why the way a prompt is written changes the result so much.
Prompt engineering brings science and art together. It goes beyond asking questions: it is a strategic dialogue with the machine, guiding it through a maze of possibilities towards a specific goal.
This article presents five techniques, each checked against the scientific paper that introduced it: Chain of Thought, Tree of Thought, ReAct, DERA and RAG. Each one has a tab in this page’s lab, so you can try it with math problems.
Technique 1 · CoTChain of Thought: step-by-step reasoning
Picture a master teaching an apprentice. Instead of revealing only the answer, the master walks through each step and shows the logic behind the solution. That is the essence of Chain of Thought: a series of intermediate reasoning steps written before the final answer (Wei et al., 2022).
The idea speaks to the classroom. In 1994, Chi and colleagues asked eighth-grade students to explain to themselves each line of a text about the circulatory system; those who self-explained the most learned with deeper understanding (Chi et al., 1994). CoT asks the model for the same habit.
How it works
There are two ways to ask. In the original paper, the prompt includes a few examples already solved step by step (few-shot), and the model imitates that format on the new question. Later, Kojima et al. (2022) showed that often a single sentence is enough: “Let’s think step by step” (zero-shot).
What it is good for
In the original tests, CoT improved performance in arithmetic, commonsense and symbolic reasoning. With only eight worked examples, a 540-billion-parameter model reached the best result of its time on GSM8K, a collection of grade-school math word problems. Kojima’s sentence raised InstructGPT’s accuracy on MultiArith from 17.7% to 78.7%.
Two caveats. The gain appears in large models, from about 100 billion parameters; small ones write fluent but illogical steps. And the chain is a window into the reasoning: if the answer is wrong, you can find the exact step where it went wrong.
Technique 2 · ToTTree of Thought: many lines of reasoning
Tree of Thought takes CoT to a new level. Instead of following a single path, the model branches its reasoning, like an explorer mapping unknown territory: it proposes partial solutions, evaluates each branch and decides which one to follow, abandoning those that lead nowhere (Yao et al., 2023b).
How it works
The prompt asks for several possible continuations, an evaluation of each and continuing only with the promising ones. In the original version, the model itself judges each branch as “sure”, “likely” or “impossible” and backtracks when a path leads nowhere.
From tree to graph
Besta et al. (2024) went one step further with the Graph of Thoughts: thoughts become vertices of a graph and can be combined, not only branched. To sort a long list, for example, the model sorts separate chunks and then merges the sorted chunks, as in merge sort. On the sorting task, this raised quality by 62% over ToT while cutting costs by more than 31%.
What it is good for
Puzzles, planning, writing and any problem where the first path is not always the right one. In the lab, you play the Game of 24, one of the tests in the original ToT paper.
Technique 3 · ReActReAct: reasoning and acting, in turns
CoT reasons only with what the model already knows, so it can invent a fact halfway through and carry the error to the end. ReAct (Reasoning + Acting) combines thinking and doing: the model alternates a Thought, an Action (looking up a source or using a tool) and the Observation that comes back, and only then thinks again (Yao et al., 2023a). It is like an experienced sailor trimming the sails at every change of wind: the plan is updated with each new piece of information.
How it works
In the original paper, the model queried Wikipedia with three actions: search[entity], which returns the first sentences of the page; lookup[string], which finds the next sentence containing that string, like Ctrl+F; and finish[answer].
What it is good for
By consulting sources, ReAct reduced CoT’s hallucination and error propagation on questions that require combining several facts (HotpotQA) and on fact verification (FEVER). In interactive tasks, such as acting in a simulated home (ALFWorld) and shopping in an online store (WebShop), it beat imitation and reinforcement learning methods by 34 and 10 percentage points, with only one or two examples in the prompt. And the trajectory is readable: you can see why the model did each thing.
A variant: ReWOO
Alternating has a cost: the model is called again after every observation. ReWOO (Reasoning WithOut Observation) separates the phases: it writes the whole plan first, with placeholders (#E1, #E2…) for the results, lets the tools work and only combines everything at the end. On a multi-step question-answering test, it used about five times fewer tokens (Xu et al., 2023). The trade-off: if a search fails, the plan does not fix itself. In the lab, you can compare the two.
Technique 4 · DERADERA: solving problems through dialogue
In many scenarios, the solution lies in collaboration. DERA (Dialog-Enabled Resolving Agents) sets up a dialogue between two agents (Nair et al., 2023). The Decider writes the first version and has the final word. The Researcher reads that version, looks for what is missing or wrong and points out the discrepancies. Neither of them knows the ideal answer: quality comes from the conversation.
How it works
For each of the Researcher’s points, the Decider accepts or rejects it, always giving a reason; it is never obliged to agree. Accepted suggestions go to a shared scratchpad. The conversation ends when the Researcher is satisfied (or at a turn limit; 15 in the paper), and the Decider rewrites the answer using the scratchpad.
What it is good for
The paper tested DERA in healthcare: summaries of medical conversations, care plans and medical questions. For the summaries, physicians preferred DERA’s final version in 90% of cases. The same idea appears in related techniques. In Self-Refine, a single model generates, critiques its own answer and rewrites it, in cycles (Madaan et al., 2023). In Chain-of-Verification, the model drafts, plans verification questions, answers each one separately and only then writes the final version (Dhuliawala et al., 2023). In the lab, the pair fixes a geometry calculation.
Technique 5 · RAGRAG: search before you answer
A language model stores what it has learned in its own parameters, its parametric memory. But it cannot say where each fact came from, and it goes out of date when the world changes. Retrieval-Augmented Generation adds a non-parametric memory: an index of documents that can be consulted on the spot (Lewis et al., 2020).
How it works
In the original paper, a retriever turns the question and every document into vectors and finds the closest ones in an index of 21 million Wikipedia passages of about 100 words each. The best passages are concatenated with the question, and a generator writes the answer. Today, the same idea is applied directly in the prompt: search, paste the passages and ask for an answer based on them.
What it is good for
In the original tests, RAG answers were more specific, diverse and factual than those of a model with parametric memory only. And there is a practical advantage: to update its knowledge, you just swap the index, without retraining the model. The authors asked who held the posts of world leaders: with the 2018 Wikipedia index, the model got 68% of the 2018 leaders right; with the older 2016 index, only 4%. It is useful for research, journalism, customer service and personalised education.
Final thoughtsAn evolving art
On this journey, we saw how CoT, ToT, ReAct and DERA let generative AI models go beyond producing text and start reasoning, planning, acting, collaborating and solving complex problems, and how RAG expands what they know with information from external sources.
Prompt engineering is not an exact science but an ever-evolving art. As models become more sophisticated, new techniques will emerge and challenge what seems certain today.
The future of prompt engineering lies in collaboration: technologists, researchers, linguists, psychologists, philosophers, artists and teachers must join forces to explore the ethical, social and creative dimensions of generative AI and make sure it is used responsibly and for the benefit of humanity.
IntroducciónEl prompt como portal
La inteligencia artificial generativa ya no es una promesa lejana: es una fuerza que redefine los límites de la creatividad y la innovación. En el corazón de esta revolución está el prompt, el texto que abre la puerta al potencial de modelos como Claude, Gemini y ChatGPT. Dominar el arte de escribir buenos prompts es la clave para obtener textos que resuenan, imágenes que inspiran y respuestas que iluminan.
Detrás de estos modelos está la arquitectura Transformer (Vaswani et al., 2017). Y, desde GPT-3, sabemos que un modelo grande puede realizar una tarea nueva solo con instrucciones y algunos ejemplos escritos en el propio prompt, sin ningún entrenamiento extra: es el llamado aprendizaje en contexto, o few-shot (Brown et al., 2020). Por eso la forma de escribir el prompt cambia tanto el resultado.
La ingeniería de prompts une ciencia y arte. Va más allá de formular preguntas: es un diálogo estratégico con la máquina, que la guía por un laberinto de posibilidades hasta un objetivo concreto.
Este artículo presenta cinco técnicas, cada una contrastada con el artículo científico que la creó: Chain of Thought, Tree of Thought, ReAct, DERA y RAG. Cada una tiene una pestaña en el laboratorio de esta página, para que la pruebes con problemas de matemáticas.
Técnica 1 · CoTChain of Thought: el razonamiento paso a paso
Imagina a un maestro enseñando a un aprendiz. En lugar de revelar solo la respuesta, recorre cada etapa y muestra la lógica detrás de la solución. Esa es la esencia de la Cadena de Pensamiento: una serie de pasos intermedios de razonamiento, escritos antes de la respuesta final (Wei et al., 2022).
La idea dialoga con el aula. En 1994, Chi y sus colegas pidieron a estudiantes de octavo grado que se explicaran a sí mismos cada línea de un texto sobre el sistema circulatorio; quienes más se autoexplicaron aprendieron con mayor comprensión (Chi et al., 1994). La CoT le pide al modelo el mismo hábito.
Cómo funciona
Hay dos maneras de pedirlo. En el artículo original, el prompt incluye algunos ejemplos ya resueltos paso a paso (few-shot), y el modelo imita ese formato en la pregunta nueva. Después, Kojima et al. (2022) mostraron que a menudo basta con una frase: “Pensemos paso a paso” (zero-shot).
Para qué sirve
En las pruebas originales, la CoT mejoró el desempeño en aritmética, sentido común y razonamiento simbólico. Con solo ocho ejemplos resueltos, un modelo de 540 mil millones de parámetros alcanzó el mejor resultado de su época en GSM8K, una colección de problemas de matemáticas de educación básica. La frase de Kojima elevó el acierto del modelo InstructGPT del 17,7% al 78,7% en MultiArith.
Dos precauciones. La mejora aparece en modelos grandes, a partir de unos 100 mil millones de parámetros; los pequeños escriben pasos fluidos, pero ilógicos. Y la cadena es una ventana al razonamiento: si la respuesta está mal, se puede encontrar el paso exacto del error.
Técnica 2 · ToTTree of Thought: varias líneas de razonamiento
El Árbol de Pensamiento lleva la CoT a otro nivel. En lugar de seguir un único camino, el modelo ramifica el razonamiento, como un explorador que cartografía un territorio desconocido: propone soluciones parciales, evalúa cada rama y decide cuál seguir, abandonando las que no llevan a ninguna parte (Yao et al., 2023b).
Cómo funciona
El prompt pide varias continuaciones posibles, una evaluación de cada una y continuar solo con las prometedoras. En la versión original, el propio modelo juzga cada rama como “seguro”, “quizás” o “imposible” y retrocede cuando un camino no lleva a nada.
Del árbol al grafo
Besta et al. (2024) dieron un paso más con el Graph of Thoughts: los pensamientos se convierten en vértices de un grafo y pueden combinarse, no solo ramificarse. Para ordenar una lista larga, por ejemplo, el modelo ordena trozos por separado y luego une los trozos ordenados, como en el merge sort. En la tarea de ordenación, esto aumentó la calidad un 62% respecto a ToT, con un costo más de un 31% menor.
Para qué sirve
Rompecabezas, planificación, redacción y cualquier problema en el que el primer camino no siempre es el correcto. En el laboratorio, juegas al Juego del 24, una de las pruebas del artículo original de ToT.
Técnica 3 · ReActReAct: razonar y actuar, por turnos
La CoT razona solo con lo que el modelo ya sabe, por eso puede inventar un dato a mitad de camino y arrastrar el error hasta el final. ReAct (de Reasoning + Acting) une pensar y actuar: el modelo alterna un Pensamiento, una Acción (consultar una fuente o usar una herramienta) y la Observación que vuelve de esa acción, y solo entonces piensa de nuevo (Yao et al., 2023a). Es como un navegante experto que ajusta las velas a cada cambio del viento: el plan se actualiza con cada información nueva.
Cómo funciona
En el artículo original, el modelo consultaba Wikipedia con tres acciones: buscar[entidad], que trae las primeras frases de la página; localizar[término], que encuentra la siguiente frase con ese término, como un Ctrl+F; y finalizar[respuesta].
Para qué sirve
Al consultar fuentes, ReAct redujo la alucinación y la propagación de errores de la CoT en preguntas que exigen combinar varios datos (HotpotQA) y en verificación de hechos (FEVER). En tareas interactivas, como actuar en una casa simulada (ALFWorld) y comprar en una tienda virtual (WebShop), superó a métodos de imitación y de aprendizaje por refuerzo en 34 y 10 puntos porcentuales, con solo uno o dos ejemplos en el prompt. Y la trayectoria es legible: se ve por qué el modelo hizo cada cosa.
Una variante: ReWOO
Alternar tiene un costo: el modelo se llama de nuevo después de cada observación. ReWOO (Reasoning WithOut Observation) separa las fases: escribe primero el plan completo, con huecos (#E1, #E2…) para los resultados, deja trabajar a las herramientas y solo al final lo une todo. En una prueba de preguntas de varios pasos, gastó unas cinco veces menos tokens (Xu et al., 2023). El precio: si una búsqueda falla, el plan no se corrige solo. En el laboratorio, puedes comparar las dos.
Técnica 4 · DERADERA: resolver problemas mediante el diálogo
En muchos escenarios, la solución está en la colaboración. DERA (Dialog-Enabled Resolving Agents) organiza un diálogo entre dos agentes (Nair et al., 2023). El Decisor escribe la primera versión y tiene la última palabra. El Investigador lee esa versión, busca lo que falta o está mal y señala las discrepancias. Ninguno de los dos conoce la respuesta ideal: la calidad nace de la conversación.
Cómo funciona
Ante cada observación del Investigador, el Decisor acepta o rechaza, siempre con un motivo; nunca está obligado a estar de acuerdo. Las sugerencias aceptadas van a un bloc de notas compartido. La conversación termina cuando el Investigador queda satisfecho (o en un límite de turnos; en el artículo, 15), y el Decisor reescribe la respuesta usando las notas.
Para qué sirve
El artículo probó DERA en salud: resúmenes de consultas médicas, planes de cuidado y preguntas de medicina. En los resúmenes, los médicos prefirieron la versión final de DERA en el 90% de los casos. La misma idea aparece en técnicas emparentadas. En Self-Refine, un único modelo genera, critica su propia respuesta y la reescribe, en ciclos (Madaan et al., 2023). En Chain-of-Verification, el modelo hace un borrador, planifica preguntas de verificación, responde cada una por separado y solo entonces escribe la versión final (Dhuliawala et al., 2023). En el laboratorio, la pareja corrige una cuenta de geometría.
Técnica 5 · RAGRAG: buscar antes de responder
Un modelo de lenguaje guarda lo que aprendió en sus propios parámetros, su memoria paramétrica. Pero no sabe decir de dónde sacó cada dato y se desactualiza cuando el mundo cambia. La Generación Aumentada por Recuperación le suma una memoria no paramétrica: un índice de documentos que se puede consultar en el momento (Lewis et al., 2020).
Cómo funciona
En el artículo original, un recuperador convierte la pregunta y cada documento en vectores y busca los más cercanos en un índice de 21 millones de fragmentos de Wikipedia, de unas 100 palabras cada uno. Los mejores fragmentos se concatenan a la pregunta, y un generador escribe la respuesta. Hoy, la misma idea se aplica directamente en el prompt: buscar, pegar los fragmentos y pedir la respuesta a partir de ellos.
Para qué sirve
En las pruebas originales, las respuestas con RAG fueron más específicas, variadas y correctas que las de un modelo solo con memoria paramétrica. Y hay una ventaja práctica: para actualizar el conocimiento, basta con cambiar el índice, sin volver a entrenar el modelo. Los autores preguntaron quién ocupaba cargos de líderes mundiales: con el índice de Wikipedia de 2018, el modelo acertó el 68% de los líderes de 2018; con el índice antiguo, de 2016, solo el 4%. Sirve para investigación, periodismo, atención al cliente y educación personalizada.
Consideraciones finalesUn arte en evolución
En este recorrido vimos cómo CoT, ToT, ReAct y DERA permiten que los modelos de IA generativa vayan más allá de producir texto y pasen a razonar, planificar, actuar, colaborar y resolver problemas complejos, y cómo RAG amplía lo que saben con información de fuentes externas.
La ingeniería de prompts no es una ciencia exacta, sino un arte en constante evolución. A medida que los modelos se vuelven más sofisticados, surgirán nuevas técnicas que desafiarán lo que hoy parece seguro.
El futuro de la ingeniería de prompts está en la colaboración: profesionales de la tecnología, investigadores, lingüistas, psicólogos, filósofos, artistas y docentes deben unir fuerzas para explorar las dimensiones éticas, sociales y creativas de la IA generativa y garantizar que se use de forma responsable y en beneficio de la humanidad.
Laboratório de prompts
Cinco técnicas, cinco experimentos com matemática. Nada aqui chama uma IA de verdade: cada aba mostra, de forma controlada, o que a técnica faz por dentro.
Referências
- BESTA, Maciej et al. Graph of Thoughts: Solving Elaborate Problems with Large Language Models. In: AAAI Conference on Artificial Intelligence, 38., 2024. Disponível em: arxiv.org/abs/2308.09687.
- BROWN, Tom B. et al. Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 2020. Disponível em: arxiv.org/abs/2005.14165.
- CHI, Michelene T. H.; DE LEEUW, Nicholas; CHIU, Mei-Hung; LAVANCHER, Christian. Eliciting Self-Explanations Improves Understanding. Cognitive Science, v. 18, p. 439–477, 1994.
- DHULIAWALA, Shehzaad et al. Chain-of-Verification Reduces Hallucination in Large Language Models. 2023. Disponível em: arxiv.org/abs/2309.11495.
- KOJIMA, Takeshi et al. Large Language Models are Zero-Shot Reasoners. Advances in Neural Information Processing Systems, 2022. Disponível em: arxiv.org/abs/2205.11916.
- LEWIS, Patrick et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems, 2020. Disponível em: arxiv.org/abs/2005.11401.
- MADAAN, Aman et al. Self-Refine: Iterative Refinement with Self-Feedback. 2023. Disponível em: arxiv.org/abs/2303.17651.
- NAIR, Varun; SCHUMACHER, Elliot; TSO, Geoffrey; KANNAN, Anitha. DERA: Enhancing Large Language Model Completions with Dialog-Enabled Resolving Agents. 2023. Disponível em: arxiv.org/abs/2303.17071.
- VASWANI, Ashish et al. Attention Is All You Need. Advances in Neural Information Processing Systems, 2017. Disponível em: arxiv.org/abs/1706.03762.
- WEI, Jason et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. Advances in Neural Information Processing Systems, 2022. Disponível em: arxiv.org/abs/2201.11903.
- XU, Binfeng et al. ReWOO: Decoupling Reasoning from Observations for Efficient Augmented Language Models. 2023. Disponível em: arxiv.org/abs/2305.18323.
- YAO, Shunyu et al. ReAct: Synergizing Reasoning and Acting in Language Models. In: International Conference on Learning Representations (ICLR), 2023a. Disponível em: arxiv.org/abs/2210.03629.
- YAO, Shunyu et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. Advances in Neural Information Processing Systems, 2023b. Disponível em: arxiv.org/abs/2305.10601.
Agora converse com quem já usa essas técnicas
As AVAMIs, agentes de IA gratuitas da metodologia Do Pí à IA, raciocinam passo a passo e conferem as contas antes de responder. Comece pela Sigma, a porta de entrada para toda a matemática.
Do Pí à IA · Matemática · História · IA