Pular para o conteúdo principal

Canto de Sabiá · Engenharia de prompts

A Arte de Sussurrar para as Máquinas e Desbloquear o Futuro da IA

Cinco técnicas que fazem a inteligência artificial generativa raciocinar, planejar, agir e colaborar: Chain of Thought, Tree of Thought, ReAct, DERA e RAG, cada uma conferida no artigo científico que a criou. Leia como funcionam e depois experimente todas no laboratório, com problemas de matemática.

CoT · ToT · ReAct · DERA · RAG 12 min de leitura PT · EN · ES

IntroduçãoO prompt como portal

A inteligência artificial generativa (IAG) não é mais uma promessa distante: é uma força que redefine os limites da criatividade e da inovação. No coração dessa revolução está o prompt, o texto que abre a porta para o potencial de modelos como Claude, Gemini e ChatGPT. Dominar a arte de escrever bons prompts é a chave para obter textos que ressoam, imagens que inspiram e respostas que iluminam.

Por trás desses modelos está a arquitetura Transformer (Vaswani et al., 2017). E, desde o GPT-3, sabemos que um modelo grande consegue realizar uma tarefa nova apenas com instruções e alguns exemplos escritos no próprio prompt, sem nenhum treinamento extra: é o chamado aprendizado em contexto, ou few-shot (Brown et al., 2020). É por isso que a forma de escrever o prompt muda tanto o resultado.

A engenharia de prompts une ciência e arte. Ela vai além de formular perguntas: é um diálogo estratégico com a máquina, que a guia por um labirinto de possibilidades até um objetivo específico.

Este artigo apresenta cinco técnicas, cada uma conferida no artigo científico que a criou: Chain of Thought, Tree of Thought, ReAct, DERA e RAG. Cada uma tem uma aba no laboratório desta página, para você experimentar com problemas de matemática.

Técnica 1 · CoTChain of Thought: o raciocínio passo a passo

Imagine um mestre ensinando um aprendiz. Em vez de revelar só a resposta, ele percorre cada etapa e mostra a lógica por trás da solução. Essa é a essência da Cadeia de Pensamento: uma série de passos intermediários de raciocínio, escritos antes da resposta final (Wei et al., 2022).

A ideia conversa com a sala de aula. Em 1994, Chi e colegas pediram a estudantes do 8º ano que explicassem para si mesmos cada linha de um texto sobre o sistema circulatório; quem mais se autoexplicou aprendeu com mais compreensão (Chi et al., 1994). A CoT pede ao modelo o mesmo hábito.

Como funciona

Há dois jeitos de pedir. No artigo original, o prompt traz alguns exemplos já resolvidos passo a passo (few-shot), e o modelo imita esse formato na pergunta nova. Depois, Kojima et al. (2022) mostraram que muitas vezes basta acrescentar uma frase: “Vamos pensar passo a passo” (zero-shot).

P: Rogério tem 5 bolas de tênis. Ele compra mais 2 latas, cada uma com 3 bolas. Quantas bolas ele tem agora? R: Rogério começou com 5 bolas. 2 latas de 3 bolas são 6 bolas. 5 + 6 = 11. A resposta é 11. P: A cantina tinha 23 maçãs. Usou 20 no almoço e comprou mais 6. Quantas maçãs tem agora? R:
P: Um malabarista tem 16 bolas. Metade são bolas de golfe, e metade das bolas de golfe são azuis. Quantas bolas de golfe azuis existem? R: Vamos pensar passo a passo.

Para que serve

Nos testes originais, a CoT melhorou o desempenho em aritmética, senso comum e raciocínio simbólico. Com apenas oito exemplos resolvidos, um modelo de 540 bilhões de parâmetros alcançou o melhor resultado da época no GSM8K, uma coleção de problemas de matemática do ensino básico. Já a frase de Kojima elevou o acerto do modelo InstructGPT de 17,7% para 78,7% no MultiArith.

Dois cuidados. O ganho aparece em modelos grandes, a partir de cerca de 100 bilhões de parâmetros; os pequenos escrevem passos fluentes, mas ilógicos. E a cadeia é uma janela para o raciocínio: se a resposta estiver errada, dá para achar o passo exato do erro.

Técnica 2 · ToTTree of Thought: várias linhas de raciocínio

A Árvore de Pensamento leva a CoT a um novo patamar. Em vez de seguir um único caminho, o modelo ramifica o raciocínio, como um explorador que mapeia um território desconhecido: propõe soluções parciais, avalia cada ramo e decide qual seguir, abandonando os que não levam a lugar nenhum (Yao et al., 2023b).

Como funciona

O prompt pede várias continuações possíveis, uma avaliação de cada uma e a continuação apenas das promissoras. Na versão original, o próprio modelo julga cada ramo como “certo”, “talvez” ou “impossível” e volta atrás quando um caminho não leva a nada.

Use os números 4, 9, 10 e 13, cada um uma vez, com + − × ÷, para chegar a 24. Proponha três primeiros passos. Para cada um, avalie se ainda é possível chegar a 24: certo, talvez ou impossível. Continue apenas pelos promissores e, se travar, volte e tente outro.
Gere três esboços diferentes para um conto sobre um detetive em uma cidade futurista. Avalie cada esboço quanto à originalidade, à coerência e ao potencial para envolver o leitor. Escolha o melhor e desenvolva-o em um conto completo.

Da árvore ao grafo

Besta et al. (2024) deram mais um passo com o Graph of Thoughts: os pensamentos viram vértices de um grafo e podem ser combinados, e não só ramificados. Para ordenar uma lista longa, por exemplo, o modelo ordena pedaços separados e depois junta os pedaços ordenados, como no merge sort. Na tarefa de ordenação, isso aumentou a qualidade em 62% em relação à ToT, com custo mais de 31% menor.

Para que serve

Quebra-cabeças, planejamento, redação e qualquer problema em que o primeiro caminho nem sempre é o certo. No laboratório, você joga o Jogo do 24, um dos testes do artigo original da ToT.

Técnica 3 · ReActReAct: raciocinar e agir, alternando

A CoT raciocina apenas com o que o modelo já sabe, e por isso pode inventar um fato no meio do caminho e carregar o erro até o fim. A ReAct (de Reasoning + Acting) junta pensar e agir: o modelo alterna um Pensamento, uma Ação (consultar uma fonte ou usar uma ferramenta) e a Observação que volta dessa ação, e só então pensa de novo (Yao et al., 2023a). É como um navegador experiente que ajusta as velas a cada mudança do vento: o plano é atualizado a cada nova informação.

Como funciona

No artigo original, o modelo consultava a Wikipédia com três ações: buscar[entidade], que traz as primeiras frases da página; procurar[termo], que encontra a próxima frase com aquele termo, como um Ctrl+F; e finalizar[resposta].

Planeje uma viagem de três dias para [cidade]. Trabalhe em ciclos: escreva um Pensamento, faça uma Ação (buscar[…]) e leia a Observação antes do próximo passo. Se algo mudar, como um museu fechado ou previsão de chuva, ajuste o plano. Termine com finalizar[roteiro].

Para que serve

Consultando fontes, a ReAct reduziu a alucinação e a propagação de erros da CoT em perguntas que exigem combinar vários fatos (HotpotQA) e em checagem de fatos (FEVER). Em tarefas interativas, como agir numa casa simulada (ALFWorld) e comprar numa loja virtual (WebShop), superou métodos de imitação e de aprendizado por reforço em 34 e 10 pontos percentuais, com apenas um ou dois exemplos no prompt. E a trajetória fica legível: dá para ver por que o modelo fez cada coisa.

Uma variante: ReWOO

Alternar tem um custo: o modelo é chamado de novo depois de cada observação. A ReWOO (Reasoning WithOut Observation) separa as fases: escreve o plano inteiro primeiro, com lacunas (#E1, #E2…) para os resultados, deixa as ferramentas trabalharem e só no fim junta tudo. Num teste de perguntas com várias etapas, gastou cerca de cinco vezes menos tokens (Xu et al., 2023). O preço: se uma busca falhar, o plano não se corrige sozinho. No laboratório, você compara as duas.

Técnica 4 · DERADERA: resolver problemas pelo diálogo

Em muitos cenários, a solução está na colaboração. A DERA (Dialog-Enabled Resolving Agents) organiza um diálogo entre dois agentes (Nair et al., 2023). O Decisor escreve a primeira versão e tem a palavra final. O Pesquisador lê essa versão, procura o que falta ou está errado e aponta as discrepâncias. Nenhum dos dois conhece a resposta ideal: a qualidade nasce da conversa.

Como funciona

A cada observação do Pesquisador, o Decisor aceita ou recusa, sempre com um motivo; ele nunca é obrigado a concordar. As sugestões aceitas vão para um bloco de anotações compartilhado. A conversa termina quando o Pesquisador fica satisfeito (ou num limite de turnos; no artigo, 15), e o Decisor reescreve a resposta usando as anotações.

Você é o Decisor. Resolva o problema e mostre a solução. Depois, leia cada observação do Pesquisador e responda “aceito” ou “recuso”, sempre com um motivo. Anote as sugestões aceitas e, no fim, reescreva a solução com base nelas.
Você é o Pesquisador. Leia o enunciado e a solução do Decisor. Aponte, uma por vez, as discrepâncias entre a solução e o enunciado. Não reescreva a solução. Quando não houver mais nada a apontar, diga que está satisfeito.

Para que serve

O artigo testou a DERA na saúde: resumos de consultas médicas, planos de cuidado e perguntas de medicina. Nos resumos, médicos preferiram a versão final da DERA em 90% dos casos. A mesma ideia aparece em técnicas parentes. Na Self-Refine, um único modelo gera, critica a própria resposta e a reescreve, em ciclos (Madaan et al., 2023). Na Chain-of-Verification, o modelo rascunha, planeja perguntas de verificação, responde a cada uma separadamente e só então escreve a versão final (Dhuliawala et al., 2023). No laboratório, a dupla corrige uma conta de geometria.

Técnica 5 · RAGRAG: buscar antes de responder

Um modelo de linguagem guarda o que aprendeu nos próprios parâmetros, a sua memória paramétrica. Mas não sabe dizer de onde tirou cada fato e fica desatualizado quando o mundo muda. A Geração Aumentada por Recuperação junta a essa memória uma memória não paramétrica: um índice de documentos que pode ser consultado na hora (Lewis et al., 2020).

Como funciona

No artigo original, um recuperador transforma a pergunta e cada documento em vetores e busca os mais próximos num índice de 21 milhões de trechos da Wikipédia, com cerca de 100 palavras cada. Os melhores trechos são concatenados à pergunta, e um gerador escreve a resposta. Hoje, a mesma ideia é aplicada direto no prompt: buscar, colar os trechos e pedir a resposta com base neles.

Responda usando apenas os trechos abaixo, do livro adotado pela turma, e indique a página. Trechos: [1] “O volume do cone é um terço do produto da área da base pela altura: V = (1/3)·π·r²·h.” (p. 212) Pergunta: Qual é a fórmula do volume do cone?

Para que serve

Nos testes originais, as respostas com RAG saíram mais específicas, variadas e corretas do que as de um modelo só com memória paramétrica. E há uma vantagem prática: para atualizar o conhecimento, basta trocar o índice, sem treinar o modelo de novo. Os autores perguntaram quem ocupava cargos de líderes mundiais: com o índice da Wikipédia de 2018, o modelo acertou 68% dos líderes de 2018; com o índice antigo, de 2016, só 4%. Serve para pesquisa, jornalismo, atendimento e educação personalizada.

Considerações finaisUma arte em evolução

Nesta jornada, vimos como CoT, ToT, ReAct e DERA permitem que os modelos de IAG vão além da geração de texto e passem a raciocinar, planejar, agir, colaborar e resolver problemas complexos, e como a RAG amplia o que eles sabem com informações de fontes externas.

A engenharia de prompts não é uma ciência exata, mas uma arte em constante evolução. À medida que os modelos se tornam mais sofisticados, novas técnicas vão surgir e desafiar o que hoje parece certo.

O futuro da engenharia de prompts está na colaboração: profissionais de tecnologia, pesquisadores, linguistas, psicólogos, filósofos, artistas e professores precisam unir forças para explorar as dimensões éticas, sociais e criativas da IAG e garantir que ela seja usada de forma responsável e benéfica para a humanidade.

AVM · Artefato Virtual Manipulável

Laboratório de prompts

Cinco técnicas, cinco experimentos com matemática. Nada aqui chama uma IA de verdade: cada aba mostra, de forma controlada, o que a técnica faz por dentro.

Para ir mais fundo

Referências

  1. BESTA, Maciej et al. Graph of Thoughts: Solving Elaborate Problems with Large Language Models. In: AAAI Conference on Artificial Intelligence, 38., 2024. Disponível em: arxiv.org/abs/2308.09687.
  2. BROWN, Tom B. et al. Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems, 2020. Disponível em: arxiv.org/abs/2005.14165.
  3. CHI, Michelene T. H.; DE LEEUW, Nicholas; CHIU, Mei-Hung; LAVANCHER, Christian. Eliciting Self-Explanations Improves Understanding. Cognitive Science, v. 18, p. 439–477, 1994.
  4. DHULIAWALA, Shehzaad et al. Chain-of-Verification Reduces Hallucination in Large Language Models. 2023. Disponível em: arxiv.org/abs/2309.11495.
  5. KOJIMA, Takeshi et al. Large Language Models are Zero-Shot Reasoners. Advances in Neural Information Processing Systems, 2022. Disponível em: arxiv.org/abs/2205.11916.
  6. LEWIS, Patrick et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems, 2020. Disponível em: arxiv.org/abs/2005.11401.
  7. MADAAN, Aman et al. Self-Refine: Iterative Refinement with Self-Feedback. 2023. Disponível em: arxiv.org/abs/2303.17651.
  8. NAIR, Varun; SCHUMACHER, Elliot; TSO, Geoffrey; KANNAN, Anitha. DERA: Enhancing Large Language Model Completions with Dialog-Enabled Resolving Agents. 2023. Disponível em: arxiv.org/abs/2303.17071.
  9. VASWANI, Ashish et al. Attention Is All You Need. Advances in Neural Information Processing Systems, 2017. Disponível em: arxiv.org/abs/1706.03762.
  10. WEI, Jason et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. Advances in Neural Information Processing Systems, 2022. Disponível em: arxiv.org/abs/2201.11903.
  11. XU, Binfeng et al. ReWOO: Decoupling Reasoning from Observations for Efficient Augmented Language Models. 2023. Disponível em: arxiv.org/abs/2305.18323.
  12. YAO, Shunyu et al. ReAct: Synergizing Reasoning and Acting in Language Models. In: International Conference on Learning Representations (ICLR), 2023a. Disponível em: arxiv.org/abs/2210.03629.
  13. YAO, Shunyu et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. Advances in Neural Information Processing Systems, 2023b. Disponível em: arxiv.org/abs/2305.10601.
Continue no Canto de Sabiá

Agora converse com quem já usa essas técnicas

As AVAMIs, agentes de IA gratuitas da metodologia Do Pí à IA, raciocinam passo a passo e conferem as contas antes de responder. Comece pela Sigma, a porta de entrada para toda a matemática.

Do Pí à IA · Matemática · História · IA