Traduzido do inglês

Cadeia-de-pensamento é uma técnica de prompting em que se pede ao modelo para produzir etapas intermediárias de raciocínio antes de dar uma resposta final, o que melhora a precisão em problemas de múltiplas etapas e fundamenta modelos de raciocínio posteriores.

Chain-of-thought é uma técnica de prompt na qual um modelo de linguagem é solicitado, ou incentivado, a produzir uma sequência de etapas intermediárias de raciocínio antes de dar uma resposta final, em vez de pular diretamente para uma conclusão. A técnica melhora a precisão em tarefas que exigem múltiplas etapas de aritmética, lógica ou raciocínio de senso comum, e se tornou uma das ideias mais influentes em engenharia de prompt após ser formalmente descrita em 2022.

Origens

O termo foi introduzido em um artigo de janeiro de 2022, "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models", de Jason Wei e coautores do Google. O artigo mostrou que incluir um pequeno número de exemplos resolvidos em um prompt, cada um com as etapas de raciocínio escritas em vez de apenas a resposta final, melhorava drasticamente o desempenho do modelo em problemas de matemática com enunciado e outras tarefas de múltiplas etapas, uma forma de aprendizado de poucos exemplos aplicada através do próprio prompt. Crucialmente, o artigo relatou que esse benefício só aparecia em modelos suficientemente grandes, ligando o chain-of-thought diretamente à discussão sobre habilidades emergentes e leis de escala.

Chain-of-thought zero-shot

Mais tarde, em 2022, um artigo separado de Takeshi Kojima e coautores descobriu que um prompt muito mais simples, anexar a frase "vamos pensar passo a passo" a uma pergunta sem nenhum exemplo resolvido, produzia uma melhora semelhante na precisão do raciocínio em muitas tarefas. Esse resultado, conhecido como chain-of-thought zero-shot, mostrou que o benefício não exigia estritamente exemplos de poucos disparos; simplesmente instruir o modelo a raciocinar antes de responder muitas vezes era suficiente para desbloquear um melhor desempenho, um caso de comportamento zero-shot que se baseia em capacidades que o modelo já possuía do pré-treinamento.

Mecanismo e autoconsistência

Pesquisadores ofereceram várias explicações para o porquê do chain-of-thought ajudar, incluindo que ele dá ao modelo mais etapas computacionais para trabalhar antes de se comprometer com uma resposta, que permite que o modelo use seu próprio raciocínio anterior como contexto adicional via aprendizado no contexto, e que reduz a chance de um erro se propagar silenciosamente dentro de uma única passagem direta. Uma técnica relacionada chamada autoconsistência gera múltiplas cadeias de raciocínio independentes para a mesma pergunta e considera a resposta final mais comum entre elas, melhorando ainda mais a precisão ao custo de computação adicional.

Da técnica de prompt ao comportamento treinado

O chain-of-thought começou como uma estratégia de prompt aplicada a modelos que não eram especificamente treinados para raciocinar passo a passo, mas se tornou fundamental para uma nova classe de sistemas. Começando com o OpenAI o1 em 2024, os laboratórios começaram a treinar modelos com aprendizado por reforço especificamente para produzir cadeias de raciocínio longas e eficazes antes de responder, em vez de depender de um usuário solicitar esse comportamento através de prompts. Essa mudança deu origem à categoria de modelos de raciocínio, incluindo o DeepSeek-R1, e reformulou o chain-of-thought de um truque opcional de prompt para um processo interno treinado e frequentemente oculto, com a quantidade de raciocínio que um modelo executa se tornando uma nova alavanca, chamada computação em tempo de teste, para melhorar a precisão ao custo de tempo de inferência adicional.

Categorias:prompt-engineering·large-language-models·reasoning
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico