Cadena de pensamiento

Traducido del inglés

La cadena de pensamiento es una técnica de indicación en la que se pide a un modelo que produzca pasos de razonamiento intermedios antes de dar una respuesta final, lo que mejora la precisión en problemas de múltiples pasos y subyace a los modelos de razonamiento posteriores.

La cadena de pensamiento es una técnica de indicación en la que se pide, o se anima, a un modelo de lenguaje a producir una secuencia de pasos de razonamiento intermedios antes de dar una respuesta final, en lugar de saltar directamente a una conclusión. La técnica mejora la precisión en tareas que requieren múltiples pasos de aritmética, lógica o razonamiento de sentido común, y se convirtió en una de las ideas más influyentes en la ingeniería de indicaciones después de ser descrita formalmente en 2022.

Orígenes

El término se introdujo en un artículo de enero de 2022, "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models", de Jason Wei y sus coautores en Google. El artículo mostró que incluir un pequeño número de ejemplos resueltos en una indicación, cada uno con los pasos de razonamiento escritos en lugar de solo la respuesta final, mejoraba drásticamente el rendimiento de un modelo en problemas de matemáticas con enunciados y otras tareas de varios pasos, una forma de aprendizaje de pocas ejemplos aplicada a través de la propia indicación. Es crucial destacar que el artículo informó que este beneficio solo aparecía en modelos suficientemente grandes, vinculando la cadena de pensamiento estrechamente con la discusión sobre las habilidades emergentes y las leyes de escalado.

Cadena de pensamiento de cero disparo

Más tarde, en 2022, un artículo separado de Takeshi Kojima y sus coautores descubrió que una indicación mucho más simple, añadir la frase "pensemos paso a paso" a una pregunta sin ningún ejemplo resuelto, producía una mejora similar en la precisión del razonamiento en muchas tareas. Este resultado, conocido como cadena de pensamiento de cero disparo, mostró que el beneficio no requería estrictamente ejemplos de pocas tomas; simplemente instruir al modelo para que razonara antes de responder era a menudo suficiente para desbloquear un mejor rendimiento, un ejemplo de comportamiento de cero disparo que se basa en las capacidades que el modelo ya tenía del preentrenamiento.

Mecanismo y autocoherencia

Los investigadores han ofrecido varias explicaciones de por qué la cadena de pensamiento ayuda, incluyendo que le da al modelo más pasos computacionales con los que trabajar antes de comprometerse con una respuesta, que permite al modelo usar su propio razonamiento anterior como contexto adicional a través del aprendizaje en contexto, y que reduce la probabilidad de que un error se acumule silenciosamente dentro de una sola pasada hacia adelante. Una técnica relacionada llamada autocoherencia genera múltiples cadenas de razonamiento independientes para la misma pregunta y toma la respuesta final más común entre ellas, mejorando aún más la precisión a costa de un cálculo adicional.

De técnica de indicación a comportamiento entrenado

La cadena de pensamiento comenzó como una estrategia de indicación aplicada a modelos que no estaban específicamente entrenados para razonar paso a paso, pero se volvió fundamental para una nueva clase de sistemas. A partir de OpenAI o1 en 2024, los laboratorios comenzaron a entrenar modelos con aprendizaje por refuerzo específicamente para producir cadenas de razonamiento largas y efectivas antes de responder, en lugar de depender de que el usuario solicite ese comportamiento a través de indicaciones. Este cambio dio lugar a la categoría de los modelos de razonamiento, incluido DeepSeek-R1, y reformuló la cadena de pensamiento de un truco de indicación opcional a un proceso interno entrenado y, a menudo, oculto, con la cantidad de razonamiento que realiza un modelo convirtiéndose en una nueva palanca, llamada cómputo en tiempo de prueba, para mejorar la precisión a costa de un tiempo de inferencia adicional.

Categorías:prompt-engineering·large-language-models·reasoning
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial