El scaffolding de agentes es la estructura de indicaciones y flujo de trabajo construida alrededor de un modelo para que actúe como un agente confiable. En Artificial intelligence, un agente es un sistema que percibe su entorno, toma decisiones y realiza acciones para alcanzar objetivos. Un Large language model crudo genera texto; el scaffolding transforma esa capacidad de generación de texto en un bucle de observación, razonamiento y acción. Esta estructura típicamente incluye una indicación de sistema, un conjunto de herramientas disponibles, un mecanismo de memoria y un flujo de control que determina cuándo el modelo debe llamar a una herramienta en lugar de responder directamente.
El término ganó prominencia a mediados de la década de 2020 cuando los desarrolladores se dieron cuenta de que simplemente indicar a un modelo que "realice una tarea" era insuficiente para operaciones complejas de múltiples pasos. El scaffolding proporciona las salvaguardas necesarias, la gestión de estado y el manejo de errores. Es la diferencia entre un chatbot que responde preguntas y un agente que reserva un vuelo, escribe código o gestiona un proyecto de investigación. El concepto está estrechamente relacionado con Generative AI y Machine learning, pero se centra en la capa de ingeniería alrededor del modelo en lugar de los parámetros internos del modelo.
Contexto Histórico
La idea de construir flujos de trabajo estructurados alrededor de sistemas de IA precede al Deep learning moderno. Los primeros sistemas expertos en las décadas de 1970 y 1980 utilizaban scaffolding basado en reglas para codificar conocimiento de dominio. Sin embargo, la interpretación moderna del scaffolding surgió con el auge de los modelos basados en Transformer (architecture). En 2017, investigadores de Google DeepMind y University of Toronto demostraron que los mecanismos de atención podían manejar dependencias de largo alcance, habilitando un razonamiento más complejo. Para 2020, el GPT-3 de OpenAI mostró que los modelos grandes podían seguir instrucciones, pero carecían de la capacidad de interactuar con sistemas externos.
El punto de inflexión llegó con la introducción del uso de herramientas. En 2021, OpenAI lanzó Codex, que podía ejecutar código en un entorno aislado. Esta fue una forma temprana de scaffolding: el modelo generaba código, el scaffold lo ejecutaba y la salida se retroalimentaba al modelo. En 2022, Anthropic introdujo Claude con un enfoque de IA constitucional, y para 2023, tanto OpenAI como Anthropic habían lanzado funciones de API para llamadas a funciones. Estas APIs permitían a los desarrolladores definir herramientas que el modelo podía invocar, formalizando el patrón de scaffolding.
Componentes Principales
Un scaffold de agente típico consiste en varias partes interconectadas. La indicación de sistema establece la persona, los objetivos y las restricciones del agente. Es la forma más directa de scaffolding, a menudo conteniendo instrucciones detalladas sobre cómo comportarse, qué herramientas están disponibles y cómo formatear las respuestas. La capa de herramientas proporciona al modelo capacidades externas: búsqueda web, ejecución de código, consultas a bases de datos, manipulación de archivos o llamadas a APIs. Cada herramienta se describe al modelo en un formato estructurado, usualmente con un nombre, una descripción y un esquema de parámetros.
La memoria es otro componente crítico. Dado que los Large language model tienen una ventana de contexto fija, el scaffolding debe gestionar qué información se retiene. La memoria a corto plazo mantiene el historial reciente de la conversación, mientras que la memoria a largo plazo podría usar una base de datos vectorial para almacenar incrustaciones de interacciones pasadas. Esto permite al agente recordar hechos a través de sesiones. El flujo de control determina el bucle: el modelo recibe entrada, decide si llamar a una herramienta o producir una respuesta final, y el scaffold ejecuta la herramienta y devuelve el resultado. Este bucle continúa hasta que el modelo señala la finalización.
Uso de Herramientas y Llamadas a Funciones
El uso de herramientas es el aspecto más visible del scaffolding. En 2023, OpenAI introdujo llamadas a funciones en su API, permitiendo a los modelos generar JSON estructurado que especifica una llamada a herramienta. Anthropic siguió con una característica similar. Estas APIs facilitaron a los desarrolladores construir agentes que pudieran consultar bases de datos, enviar correos electrónicos o controlar software. El scaffold maneja la ejecución real, valida la salida de la herramienta y la pasa de vuelta al modelo.
Por ejemplo, un agente de soporte al cliente podría tener herramientas para buscar pedidos, procesar reembolsos y escalar problemas. El modelo decide qué herramienta llamar basándose en la consulta del usuario. El scaffold asegura que la llamada a la herramienta sea segura, que la salida esté dentro de los límites esperados y que el modelo no entre en un bucle indefinido. Este patrón es ahora estándar en marcos de agentes como LangChain, AutoGPT y Semantic Kernel de Microsoft, aunque el concepto de scaffolding es independiente del marco.
Memoria y Gestión de Estado
La memoria es un diferenciador clave entre chatbots simples y agentes confiables. Un scaffold puede implementar varios tipos de memoria. La memoria episódica almacena interacciones pasadas, permitiendo al agente aprender de tareas anteriores. La memoria semántica contiene hechos y conocimiento, a menudo en una base de datos vectorial. La memoria procedimental codifica cómo realizar ciertas tareas, posiblemente a través de ejemplos de pocas muestras en la indicación.
La gestión de estado también es crucial. Un agente que realiza una tarea de múltiples pasos necesita rastrear el progreso, los resultados intermedios y las acciones pendientes. El scaffold podría mantener una máquina de estados que defina transiciones válidas. Por ejemplo, un agente de investigación podría tener estados como "buscando", "leyendo", "resumiendo" y "reportando". El scaffold asegura que el agente no omita pasos ni repita acciones innecesariamente. Esto es especialmente importante en sistemas de producción donde la fiabilidad es primordial.
Planificación y Razonamiento
El scaffolding a menudo incluye mecanismos de planificación explícitos. En lugar de dejar que el modelo decida acciones de manera puramente reactiva, el scaffold puede indicar al modelo que cree un plan primero. Esto a veces se llama "planificar y ejecutar". El modelo genera una lista de pasos, y el scaffold los ejecuta secuencialmente, marcando cada paso. Esto reduce el riesgo de que el modelo se atasque o tome decisiones inconsistentes.
Técnicas de razonamiento como la indicación de cadena de pensamiento también son parte del scaffolding. Al pedir al modelo que "piense paso a paso", el scaffold fomenta un razonamiento más preciso. Algunos scaffolds usan un patrón de "reflexión", donde el modelo revisa su propia salida y corrige errores. Estas técnicas no son nuevas; son extensiones de conceptos de Curriculum Learning y Loss Functions de la investigación temprana en IA, pero aplicadas a nivel de inferencia.
Fiabilidad y Seguridad
Uno de los objetivos principales del scaffolding es hacer que los agentes sean confiables. Un modelo crudo podría alucinar, ignorar instrucciones o producir salidas inseguras. El scaffold añade salvaguardas: validación de entrada, filtrado de salida, limitación de tasa y puntos de control con intervención humana. Para aplicaciones de alto riesgo como atención médica o finanzas, el scaffold podría requerir aprobación antes de ejecutar ciertas acciones.
La seguridad también es una preocupación. El scaffold puede restringir las herramientas disponibles para el modelo, evitando que acceda a datos sensibles o realice operaciones destructivas. También puede monitorear el comportamiento del modelo en busca de señales de inyección de indicaciones u otros ataques. A medida que los agentes se vuelven más autónomos, el scaffold se convierte en la primera línea de defensa contra consecuencias no intencionadas.
Marcos y Implementaciones
Varios marcos de código abierto y comerciales han surgido para ayudar a los desarrolladores a construir scaffolds. LangChain, lanzado en octubre de 2022 por Harrison Chase, popularizó el concepto de cadenas y agentes. AutoGPT, lanzado en marzo de 2023, demostró un agente completamente autónomo que podía descomponer un objetivo en subtareas. AutoGen de Microsoft, lanzado en 2023, introdujo conversaciones multiagente donde múltiples modelos colaboran.
En 2024, OpenAI y Anthropic lanzaron herramientas para construir agentes. La API de Asistentes de OpenAI proporcionó un scaffold alojado con herramientas, memoria y recuperación. Claude Code de Anthropic, lanzado en 2025, ofreció una interfaz de línea de comandos para agentes de codificación. Estos productos abstraen gran parte de la complejidad, pero los principios subyacentes siguen siendo los mismos. La elección del marco a menudo depende del caso de uso específico, los requisitos de latencia y la necesidad de personalización.
Desafíos y Limitaciones
A pesar de los avances, el scaffolding enfrenta varios desafíos. Los límites de la ventana de contexto siguen siendo un cuello de botella; incluso con contextos grandes, las tareas complejas pueden exceder la capacidad del modelo. La latencia es otro problema: cada llamada a herramienta añade tiempo de ida y vuelta, haciendo que los agentes sean más lentos que las respuestas directas. El costo escala con el número de tokens procesados, por lo que los scaffolds verbosos pueden ser caros. La propagación de errores es una preocupación: un solo error en un paso temprano puede tener un efecto en cascada, llevando a resultados finales incorrectos.
Otro desafío es la evaluación. ¿Cómo se mide la fiabilidad de un agente? Las métricas tradicionales como la precisión en benchmarks son insuficientes. Los investigadores han propuesto nuevos benchmarks como AgentBench y SWE-bench, pero aún no están estandarizados. El campo es todavía joven y las mejores prácticas están evolucionando.
Direcciones Futuras
El futuro del scaffolding de agentes probablemente involucra sistemas de memoria más sofisticados, mejores algoritmos de planificación y una integración más estrecha con el propio modelo. Algunos investigadores están explorando scaffolds aprendidos, donde el flujo de control se optimiza mediante aprendizaje por refuerzo en lugar de estar codificado a mano. Otros están investigando sistemas multiagente, donde múltiples modelos con diferentes especializaciones colaboran bajo un scaffold central.
A medida que los modelos se vuelven más capaces, el scaffold podría simplificarse, pero no desaparecerá. Incluso un modelo perfecto necesita una forma de interactuar con el mundo. El scaffold es el puente entre las representaciones internas del modelo y la realidad externa. En ese sentido, es una parte fundamental de cualquier agente de IA, y su importancia solo crecerá a medida que los agentes se desplieguen en más dominios.
Conclusión
El scaffolding de agentes es la disciplina de ingeniería para construir agentes de IA confiables. Abarca el diseño de indicaciones, la integración de herramientas, la gestión de memoria y el flujo de control. Aunque los modelos subyacentes son potentes, no son autónomos por defecto; el scaffolding proporciona la estructura que convierte un modelo de lenguaje en un agente útil. A medida que el campo madura, podemos esperar marcos más estandarizados, mejores métodos de evaluación y una comprensión más profunda de cómo diseñar scaffolds que sean tanto efectivos como seguros.