Agent Lightning : Entraînement RL découplé pour les agents
De Wikiprompt, l’encyclopédie libre de prompts
Agent Lightning : Entraînement RL découplé pour les agents Explique le framework open-source Agent Lightning de Microsoft, qui découple le runtime des agents de la boucle d'entraînement par renforcement via un store partagé et des spans, permettant un entraînement flexible des agents en production.
Contenu du PromptEnregistrer
🌐
Agent Lightning est un framework open source qui découple votre runtime d'agent de la boucle d'entraînement. L'idée centrale : votre agent et l'entraîneur ne se touchent jamais. L'agent fonctionne comme il fonctionne déjà (LangChain, AutoGen, CrewAI, OpenAI SDK, ou Python pur) et émet des spans au fur et à mesure. L'entraîneur se trouve de l'autre côté d'un store partagé et lit ces spans. Aucun côté n'importe l'autre. Cela compte car transformer un agent existant en quelque chose que vous pouvez entraîner par RL signifie généralement le réécrire autour du modèle de données de l'entraîneur, ou construire l'agent dans le framework de l'entraîneur dès le premier jour. Ici, le runtime reste en place et la boucle d'entraînement est boulonnée de l'extérieur.
Mécanique :
→ chaque prompt, appel d'outil et récompense est capturé comme un span structuré, soit via un helper emit_xxx que vous insérez, soit via un traceur qui les récupère automatiquement.
→ les spans circulent dans un LightningStore central qui contient les tâches, les ressources et les traces. Le runner d'agent et l'algorithme lisent et écrivent ici, et c'est le seul contrat entre eux.
→ le slot d'algorithme est enfichable. L'apprentissage par renforcement, l'optimisation automatique de prompts et le fine-tuning supervisé s'adaptent tous à la même interface, et cela peut être un algorithme que vous avez écrit vous-même.
→ dans un système multi-agents, vous pouvez pointer l'entraîneur vers un agent spécifique et laisser le reste intact. Les autres continuent de fonctionner et d'émettre des spans, mais seul celui sélectionné reçoit des poids ou des prompts mis à jour.
Ce dernier point est ce que j'utiliserais en pratique. La plupart des travaux RL sur agents supposent que vous avez un modèle à entraîner. Les systèmes réels ont un planificateur, quelques spécialistes, un critique, et vous ne voulez déplacer les poids que sur celui qui est réellement le goulot d'étranglement. Pouvoir isoler cela sans démonter tout le graphe est la différence entre une démo de recherche et quelque chose qui tourne en production.
Presque tous les frameworks d'agents lancés en 2025 étaient runtime-first. Celui-ci est training-first et traite le framework dans lequel vous avez construit votre agent comme un détail d'implémentation plutôt qu'une exigence.
Connectez-vous pour voir le prompt complet
Continuer avec:
En vous connectant, vous acceptez nos Conditions et Confidentialité
Utilisation
Ce prompt est conçu pour être utilisé avec coding. Copiez le contenu ci-dessus et collez-le dans votre outil d’IA préféré.
Pour de meilleurs résultats, personnalisez les espaces réservés (indiqués par des crochets ou des majuscules) selon vos besoins.
Références
- Catégorie: Prompts coding
- Source: https://x.com/thisdudelikesAI/status/2088544035023863867
Discussion
0 commentaires