Diskussion

Agent Lightning: Entkoppeltes RL-Training für Agenten

Von Wikiprompt, der freien Prompt-Enzyklopädie

Ryan Hart
Beigetragen vonRyan HartXQuelle

15. Aug. 2026

Agent Lightning: Entkoppeltes RL-Training für Agenten Erklärt Microsofts Open-Source-Framework Agent Lightning, das die Agenten-Laufzeitumgebung vom RL-Trainingszyklus über einen gemeinsamen Speicher und Spans entkoppelt, wodurch flexibles Training von Produktionsagenten ermöglicht wird.

Prompt-InhaltSpeichern

🌐
Agent Lightning ist ein Open-Source-Framework, das Ihre Agenten-Laufzeitumgebung vom Trainingsloop entkoppelt. Die Kernidee: Ihr Agent und der Trainer berühren sich nie gegenseitig. Der Agent läuft so, wie er bereits läuft (LangChain, AutoGen, CrewAI, OpenAI SDK oder einfaches Python) und gibt dabei Spans aus. Der Trainer sitzt auf der anderen Seite eines gemeinsamen Stores und liest diese Spans. Keine Seite importiert die andere. Das ist wichtig, weil die Umwandlung eines bestehenden Agenten in etwas, das Sie RL-trainieren können, normalerweise bedeutet, ihn um das Datenmodell des Trainers herum neu zu schreiben oder den Agenten von Anfang an im Framework des Trainers zu bauen. Hier bleibt die Laufzeit unverändert und der Trainingsloop wird von außen angedockt. Mechanik: → jede Prompt, jeder Tool-Aufruf und jede Belohnung wird als strukturierter Span erfasst, entweder durch einen emit_xxx-Helper, den Sie einfügen, oder durch einen Tracer, der sie automatisch aufnimmt. → Spans fließen in einen zentralen LightningStore, der Aufgaben, Ressourcen und Traces hält. Sowohl der Agenten-Runner als auch der Algorithmus lesen und schreiben hier, und das ist der einzige Vertrag zwischen ihnen. → der Algorithmus-Slot ist pluggbar. Reinforcement Learning, automatische Prompt-Optimierung und überwachtes Feintuning passen alle in dieselbe Schnittstelle, und es kann ein Algorithmus sein, den Sie selbst geschrieben haben. - in einem Multi-Agenten-System können Sie den Trainer auf einen bestimmten Agenten richten und den Rest unberührt lassen. Die anderen laufen weiter und geben weiterhin Spans aus, aber nur der ausgewählte erhält aktualisierte Gewichte oder Prompts zurück. Das letzte ist das, was ich tatsächlich verwenden würde. Die meiste Agenten-RL-Arbeit geht davon aus, dass Sie ein Modell zum Trainieren haben. Echte Systeme haben einen Planer, ein paar Spezialisten, einen Kritiker, und Sie wollen nur die Gewichte auf dem bewegen, der tatsächlich der Engpass ist. In der Lage zu sein, das zu isolieren, ohne das gesamte Diagramm auseinanderzunehmen, ist der Unterschied zwischen einer Forschungsdemo und etwas, das in der Produktion läuft. Fast jedes Agenten-Framework, das 2025 ausgeliefert wird, war laufzeit-zuerst. Dieses ist trainings-zuerst und behandelt, in welchem Framework Sie Ihren Agenten gebaut haben, als Implementierungsdetail und nicht als Anforderung.

Melde dich an, um den vollständigen Prompt zu sehen

Weiter mit:

Mit der Anmeldung akzeptierst du unsere Nutzungsbedingungen und Datenschutz

Verwendung

Dieser Prompt ist für die Verwendung mit coding gedacht. Kopiere den Inhalt oben und füge ihn in dein bevorzugtes KI-Tool ein.

Für beste Ergebnisse passe die Platzhalter (eckige Klammern oder Großbuchstaben) an deine Anforderungen an.

Referenzen

Kategorien:coding| twitter| agent-lightning| reinforcement-learning

Diskussion