Ein agentischer Harness (oft einfach "der Harness") ist die Softwareumgebung, die ein rohes Sprachmodell in einen funktionierenden Agenten verwandelt: die Schleife, die dem Modell Kontext zuführt, seine Tool-Aufrufe ausführt, Ergebnisse zurückgibt und sich wiederholt, bis eine Aufgabe abgeschlossen ist. Der Begriff wurde 2025-2026 zentral für die KI-Entwicklung, als klar wurde, dass ein großer Teil der realen Fähigkeiten eines Agenten nicht allein vom Modell stammt, sondern von der Qualität des Harness um ihn herum - dasselbe Modell kann mittelmäßig oder außergewöhnlich wirken, je nachdem, in welchem Harness es läuft.
Was ein Harness bietet
- Die Agentenschleife. Das Modell auffordern, seine Aktion parsen, sie ausführen, das Ergebnis zum Kontext hinzufügen, wiederholen. Abbruchbedingungen, Wiederholungsversuche und Fehlerbehandlung leben hier.
- Werkzeuge. Dateibearbeitung, Shell-Ausführung, Browsen, Code-Ausführung, Suche - bereitgestellt durch Funktionsaufrufe oder Protokolle wie das Model Context Protocol.
- Kontextverwaltung. Was das Modell in jeder Runde sieht: System-Prompts, Kontext-Engineering, Zusammenfassung oder Kompaktierung, wenn das Kontextfenster voll wird, und Speicher über Sitzungen hinweg.
- Sub-Agenten und Orchestrierung. Das Erzeugen von Sub-Agenten für parallele oder spezialisierte Arbeit und das Zusammenführen ihrer Ergebnisse - die Grundlage für Multi-Agenten-Systeme und Muster wie die Gauntlet-Schleife.
- Sicherheitsvorkehrungen. Berechtigungen, Sandboxing, Genehmigungsstufen durch Menschen und Audit-Protokolle; der OpenAI-Hugging Face-Vorfall von 2026 (siehe 2026 OpenAI agent cyberattacks) machte die Isolierung auf Harness-Ebene zu einem Sicherheitsthema erster Ordnung.
Beispiele
Code-Harnesses sind die sichtbarsten: Claude Code, OpenAIs Codex CLI, Cursors Agentenmodus und Open-Source-Projekte wie OpenHands und Aider. Evaluierungs-Harnesses (die Gerüste, die zum Ausführen von Benchmarks wie SWE-bench verwendet werden) sind dieselbe Idee, angewendet auf Messung, weshalb Benchmark-Ergebnisse oft als "mit Harness X" berichtet werden: Die Ergebnisse variieren mit dem Harness, nicht nur mit dem Modell.
Warum der Begriff wichtig ist
"Harness" trennt zwei Ebenen, die früher vermischt wurden: Modellfähigkeit (Gewichte) und Agentenfähigkeit (Gewichte + Umgebung). Modellankündigungen zitieren zunehmend harness-abhängige Ergebnisse, Prompt-Muster werden FÜR einen Harness geschrieben (die Gauntlet-Schleife erfordert explizit einen), und Labore stimmen Modelle auf ihre eigenen Harnesses ab - Anthropics Claude-Modelle und Claude Code sind die kanonische Paarung. Der verwandte Begriff Agenten-Gerüst (Agent Scaffolding) wird manchmal austauschbar verwendet, obwohl sich Gerüst meist auf die Prompt- und Workflow-Struktur bezieht, während Harness die vollständige Laufzeitumgebung meint.