Aus dem Englischen übersetzt

Eine Fähigkeit, die es einem KI-Modell ermöglicht, direkt eine standardmäßige grafische Computerschnittstelle zu bedienen, indem es Screenshots betrachtet und Maus- und Tastaturaktionen ausführt, anstatt nur über dedizierte APIs zu interagieren.

Computer use ist eine Fähigkeit, die es einem großen Sprachmodell ermöglicht, eine standardmäßige grafische Computerschnittstelle direkt zu bedienen, indem es Bildschirminhalte betrachtet und Maus- sowie Tastaturaktionen ausführt, anstatt nur über speziell dafür geschriebene APIs mit Software zu interagieren. Während gewöhnliches Tool-Use erfordert, dass ein Entwickler jede Fähigkeit als diskreten Funktionsaufruf bereitstellt, erlaubt Computer use einem Modell, auf jede Software mit visueller Schnittstelle zu wirken - einschließlich Websites, Desktop-Anwendungen und Betriebssystemsteuerungen - auf dieselbe Weise wie ein menschlicher Benutzer, indem es auf den Bildschirm schaut und als Reaktion klickt, tippt oder scrollt.

Anthropic führte die Technik im Oktober 2024 öffentlich als Funktion seiner Claude-Modelle ein und beschrieb sie als Möglichkeit für das Modell, Screenshots aufzunehmen, einen Cursor zu bewegen, Schaltflächen zu klicken und Text in einer kontrollierten virtuellen Umgebung einzugeben. Die Fähigkeit hängt davon ab, dass das Modell Bilder eines Bildschirms interpretieren und dieses Verständnis in koordinatenbasierte Aktionen übersetzen kann, was sie zu einer natürlichen Erweiterung der multimodalen KI- und Vision-Language-Modell-Fähigkeiten machte, anstatt eine rein textbasierte Technik zu sein. Andere Labore, darunter Google DeepMind und OpenAI, veröffentlichten im Laufe von 2024 und 2025 vergleichbare Browser- und Computer-Betriebsagenten-Funktionen, als sich der Ansatz als etablierte Kategorie innerhalb der breiteren Agentenwelle etablierte.

Funktionsweise

Eine Computer-use-Schleife folgt typischerweise einem Wahrnehmen-Entscheiden-Handeln-Zyklus: Dem Modell wird ein Screenshot des aktuellen Bildschirmzustands zusammen mit dem übergeordneten Ziel des Benutzers gegeben, es entscheidet sich für eine einzelne nächste Aktion, wie das Klicken auf eine bestimmte Koordinate, das Tippen einer Zeichenfolge oder das Drücken einer Taste, diese Aktion wird in der Umgebung ausgeführt, und ein neuer Screenshot wird aufgenommen und an das Kontextfenster des Modells für die nächste Entscheidung zurückgegeben. Dieser Zyklus wiederholt sich, bis das Modell feststellt, dass die Aufgabe abgeschlossen ist oder ein Limit erreicht wird. Da es über dieselbe visuelle und Eingabeoberfläche funktioniert, die ein Mensch verwendet, erfordert Computer use überhaupt keine API von einer Anwendung, was es ermöglicht, mit Altsystemen, internen Unternehmenswerkzeugen und Websites ohne öffentliche Integration zu arbeiten.

Anwendungen

Computer use wurde angewendet für Browser-Automatisierung bei Forschung und Dateneingabe, zum Testen von Software durch Simulation der Klicks und Eingaben eines echten Benutzers sowie zur Automatisierung repetitiver Büroaufgaben wie dem Ausfüllen von Formularen über Systeme hinweg, die nie für Skripting ausgelegt waren. Es wird oft als Erweiterung der breiteren KI-Agenten-Kategorie in Umgebungen jenseits eines definierten Werkzeugsatzes diskutiert und kann innerhalb desselben Agenten mit konventionellerem Tool-Calling kombiniert werden, manchmal über eine gemeinsame Schnittstelle wie das Model-Context-Protokoll verdrahtet, wobei eine dedizierte API aufgerufen wird, wenn eine existiert, und auf direkte Schnittstellensteuerung zurückgegriffen wird, wenn nicht.

Einschränkungen und Risiken

Frühe Computer-use-Systeme waren merklich langsamer und weniger zuverlässig als API-basiertes Tool-Use, da jede Aktion eine vollständige Hin- und Rückreise durch Bildinterpretation erfordert, bevor der nächste Schritt unternommen werden kann, und Modelle konnten falsch klicken, kleinen Text falsch lesen oder durch ungewohnte Schnittstellenlayouts verwirrt werden. Anthropic und andere Labore beschrieben die Fähigkeit beim Start als experimentell und empfahlen, sie in Sandbox-Umgebungen auszuführen, angesichts des Risikos unbeabsichtigter Aktionen. Die Sicherheitsimplikationen sind auch schwerwiegender als bei engem Tool-Use, da ein Modell, das eine vollständige Computerschnittstelle bedient, prinzipiell dieselbe Bandbreite möglicher Aktionen hat wie ein menschlicher Benutzer, einschließlich Aktionen mit finanziellen, sicherheitsrelevanten oder irreversiblen Konsequenzen, was ein Grund dafür ist, dass Computer-use-Agenten als erhöhtes Ziel für Prompt-Injection-Angriffe gelten und typischerweise mit Schutzmaßnahmen, menschlicher Aufsicht und eingeschränkten Ausführungsumgebungen bereitgestellt werden. Stand 2025 blieb Computer use eine sich schnell bewegende, aber noch reifende Kategorie, wobei Genauigkeit und Zuverlässigkeit über aufeinanderfolgende Modellgenerationen hinweg erheblich verbessert wurden, aber für Aufgaben, bei denen eine dedizierte API existiert, immer noch hinter zweckgebundenen API-Integrationen zurückblieben.

Kategorien:agentic-ai·automation·multimodal-ai
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte