Dieser Beitrag ist eine fachliche Einordnung aus der Praxis und keine Rechtsberatung.

Das Wichtigste in Kürze

  • Computer Use heißt: Ein KI-Agent bekommt Bildschirm, Maus und Tastatur und bedient Programme so, wie ein Mensch es tut.
  • Damit erreicht er Systeme, für die es keine Schnittstelle gibt, etwa Portale von Dienstleistern, alte interne Software und Anbieter-Dashboards.
  • Die Grenzen sind praktisch: Anmeldung mit zweitem Faktor, Kosten je Arbeitsschritt und die Frage, wer eine Freigabe erteilen darf.
  • Für die Beschäftigten verschiebt sich die Arbeit vom Ausführen zum Beauftragen, Begrenzen und Prüfen. Genau das ist eine Kompetenzfrage.

Am 3. September 2026 stellte OpenAI das Modell GPT-6 Astra vor und rückte dabei eine Fähigkeit in den Mittelpunkt, die bis dahin eher als Vorführung galt: die Bedienung von Computer und Browser. Der Fachbegriff dafür lautet Computer Use.

Die Fähigkeit selbst ist nicht neu. Anthropic dokumentiert seit 2024 ein Werkzeug, das dem Modell Bildschirmfotos, Maus und Tastatur gibt, und OpenAI hatte mit Operator eine frühe Fassung im Browser. Neu ist, wie schnell und wie verlässlich die Modelle inzwischen längere Ketten von Schritten durchhalten, ohne nach jedem Klick nachzufragen.

Das ist der eigentliche Unterschied. Eine Automatisierung, die man die ganze Zeit beaufsichtigen muss, spart keine Arbeit. Erst wenn ein Agent zwanzig oder vierzig Schritte am Stück durchhält, ändert sich etwas im Arbeitsalltag.

Was ist Computer Use?

Der Gedanke ist einfach. Ein KI-Agent bekommt denselben Zugang wie ein Mensch: ein Bild des Bildschirms, einen Mauszeiger und eine Tastatur, oft dazu ein Konto mit Anmeldedaten. Er liest, was auf dem Bildschirm steht, klickt, tippt und arbeitet sich durch Programme und Webseiten. Die Dokumentation des Computer-Use-Werkzeugs von Anthropic beschreibt genau diese drei Bausteine: Bildschirmfoto, Mausbewegung, Tastatureingabe, anwendbar auf jede Anwendung im System.

Über Schnittstellen

  • Der Agent spricht mit dem System über eine Programmierschnittstelle, einen Konnektor oder einen MCP-Server.
  • Verlässlich, schnell und günstig je Arbeitsschritt.
  • Setzt voraus, dass jemand diese Schnittstelle gebaut und freigegeben hat.

Über den Bildschirm

  • Der Agent benutzt die Oberfläche, die für Menschen gebaut wurde.
  • Erreicht Systeme, für die es keine Schnittstelle gibt und vermutlich auch keine geben wird.
  • Langsamer, teurer je Schritt und empfindlich gegenüber Änderungen an der Oberfläche.

Beides schließt sich nicht aus. Die Frage ist selten, welcher Weg der bessere ist, sondern welcher Weg überhaupt zu dem System führt, um das es geht.

Welche Arbeit wird damit erreichbar?

Die meisten Agenten im Unternehmen arbeiten heute nur dort, wo jemand eine Schnittstelle bereitgestellt hat. Computer Use erweitert das Gebiet auf Systeme, die auf keiner Integrationsliste stehen.

40 %

der Unternehmensanwendungen sollen nach Gartners Prognose bis Ende 2026 aufgabenbezogene KI-Agenten enthalten, nach weniger als 5 Prozent im Jahr 2025.

Gartner, August 2025

Das vergrößert die Menge an Arbeit, die ein Agent übernehmen kann, ohne auf ein IT-Projekt zu warten. Zugang ist aber nicht dasselbe wie Erlaubnis. Viele Plattformen untersagen die automatisierte Nutzung in ihren Bedingungen, und bei personenbezogenen Daten kommt die Frage der Rechtsgrundlage dazu. Beides gehört geklärt, bevor ein Agent auf ein fremdes Portal gerichtet wird. Was passiert, wenn Werkzeuge an der IT vorbei genutzt werden, haben wir im Beitrag zu Schatten-KI beschrieben.

Zugang ist nicht dasselbe wie Erlaubnis.

Wo es in der Praxis hakt

Die häufigste Hürde ist die Anmeldung. Ein zweiter Faktor ist genau dafür gemacht, einen Menschen an der Tastatur zu verlangen, und er tut dann auch genau das.

Antworten darauf gibt es: eigene Agentenkonten mit eng begrenzten Rechten, Regeln für verwaltete Geräte, vorab angemeldete Browsersitzungen unter Kontrolle der IT. Das sind Entscheidungen für IT und Informationssicherheit und keine Einstellungen, die einzelne Fachbereiche für sich treffen sollten. Dieses Gespräch lohnt sich, bevor jemand im Team ein geteiltes Administratorkennwort in die Konfiguration eines Agenten schreibt. In vielen Unternehmen ist die KI-Richtlinie der Ort, an dem diese Regeln festgehalten werden.

Dazu kommen die Kosten. Jeder Schritt am Bildschirm schickt ein Bildschirmfoto in das Kontextfenster des Modells. Eine Sitzung mit vierzig Schritten verbraucht deshalb ein Vielfaches dessen, was dieselbe Aufgabe über eine Schnittstelle kosten würde. Das spricht nicht gegen Computer Use. Es spricht dafür, es dort einzusetzen, wo es Arbeit erreichbar macht, die sonst liegen bleibt.

über 40 %

der agentischen KI-Vorhaben werden nach Gartners Einschätzung bis Ende 2027 eingestellt, unter anderem wegen steigender Kosten, unklarem Nutzen und unzureichender Risikokontrolle.

Gartner, Juni 2025

Was verschiebt sich für die Beschäftigten?

Wenn ein Agent den Bildschirm bedient, verschwindet die Arbeit nicht. Sie ändert ihre Form. Aus dem Ausführen wird ein Beauftragen, Begrenzen, Prüfen und Verantworten.

01

Auftrag formulieren

Was genau soll erreicht werden, mit welchen Daten, bis zu welchem Punkt?

02

Grenzen setzen

Welche Konten, welche Systeme, welche Beträge, und wo endet die Vollmacht des Agenten?

03

Zwischenstand prüfen

Stimmt der Weg, oder arbeitet der Agent sauber an der falschen Aufgabe weiter?

04

Ergebnis verantworten

Wer unterschreibt am Ende, und woran ist das später noch nachvollziehbar?

Dazu kommt ein Risiko, das es ohne Bildschirm nicht gab. Was der Agent sieht, ist Text, und Text kann Anweisungen enthalten. Eine Webseite oder ein Dokument kann versuchen, dem Agenten eigene Befehle zu geben. Anthropic beschreibt dafür Klassifikatoren, die Bildschirmfotos auf solche eingeschleusten Anweisungen prüfen und das Modell zur Rückfrage bewegen. Für die Menschen davor heißt das vor allem eines: Wer einen Agenten beaufsichtigt, sollte wissen, dass eine Seite den Agenten ansprechen kann.

Wie sich das im Alltag anfühlt, hängt von der Aufgabe ab. Vier Beispiele:

Vier typische Aufgaben am Bildschirm

Was der Agent am Bildschirm tut

Anmelden, filtern, blättern, Werte aus einer Tabelle übernehmen

Woran es scheitert

Zweiter Faktor, geänderte Oberfläche, ein Filter, der stillschweigend Zeilen ausblendet

Was ein Mensch prüfen muss

Ob der Auszug vollständig ist und aus dem Zeitraum stammt, um den es geht

Diese Prüfarbeit ist keine Nebensache. Sie ist der Teil der Aufgabe, der beim Menschen bleibt, und sie besteht aus Entscheidungen: Auftrag, Grenze, Rückfrage, Freigabe. Die KI-Verordnung der EU verlangt von Unternehmen ohnehin, dass die Menschen, die KI einsetzen, dafür ausreichend befähigt sind; was das im Einzelnen bedeutet, steht in unserem Leitfaden zur KI-Kompetenz. Mit Agenten am Bildschirm wird daraus eine sehr praktische Frage: Wissen die Leute, wann sie widersprechen müssen?

Was diese Woche sinnvoll ist

Für die meisten Unternehmen ist jetzt die Zeit für Versuche, nicht für ein Programm.

  1. Ein System ohne Schnittstelle auswählen

    Nehmen Sie ein Portal oder ein altes Programm, aus dem Sie sich seit Langem eine Auswertung wünschen, die niemand liefern kann. Stellen Sie genau diese Frage.

  2. Vorher das Konto klären

    Mit welchem Zugang arbeitet der Agent, welche Rechte hat dieses Konto, und wer sieht, was damit getan wurde? Diese Frage gehört an IT und Informationssicherheit, bevor der erste Versuch läuft.

  3. Dieselbe Aufgabe zweimal durchlaufen

    Einmal von einem Menschen, einmal vom Agenten. Halten Sie fest, wo die Wege auseinandergehen und an welchen Stellen ein Mensch etwas bemerkt hat, das der Agent übersehen hat.

  4. Festlegen, was eine Freigabe behält

    Lesen ist etwas anderes als Absenden. Schreiben Sie auf, welche Schritte der Agent allein gehen darf und welche eine benannte Person freigibt.

Fazit

Computer Use verschiebt eine Grenze, die lange stabil war. Bisher endete die Reichweite eines Agenten dort, wo die Schnittstellen endeten. Jetzt endet sie eher dort, wo Anmeldung, Erlaubnis und Kosten es verlangen. Das macht einen großen Teil der täglichen Arbeit erreichbar, der nie auf einer Integrationsliste stand.

Für die Menschen im Unternehmen heißt das nicht weniger Verantwortung, sondern eine andere. Wer einen Agenten am Bildschirm beauftragt, muss die Aufgabe genauer beschreiben können, als wenn er sie selbst erledigt, muss erkennen, wann der Agent sauber am falschen Ziel arbeitet, und muss am Ende für das Ergebnis geradestehen. Das ist keine Frage der Werkzeuge. Es ist eine Frage der Kompetenz, und sie lässt sich an echter Arbeit beobachten.

Quellen und weiterführende Links

  1. OpenAI: GPT-6 Astra
  2. Fortune: OpenAI debuts GPT-6 Astra and touts its ability to use your computer
  3. Anthropic: Computer use tool
  4. Gartner: 40 % of enterprise apps will feature task-specific AI agents by 2026
  5. Gartner: Over 40 % of agentic AI projects will be canceled by end of 2027
  6. Gartner: Uniform governance across AI agents will lead to enterprise AI agent failure
  7. KI-Verordnung der EU (EU) 2024/1689
  8. Europäische Kommission: AI Literacy, Questions & Answers