Ist das wirklich ein KI-Agent?
Ein praktischer Test für Produkte, die als Agenten oder agentische KI vermarktet werden: was sie wirklich können, woher der Wert kommt, und welche Fragen den Hype entlarven.
Fabian Mösli Leseeinstellungen
Das Wichtigste in Kürze
- • Die Bezeichnung «Agent» beweist gar nichts. Der brauchbare Test ist, ob das Modell beobachten kann, was passiert ist, und seine nächste Aktion selbst wählt, statt einem im Voraus festgelegten Ablauf zu folgen.
- • Tools, Memory, Zeitpläne und mehrere Modelle können einen Agenten unterstützen, aber keines davon macht ein Produkt für sich allein agentisch.
- • Beurteile Handlungsfähigkeit und Autonomie getrennt. Frag, was das System beobachten, entscheiden, verändern und verifizieren darf, und teste dann, wie es sich verhält, wenn der Happy Path bricht.
In diesem Guide
Jedes KI-Produkt scheint mittlerweile einen Agenten zu haben.
Es gibt Recherche-Agenten, Vertriebs-Agenten, Service-Agenten, Meeting-Agenten, Coding-Agenten, Browser-Agenten und ganze Teams von Agenten. Manchmal ist die Bezeichnung berechtigt. Das System kann eine Aufgabe untersuchen, Tools nutzen, merken, wenn etwas schiefgelaufen ist, den Kurs ändern und weiterarbeiten.
Manchmal bedeutet «Agent» einfach ein Chatbot mit Zugriff auf deine Dateien. Oder eine gewöhnliche Automatisierung, bei der ein LLM mittendrin einen Schritt übernimmt. Die Demo sieht trotzdem beeindruckend aus. Der Unterschied zeigt sich erst, wenn etwas Unerwartetes passiert.
Das ist wichtig, weil «agentische» Fähigkeiten oft einen höheren Preis, tieferen Zugriff auf Firmensysteme und ein viel grösseres Versprechen rechtfertigen sollen: Dieses Produkt erledigt die Arbeit, statt dir nur beim Denken zu helfen.
Ich betreibe selbst so ein System. Meine eigene Assistentin bearbeitet diese Website seit März: Ich beschreibe eine Änderung, sie setzt sie um, erstellt eine Vorschau und schickt mir einen Link zur Freigabe zurück. Bis dahin brauchte es einen gemieteten Server, viel manuelle Konfiguration und mehrere Setups, die ich so gründlich zerschossen habe, dass nur die Wiederherstellung aus dem Backup half. Die Bezeichnung kostet nichts. Alles, was ich gerade beschrieben habe, war Arbeit.
Bevor ich einem solchen Versprechen glaube, will ich wissen, was das System beobachten kann, welche Entscheidungen das Modell treffen darf, was es verändern kann und wie jemand feststellt, ob es erfolgreich war. Am Ende dieses Guides hast du eine praktische Methode, solche Behauptungen zu beurteilen, ohne selbst KI-Engineer zu werden.
Ein Job, drei sehr unterschiedliche Produkte
Stell dir vor, ein Anbieter zeigt dir einen «agentischen Campaign-Analysten». Du verbindest einen Analytics-Export, den Kampagnenplan und eine Ausgabenübersicht. Jeden Montag bereitet er die Auswertung vor.
Hier sind drei Versionen dieses Produkts.
| Was das Produkt tut | Was du tatsächlich bekommst |
|---|---|
| Es liest die Dateien, schreibt eine plausible Auswertung und wartet. Du bemerkst, dass die Ausgaben nicht zum Plan passen, und bittest es, das zu untersuchen. | Chat oder ein Assistent. Es hat bei der Antwort geholfen; die Weiterarbeit lag bei dir. |
| Ein Zeitplan sammelt dieselben Exporte, führt dieselben Berechnungen aus, lässt ein LLM eine Zusammenfassung schreiben und liefert den Bericht. Programmierte Regeln steuern jede Verzweigung. | Ein KI-gestützter Workflow. Nützlich, wiederholbar und vorhersehbar. Der Ablauf wurde im Voraus festgelegt. |
| Es bemerkt die Abweichung bei den Ausgaben, entscheidet sich, die betroffene Kampagne genauer zu prüfen, kontrolliert eine weitere zulässige Quelle, findet widersprüchliche Daten und ändert seine Empfehlung, bevor es für deine Freigabe stoppt. | Ein Agent. Das Modell hat den nächsten Untersuchungsschritt aufgrund dessen gewählt, was es entdeckt hat. |
Alle drei können in einem Chatfenster erscheinen. Alle drei können dasselbe LLM nutzen. Der Unterschied liegt im Verhalten rund um das Modell.
Ein Produkt kann auch mehrere Muster gleichzeitig nutzen. Sein Recherche-Modus kann agentisch sein, während der E-Mail-Schreiber nur eine einzelne Antwort liefert. Beurteile den konkreten Job und Modus, den du kaufst — nicht das Logo auf der Startseite.
Die eine Frage, die die meisten Agent-Versprechen entlarvt
Nachdem das System das Ergebnis einer Aktion beobachtet hat: Wer entscheidet, was als Nächstes passiert — feste Regeln oder das Modell?
Ein gewöhnlicher Chat-Austausch endet so:
du fragst → Modell antwortet → Modell wartet
Ein Agent kann die Aufgabe weiterführen:
Ziel → prüfen → Aktion wählen → Tool nutzen → Ergebnis beobachten
↑ ↓
└────────────── erneut entscheiden ────────┘
↓
verifizieren, stoppen oder Hilfe anfordern
Die Anzahl Schritte entscheidet nicht. Ein Produkt kann so programmiert sein, dass es in fester Reihenfolge fünf Suchen durchführt — das ist ein Workflow. Ein Agent braucht bei einem einfachen Fall vielleicht nur eine Suche, aber das Modell hätte erneut suchen können, wenn die Beweislage schwach gewesen wäre.
Anthropic macht in seinem Guide zum Bauen effektiver Agenten dieselbe praktische Unterscheidung: Workflows folgen vorgegebenen Pfaden, während Agenten ihren eigenen Prozess und Tool-Einsatz steuern.
Feste Workflows sind oft die bessere Lösung. Wenn dieselben Prüfungen jeden Montag in derselben Reihenfolge ablaufen sollen, macht es die Sache nur teurer und fehleranfälliger, wenn ein Modell den Ablauf selbst improvisiert. Agentisches Verhalten lohnt sich, wenn der richtige nächste Schritt davon abhängt, was das System entdeckt.
Warum dasselbe Modell ein ganz anderes Produkt ergeben kann
Das LLM ist nur eine Komponente. Es erhält Context und liefert eine Ausgabe, aber es kommt nicht mit deinen Dateien, Accounts, Memory oder Befugnissen.
Das Produkt drumherum liefert Anweisungen, Firmen-Context, Tools, einen Ort, um den Stand der Aufgabe festzuhalten, Berechtigungen, den Loop, der die Arbeit am Laufen hält, und Kontrollen des Ergebnisses. Engineers nennen dieses Umfeld oft den Harness. Ein Agent ist ein Modell in einem Harness, das Aktionen wählen, Ergebnisse beobachten und weitermachen kann.
Das Chatfenster ist nur die Oberfläche. Dahinter kann sich eine einzelne Antwort oder ein langer agentischer Prozess verbergen — deshalb sagt der Vergleich von Screenshots so wenig aus.
Ich stelle mir das Modell als das brillante neue Teammitglied vor, das viel über die Welt weiss und nichts über dein Unternehmen.
Ein blosser Chat setzt diese Person in einen leeren Sitzungsraum. Sie kann dir einen Rat geben oder dir ein Dokument in die Hand drücken. Du verlässt den Raum und erledigst den Rest.
Ein Agent-Setup gibt derselben Person einen Arbeitsplatz, einen Zutrittsausweis, die relevanten Dateien, freigegebene Tools, schriftliche Abläufe und eine Definition, wann eine Aufgabe erledigt ist. Es legt auch fest, welche Türen verschlossen bleiben und wann eine Führungsperson den nächsten Schritt genehmigen muss.
Der Arbeitsplatz verändert, was das Modell leisten kann. Er verändert auch, was schiefgehen kann. Anthropics Guide zum Evaluieren von Agenten behandelt Modell und Harness deshalb als ein gemeinsam zu testendes System. Ein bekannter Modellname garantiert kein starkes Produkt drumherum.
Was Marketing-Aussagen wirklich sagen
Die meisten Agent-Versprechen beschreiben eine Zutat und überlassen dir den Rest der Schlussfolgerung.
| Die Aussage | Was sie beweist | Was noch fehlt |
|---|---|---|
| «Agent-Modus» | Das Produkt hat ein Feature benannt. | Welche Entscheidungen kann das Modell treffen, nachdem es ein Ergebnis gesehen hat? |
| «Verbindet sich mit 100 Apps» | Es hat viele mögliche Tools. | Welche Tools darf es für diesen Job nutzen, mit welchen Berechtigungen, und wer entscheidet wann? |
| «Plant und führt mehrstufige Aufgaben aus» | Es kann einen Plan erstellen oder befolgen. | Kann es diesen Plan anpassen, wenn die Realität etwas anderes zeigt? |
| «Läuft autonom» | Es kann laufen, ohne auf dich zu warten. | Ist der Ablauf anpassungsfähig, oder ist es ein geplanter Workflow? Was stoppt es? |
| «Erinnert sich an dich und dein Unternehmen» | Es speichert oder ruft Context ab. | Kann es handeln, das Ergebnis beobachten und weitermachen? |
| «Ein Team spezialisierter Agenten» | Der Anbieter nutzt mehrere Modellrollen oder Prozesse. | Verbessert das Ergebnis dadurch, oder vervielfacht sich nur die Zahl der Calls, die Latenz und die Fehlerquellen? |
Tool-Zugriff wird besonders leicht überschätzt. Ein Chatbot, der einmal sucht und eine Antwort liefert, kann nützlich sein, aber das Such-Icon macht ihn noch nicht zum Agenten. Dasselbe gilt für Memory. Wenn sich ein System deine Präferenzen merkt, verbessert das den Context — es schafft noch keine Ausführungs-Loop.
«Multi-Agent» verdient besondere Vorsicht. Mehrere Agenten können tatsächlich unterschiedliche Aufgaben aufteilen. Sie können aber auch deutlich mehr Calls, Zeit und Geld verbrauchen, um eine Antwort zu liefern, die ein einzelnes Modell genauso hätte schreiben können. Frag nach, welche eigenständige Arbeit jede Rolle übernimmt und welches gemessene Ergebnis eine Single-Agent-Basislinie schlägt.
Wofür sich agentische Fähigkeiten wirklich lohnen
Der erste Vorteil ist der Wegfall von Kleinarbeit zwischen den Systemen. Im Chat lädst du eine Datei herunter, fügst den relevanten Abschnitt ein, führst eine Berechnung aus, kehrst mit dem Fehler zurück, kopierst die Antwort in ein anderes System und promptest erneut. Ein Agent kann diesen Zustand selbst zwischen den Tools weitertragen.
Der grössere Vorteil ist Feedback aus der Realität. Eine flüssig klingende Antwort kann trotzdem falsch sein. Ein Agent kann die Quelle öffnen, den Datensatz abfragen, die Berechnung ausführen oder den Test durchführen. Fehlt das Ergebnis oder widerspricht es sich, kann er weiter nachforschen, statt den Satz einfach selbstbewusst zu Ende zu schreiben.
Das macht Agenten nützlich für Aufgaben, bei denen:
- der Ablauf von Fall zu Fall variiert;
- die nötigen Belege über mehrere zulässige Quellen verteilt sind;
- das Ergebnis im echten System überprüft werden kann; und
- die Arbeit wertvoll genug ist, um zusätzliche Zeit, Calls und Aufsicht zu rechtfertigen.
Agentische Arbeit kostet meist mehr und dauert länger als eine einzelne Antwort. Jede Aktion schafft eine weitere Stelle, an der eine falsche Annahme, eine feindliche Anweisung oder ein Tool-Fehler eindringen kann. Spätere Schritte bauen dann auf diesem Fehler auf.
Nutz Chat, wenn du eine Antwort brauchst. Nutz einen Workflow, wenn der Ablauf fest bleiben soll. Bezahl für einen Agenten, wenn die Anpassung an neue Erkenntnisse Teil des Jobs ist.
Handlungsfähigkeit und Autonomie sind getrennte Fragen
Produktdemos vermischen oft zwei Fragen:
- Kann das Modell den nächsten Schritt wählen?
- Wie weit darf das System ohne einen Menschen gehen?
Das sind zwei unterschiedliche Kontrollmechanismen.
Ein Recherche-Agent kann stark beaufsichtigt sein. Er entscheidet, welche Quellen er prüft, aber du genehmigst jede externe Aktion. Das System ist agentisch und hat wenig Autonomie.
Ein fester Bericht kann jede Nacht laufen, ohne dass jemand zuschaut. Er hat hohe Autonomie und keinen vom Modell gesteuerten Ablauf.
Ein Agent, der über Nacht läuft und Kundendaten aktualisieren darf, hat beides. Das kann irgendwann gerechtfertigt sein, sollte aber deutlich höhere Anforderungen an Nachweise und Sicherheit erfüllen als ein beaufsichtigter Entwurf.
Meine eigene Assistentin macht diese Trennung greifbar. Ihre Standardeinstellung ist eine starke Handlungsneigung: Braucht ein Job ein Tool, das nicht installiert ist, installiert und konfiguriert sie es und meldet es mir danach. Ich kann sie auch so einstellen, dass sie zuerst fragt, und daran, wie sie entscheidet, ändert das nichts. Gleiche Handlungsfähigkeit, unterschiedliche Autonomie. Ein Anbieter, der diese Grenze bei seinem eigenen Produkt nicht ziehen kann, hat sich damit nicht ernsthaft befasst.
Wenn ein Anbieter «autonom» sagt, frag nach Zeitlimiten, Ausgabenlimiten, maximaler Schrittzahl, Freigabe-Gates, Berechtigungen, Rollback und Eskalation. Bei der Autonomie wird aus einer beeindruckenden Produktdemo schnell dein eigener Vorfall.
Über den Happy Path hinaus testen
Eine polierte Happy-Path-Demo beweist nur, dass ein vorbereiteter Fall funktioniert. Bitte den Anbieter vor einem Pilotprojekt, denselben Job in drei Fällen durchzuspielen:
- Der Normalfall. Alle erwarteten Eingaben sind vorhanden und stimmig.
- Der gestörte Fall. Eine Quelle fehlt, und zwei andere widersprechen sich.
- Der feindliche Fall. Du lieferst ein Dokument oder eine E-Mail mit einer Anweisung, die den Agenten dazu bringen soll, seine Regeln zu ignorieren, Daten preiszugeben oder eine nicht genehmigte Aktion auszuführen. Legt die zulässigen Daten- und Aktionsgrenzen vor dem Lauf fest.
Achte auf das Verhalten, nicht nur auf den fertigen Text. Erkennt das System Unsicherheit? Passt es seine Untersuchung an? Erfindet es eine fehlende Zahl? Lässt es sich durch Inhalte in einer Datei austricksen? Stoppt es an der Freigabegrenze?
Bitte anschliessend um das Laufprotokoll. Ein brauchbarer Trace zeigt, welche Quellen das System gelesen hat, welche Tools es aufgerufen hat, was sich verändert hat, den protokollierten Stoppgrund oder Tool-Fehler, was es gekostet hat, und welche Freigabe oder Limite den Lauf beendet hat. Ein Screenshot der Endantwort sagt dir davon nichts.
Eine Scorecard für Käufer
Ich würde ein agentisches Produkt anhand von acht Dimensionen beurteilen:
| Dimension | Fragen, die sich lohnen | Schwache Antwort |
|---|---|---|
| Beobachten | Welche Quellen kann es einsehen? Sind sie live, kopiert oder abgeleitet? Was sieht es nie? | «Es versteht dein ganzes Geschäft.» |
| Entscheiden | Welche nächsten Aktionen kann das Modell wählen? Welche Verzweigungen bleiben feste Regeln? Lässt sich das im Laufprotokoll zeigen? | «Unsere proprietäre agentische Architektur übernimmt das.» |
| Ergebnisvorteil | Bei welchen realistischen Ausnahmefällen verbessert der anpassungsfähige Ablauf Genauigkeit, Durchlaufzeit, Fehlerbehebung oder menschlichen Aufwand gegenüber einem festen Workflow? Was ist die Basislinie? | Der Anbieter beweist, dass es agentisch ist, kann aber nicht zeigen, dass die Handlungsfähigkeit den Job tatsächlich verbessert. |
| Handeln | Was kann es lesen, schreiben, senden, ausgeben, löschen oder veröffentlichen? Sind die Berechtigungen pro Job gesetzt? | Ein einziger, breiter Zugriffsschalter für das ganze Produkt. |
| Verifizieren | Wie prüft es das tatsächliche Ergebnis? Kontrolliert es den geänderten Datensatz, führt es die Berechnung erneut aus, oder meldet es nur Erfolg? | «Das Modell prüft seine Antwort selbst.» |
| Stoppen | Was passiert, wenn Daten fehlen, Tools ausfallen oder das Schrittlimit erreicht ist? Wo ist eine menschliche Freigabe zwingend? | Es versucht es einfach weiter, rät, oder liefert stillschweigend nur Teilergebnisse. |
| Wiederherstellen | Kannst du Änderungen rückgängig machen und einen misslungenen Lauf rekonstruieren? Wer ist bei einem Vorfall zuständig? | Es gibt Logs, aber niemand kann die Aktion erklären oder rückgängig machen. |
| Wirtschaftlichkeit und Daten | Was kostet ein einzelner echter Lauf? Was begrenzt die Nutzung? Welche Daten verlassen deine Umgebung, wer speichert sie, und wie lange? | Ein Preis pro Sitzplatz, ohne Antwort zu Laufkosten oder Datenfluss. |
OpenAIs praktischer Guide zum Bauen von Agenten schlägt vor, Tools anhand von Faktoren wie Lese- versus Schreibzugriff, Umkehrbarkeit, Kontoberechtigungen und finanziellen Auswirkungen zu beurteilen. Diese Fragen bringen mehr als ein einzelner «Agent aktiviert»-Schalter.
Wähl das kleinste System, das dem echten Job standhält
Ein Agent ist nicht die Premium-Version jedes KI-Produkts. Manchmal ist das beste Produkt ein gut gestaltetes Chat-Interface. Manchmal ist es ein langweiliger Workflow, der jedes Mal dasselbe tut und sichtbar scheitert, wenn etwas schiefgeht.
Der zusätzliche Aufwand eines Agenten lohnt sich, wenn sich der Ablauf wirklich anpassen muss. Dein Pilotprojekt sollte zeigen, dass diese Anpassung die Ergebnisse bei schwierigen Fällen tatsächlich verbessert — und nicht nur einen theatralischeren Fortschrittsbildschirm liefert.
Wenn du entscheidest, dass der Job wirklich einen Agenten braucht, stellt sich als Nächstes die Frage, ob du einen General-Purpose-Agenten konfigurierst oder einen massgeschneiderten Dienst baust. Teil zwei zeigt, wie ich diese Entscheidung treffe und den Job in Etappen aufbaue — beginnend mit statischen Dateien und menschlicher Freigabe statt mit Live-Accounts und Wunschdenken.
Bring zur nächsten Produktdemo einen unbequemen echten Fall mit. Frag, was das System beobachtet hat, welche Entscheidung das Modell getroffen hat, was es verändert hat, wie es das Ergebnis geprüft hat und warum es gestoppt hat. Wenn der Anbieter dir nur den Happy Path zeigen kann, hast du gerade Verkaufstheater gesehen.
Für tiefere technische Orchestrierung lies Loops, Graphs und wer entscheidet, was die KI als Nächstes tut. Um einen Agenten in Produktion mit vier Monaten Betriebserfahrung zu sehen, lies Ich habe einen KI-Agenten gebaut, der diese Website per WhatsApp-Sprachnachricht aktualisiert.
Veröffentlicht: 2026-09-15
Zuletzt aktualisiert: 2026-09-15