Von Assistenz zu Agenten: Wie viel Autonomie darf ein Workflow haben?

A glowing architectural gate and controlled paths represent bounded autonomy for AI agents.

Die falsche Frage lautet: „Können wir dafür einen Agenten bauen?“ Die bessere: „Welche Entscheidung darf dieser Agent treffen — und wann muss er stehen bleiben?“

Das klingt nach einem kleinen Unterschied. In der Praxis trennt diese Frage einen hilfreichen digitalen Kollegen von einem System, das mehr Koordination, Risiko und Nacharbeit erzeugt als es spart.

Autonomie ist ein Spektrum, kein Schalter

Zwischen Chatbot und autonomem Workflow liegen mehrere sinnvolle Stufen. Ein Assistent fasst zusammen. Ein Copilot schlägt Optionen vor. Ein Agent kann Informationen einholen, einen Plan bilden und einen begrenzten Schritt ausführen. Erst bei wiederkehrenden, klar eingegrenzten Abläufen ist eine weitergehende Ausführung sinnvoll.

Die Stufe sollte nicht durch technische Machbarkeit bestimmt werden, sondern durch die Konsequenz eines Fehlers. Eine fehlerhafte Zusammenfassung ist anders zu behandeln als eine falsche Änderung in einem Kundensystem, eine Bestellung oder ein Zugriff auf sensible Daten. Das NIST GenAI Profile empfiehlt deshalb, Risiken über den gesamten Lebenszyklus zu betrachten — nicht nur beim ersten Build.

Ein pragmatisches Modell hat vier Stufen:

  1. Informieren: Der Agent recherchiert, fasst zusammen oder strukturiert.
  2. Empfehlen: Der Agent schlägt eine Entscheidung oder Handlung vor, ein Mensch entscheidet.
  3. Ausführen mit Freigabe: Der Agent bereitet die Aktion vollständig vor; ein klar benannter Mensch gibt sie frei.
  4. Begrenzt ausführen: Der Agent handelt innerhalb fester Betrags-, Daten-, Zeit- und Systemgrenzen und eskaliert Ausnahmen.

Die meisten Teams gewinnen viel, bevor sie Stufe vier erreichen. Das ist kein Zeichen von mangelndem Mut. Es ist gutes Prozessdesign.

Ziehen Sie vier Grenzen, bevor Sie bauen

1. Aufgabengrenze. Welches Ergebnis besitzt der Agent? „Unterstützt den Vertrieb“ ist keine Aufgabe. „Erstellt aus freigegebenen CRM-Daten eine Meeting-Vorbereitung und speichert sie als Entwurf“ ist eine.

2. Entscheidungsgrenze. Welche Aktionen darf er selbst auslösen? Definieren Sie positive Berechtigungen statt einer langen Verbotsliste. Beispiel: Der Agent darf einen Termin vorschlagen, aber nicht verbindlich buchen; er darf einen Entwurf anlegen, aber nicht veröffentlichen.

3. Datengrenze. Welche Quellen, Felder und Identitäten darf er verwenden? Externe Dokumente, Webseiten oder Tool-Ausgaben sind Daten — nicht vertrauenswürdige Instruktionen. Die OWASP Top 10 für LLM-Anwendungen führt Prompt Injection bewusst als zentrale Risikoquelle. Daraus folgt ein einfacher Designgrundsatz: Fremder Inhalt darf nie die Berechtigungen, Ziele oder Sicherheitsregeln eines Agenten überschreiben.

4. Eskalationsgrenze. Wann muss der Agent pausieren? Gute Regeln sind beobachtbar: fehlende Pflichtdaten, widersprüchliche Quellen, geringe Konfidenz, ungewöhnlicher Betrag, neuer Zahlungsempfänger oder ein Versuch, ausserhalb des Mandats zu handeln. „Wenn es kritisch wird“ ist keine Regel.

Lassen Sie das Risiko die Lane bestimmen

Nicht jedes Vorhaben braucht dasselbe Verfahren. Eine hilfreiche Unterscheidung sind drei Lanes:

  • Grün: persönliche oder teaminterne Unterstützung mit zugelassenen Daten und ohne irreversible Aktion. Schnell testen, klar kennzeichnen, Feedback sammeln.
  • Amber: bereichsübergreifende Nutzung, moderat sensible Informationen oder integrierte Systeme. Vor der breiteren Nutzung: eine benannte verantwortliche Person, eine Prüfung der Datenzugriffe, Testfälle und ein Freigabeschritt.
  • Rot: hohe Wirkung auf Menschen, Geld, Rechte, Sicherheit oder regulierte Entscheidungen. Strenge Tests, formale Verantwortlichkeit, nachvollziehbare Evidenz und ein klarer Ausstiegsweg.

Diese Zonierung ist keine Rechtsklassifikation. Sie ist eine operative Abkürzung. Microsofts aktuelle Governance-Leitlinie für Copilot Studio beschreibt ebenfalls zonierte Umgebungen, Guardrails und kontrollierte Lebenszyklen. Der Gedanke lässt sich plattformunabhängig anwenden: Je grösser die Wirkung, desto expliziter müssen Rechte, Tests und Beobachtung werden.

Menschliche Checkpoints müssen echte Entscheidungen ermöglichen

„Human in the loop“ ist wertlos, wenn der Mensch nur noch auf Approve klickt. Ein guter Checkpoint zeigt, was der Agent gesehen hat, welche Annahme er gemacht hat, welche Aktion folgt und welche Alternative es gibt. Er muss eine sinnvolle Intervention erlauben: ändern, ablehnen, zurückstellen oder eskalieren.

Bei bestimmten Hochrisiko-Kontexten verlangt der EU AI Act unter anderem angemessene menschliche Aufsicht, Protokollierung und dokumentierte Risikokontrollen. Ob ein konkreter Anwendungsfall darunter fällt, ist eine Rechtsfrage. Der praktische Schluss ist dennoch universell: Je folgenreicher eine Aktion, desto sichtbarer muss die menschliche Entscheidungsfähigkeit bleiben.

Messen Sie nicht nur Geschwindigkeit

Ein Agent ist nicht erfolgreich, weil er viele Aktionen ausführt. Er ist erfolgreich, wenn er fachlich korrekte Abläufe zuverlässig beschleunigt und bei Unsicherheit sauber innehält. Messen Sie deshalb mindestens vier Dinge:

  • Ergebnisqualität: War die Entscheidung oder Aktion inhaltlich brauchbar?
  • Sichere Enthaltung: Hat der Agent bei unklaren Fällen korrekt eskaliert?
  • Reversibilität von Fehlern: Wie schnell lässt sich ein falscher Schritt entdecken und korrigieren?
  • Nacharbeit: Spart der Ablauf wirklich Zeit, oder verschiebt er Arbeit in Prüfung und Bereinigung?

Eine gute Metrik ist oft überraschend menschlich: Würde die verantwortliche Person denselben Agenten morgen wieder einsetzen — und warum?

Die nächste praktische Entscheidung

Nehmen Sie einen bestehenden Agenten oder einen Kandidaten und schreiben Sie auf einer Seite: Ergebnis, erlaubte Aktionen, Datenquellen, Ausschlusskriterien und Eskalationen. Dann testen Sie fünf normale, drei unvollständige und zwei absichtlich problematische Fälle. Wenn das Team die erwartete Reaktion nicht eindeutig beschreiben kann, ist der Agent noch nicht bereit für mehr Autonomie.

Nützliche Agenten sind nicht die, die überall handeln können. Sie sind die, deren Mandat so klar ist, dass Menschen ihnen verantwortungsvoll Raum geben können.

English edition: From Assistance to Agents: How Much Autonomy Should a Workflow Have?

Quellen und Einordnung

Vertiefen: Alle Weekly Field Notes ansehen.

Redaktioneller Hinweis: Der Beitrag ist ein operativer Entscheidungsrahmen, keine rechtliche Bewertung eines konkreten AI-Systems.