Meistens nein. Wer einen oder zwei KI-Agenten laufen hat, braucht keine Führungsrolle darüber, sondern zwei sauber abgegrenzte Aufträge. In dieser Größe bist du selbst der Überblick: Du liest jedes Ergebnis ohnehin, und eine zusätzliche Instanz, die dir vorliest, was du in fünf Minuten selbst siehst, ist Überbau, der Zeit und Rechenkosten frisst. Anthropic formuliert die Grundregel für solche Systeme deutlich: die einfachste Lösung suchen und Komplexität nur erhöhen, wenn sie das Ergebnis nachweislich verbessert. Der Punkt, an dem sich eine Überblicksrolle lohnt, ist kein Zählwert, sondern ein Zustand, erkennbar an vier Dingen: Niemand weiß, was gestern erledigt wurde, zwei Rollen machen dieselbe Arbeit doppelt, Berichte behaupten Dinge, die so nicht passiert sind, und Übergaben laufen mündlich im Chatfenster statt schriftlich. Bevor du dafür eine Rolle baust, greifen drei einfachere Mittel: eine schriftliche Zuständigkeit je Agent, ein gemeinsamer Ablageort für Ergebnisse und eine feste Übergabeform. Erst wenn die drei stehen und die Anzeichen bleiben, ist die Rolle dran.
Ich führe mein Geschäft mit einer Belegschaft aus vierzehn KI-Mitarbeitern, jeder mit eigener Rolle, eigener Personalakte und eigenen Grenzen. Wer bei mir welchen Job macht, steht im Organigramm, dreizehn davon mit einer eigenen Seite. Die Rolle, die den Überblick über die anderen behält, kam nicht am ersten Tag, sondern am 03.09.2026, als die Belegschaft schon eine ganze Weile lief. Wie sie gewachsen ist, steht in Meine KI-Belegschaft, alle Rollen-Themen sammle ich auf der Seite KI-Mitarbeiter. Dieser Beitrag beantwortet die Frage, ob du so eine Rolle brauchst. Wie man mehrere Agenten praktisch zusammenführt, steht in Mehrere KI-Agenten orchestrieren: Anleitung.
Warum die Antwort meistens Nein ist
Eine Führungsrolle ist selbst ein Agent. Sie liest, prüft, schreibt und kostet dabei genau das, was jeder andere Agent kostet. Wie groß dieser Posten wird, hängt an Modell, Werkzeugen, Parallelität und Aufgabe. Eine Hausnummer gibt Anthropic für das eigene Recherchesystem: In den dortigen Daten verbrauchten Agenten etwa das Vierfache an Tokens einer Chat-Nutzung, Systeme aus mehreren Agenten etwa das Fünfzehnfache. Übertragen lässt sich daraus keine Rechnung, wohl aber die Richtung: Das lohnt sich nur, wenn die Aufgabe den Aufwand wert ist. Bei zwei laufenden Agenten ist sie es fast nie, weil das Problem, das die Rolle löst, bei zwei Agenten noch gar nicht existiert.
Dazu kommt ein zweiter Punkt, der oft übersehen wird: Eine Überblicksrolle kann nur sichten, was zugänglich belegt ist. Live-Adressen und Systemzustände ruft sie selbst ab, aber für alles, was im Betrieb passiert ist, braucht sie Berichte, abgelegte Ergebnisse und Übergabedateien. Fehlen die, sichtet sie nichts und rät stattdessen. Eine Führungsrolle auf ein unordentliches Setup zu setzen, macht das Setup nicht ordentlich, sondern erzeugt eine zweite Quelle für Behauptungen. Die Reihenfolge ist deshalb immer: erst die Ablage, dann die Rolle.
Und ein dritter: Nicht jede Mehrfach-Struktur ist der richtige Zuschnitt. Anthropic hält fest, dass Aufgaben mit geteiltem Kontext oder vielen Abhängigkeiten sich heute schlecht auf mehrere Agenten verteilen lassen. Wer merkt, dass seine zwei Agenten sich ständig gegenseitig zuarbeiten, hat kein Führungsproblem, sondern einen Agenten zu viel.
Vier Anzeichen, dass der Punkt erreicht ist
Diese vier Zustände sind keine Skala, sondern Schalter. Trifft einer dauerhaft zu, hast du ein Überblicksproblem, egal wie viele Agenten laufen.
1. Niemand kann sagen, was gestern erledigt wurde
Der Test ist unangenehm einfach: Nenn ohne nachzusehen, was deine Agenten gestern abgeliefert haben, und such dann den Beleg dafür. Brauchst du länger als ein paar Minuten oder findest du zu einem Ergebnis keine Datei, ist der Zustand erreicht. Ein Agent hat kein Gedächtnis über Sitzungen hinweg, dein Dateisystem schon. Was nirgends abgelegt ist, ist am nächsten Tag weg, für alle Beteiligten.
2. Zwei Rollen machen dieselbe Arbeit doppelt
Anthropic beschreibt aus dem eigenen Recherchesystem einen Lauf, in dem ein Subagent die Chipkrise 2021 untersuchte, während zwei weitere parallel an aktuellen Lieferketten arbeiteten, ohne dass irgendjemand die Arbeit aufgeteilt hatte. Dreimal bezahlt, einmal gebraucht. Das Gegenmittel dort: Jeder Auftrag nennt Ziel, Ausgabeformat, Hinweise zu Werkzeugen und Quellen und ausdrückliche Aufgabengrenzen. Bekommst du auch damit doppelte Ergebnisse, fehlt eine Stelle, die vorher sieht, was schon läuft.
3. Berichte behaupten, was nicht passiert ist
Das ist das teuerste der vier Anzeichen, weil es sich am besten anfühlt. Ein Bericht sagt, sechs Seiten seien live, der alte Textbaustein sei überall ersetzt, die Prüfung sei durchgelaufen. Niemand ruft die sechs Adressen ab, niemand sucht im Projekt nach dem alten Satz, und ein paar Tage später fällt auf, dass die Hälfte nicht stimmt. Wenn du anfängst, Berichten zu glauben, weil das Nachprüfen länger dauert als das Lesen, brauchst du jemanden, der genau dieses Nachprüfen zur Aufgabe hat.
4. Übergaben laufen mündlich statt schriftlich
Mündlich heißt hier: im Chatfenster, im Kopf, im Zuruf. Das funktioniert, solange du in jedem Gespräch selbst drinsitzt, und bricht in dem Moment, in dem zwei Agenten getrennt voneinander arbeiten. Die Claude-Dokumentation ist an dieser Stelle eindeutig: Ein Subagent startet mit einem frischen, isolierten Kontextfenster, er sieht deinen Gesprächsverlauf nicht und auch nicht die Dateien, die dein Hauptgespräch schon gelesen hat. Lesen kann er sie, wenn er die Rechte dafür hat, aber eben nur, wenn im Auftrag steht, wo sie liegen. Was Agent eins im Kopf hatte, existiert für Agent zwei nur, wenn es jemand aufgeschrieben hat.
Drei einfachere Mittel, die vorher greifen
Drei von vier Anzeichen verschwinden ohne jede zusätzliche Rolle. Diese drei Mittel kosten einen Nachmittag und sind ohnehin die Voraussetzung dafür, dass eine Führungsrolle später etwas zu sichten hat.
- Schriftliche Zuständigkeit je Agent. Ein Absatz pro Rolle, in der Rollendatei, nicht im Chat: Was liefert dieser Agent ab, in welchem Format, und was ist ausdrücklich nicht sein Job. Die Trennlinie verläuft am Ergebnis, nicht am Werkzeug. „Der eine recherchiert, der andere schreibt" ist eine haltbare Grenze, weil die Übergabe ein fertiges Dokument ist. „Der eine nutzt die Websuche, der andere das Dateisystem" ist keine, weil beide dieselbe Aufgabe an verschiedenen Enden anfassen. Wie dieser dauerhafte Rollen-Kontext technisch aussieht, steht in CLAUDE.md: das Gedächtnis von Claude Code.
- Ein gemeinsamer Ablageort. Ein Ordner, in dem jedes Ergebnis als Datei landet, mit Datum im Namen, immer an derselben Stelle. Kein Ergebnis lebt im Chatverlauf. Das allein beantwortet Anzeichen 1 und ist die Grundlage jeder späteren Prüfung, weil sich nur nachprüfen lässt, was irgendwo steht.
- Eine feste Übergabeform. Immer dieselben Felder: Absender, Empfänger, Datum, Anliegen, ein Link auf den Kontext statt einer Kopie des Inhalts, offene Punkte. Der Link statt der Kopie ist der entscheidende Teil: Es gibt dann eine einzige Quelle statt mehrerer Kopien, die getrennt veralten. Verschiebst du etwas, ziehst du die Links nach, von allein bleiben auch Pfade nicht richtig. Mit dieser Form fallen die Anzeichen 2 und 4 weg, weil jeder sehen kann, was ein anderer bereits übernommen hat.
Wie du diese drei Mittel konkret einrichtest, Schritt für Schritt bis zum zweiten Agenten, steht in Mehrere KI-Agenten orchestrieren: Anleitung. Den Zuschnitt der Zuständigkeiten musst du dabei nicht allein finden: In der Community sitzen Leute, die ihre Rollen schon geschnitten haben, und eine Frage in einem Posting spart dir oft den halben Nachmittag. Und wenn du beim ersten Punkt merkst, dass dein Agent gar kein klares Ergebnis abliefert, sondern ein Gespräch ist, fehlt nicht die Führungsrolle, sondern die Einarbeitung: KI-Mitarbeiter einstellen: der Ablauf und Welche Aufgaben du an KI abgeben kannst.
Was die Rolle dann tatsächlich tut
Bleibt nach diesen drei Mitteln vor allem Anzeichen 3 übrig, also Berichte, die niemand gegen den echten Stand hält, dann ist das der Fall, für den es eine eigene Rolle gibt. Und zwar genau für diesen einen Handgriff: Behauptung gegen Beleg.
Der Unterschied zu einem Statusanzeiger liegt in Zeile zwei. Ein Dashboard kann viel: Läufe melden, Tests fahren, Erreichbarkeit prüfen. Was es nicht tut, ist die Behauptung eines Berichts gegen den Gegenstand halten, von dem sie handelt. Die Rolle ruft die sechs Adressen ab, von denen der Bericht behauptet, sie seien live. Sie sucht im Projekt nach dem alten und dem neuen Satz. Und findet sie keinen Beleg, schreibt sie „nicht belegt" hin, statt die Lücke zu glätten. Genau deshalb entscheidet sie nichts: Eine Instanz, die prüft und gleichzeitig freigibt, prüft ihre eigene Arbeit. Dass Selbstprüfung eine schwache Absicherung ist, zeigt zumindest für einen klar umrissenen Fall die Untersuchung Large Language Models Cannot Self-Correct Reasoning Yet (Huang et al., ICLR 2024): Sollten Modelle ihre eigenen Antworten allein aus sich heraus korrigieren, ohne Rückmeldung von außen, wurden die Ergebnisse bei Reasoning-Aufgaben teils schlechter statt besser. Auf jede Form von Selbstprüfung lässt sich das nicht übertragen. Mein Grund ist deshalb zusätzlich eine Hausregel: Ersteller und Prüfer sind nie dieselbe Instanz. Die Praxisregeln für getrennte Prüfrollen stehen in Claude Code Subagents: Best Practices.
Wie diese Rolle bei mir aussieht
Bei mir heißt die Stelle, die den Überblick behält, Kai. Er hat keine eigene Oberfläche, er liest das, was die anderen ohnehin hinterlassen: Git-Historie, Berichte und Protokolle im gemeinsamen Ordner, das Postfach der Belegschaft. Nach einer Sitzung hält er die Behauptungen eines Mitarbeiters gegen das, was im Dateisystem und auf der Live-Website liegt, und schreibt daraus einen kurzen Bericht mit dem, worüber ich entscheiden muss.
Wie das aussieht, zeigt seine Sichtung vom 05.09.2026. Er prüfte die Arbeit von zwei Mitarbeitern und fand drei Dinge: einen unvollständigen Korrekturlauf, nach dem sich eine Live-Site an fünf Stellen selbst widersprach; einen Mitarbeiter, der dauerhaft auf einer Berechtigungsstufe ohne Rückfragen stand; und eine geänderte Wissensdatei ohne Protokoll darüber, wer sie geändert hatte. Dieselbe Sichtung bestätigte umgekehrt einen abgeschlossenen Rollout: sechs Kernrouten live mit HTTP 200 geprüft, der veraltete Satz danach mit null Treffern, der neue zweimal vorhanden.
Das ist der ganze Trick, und er ist unspektakulär. Kai meldet in beide Richtungen, was stimmt und was fehlt, allein in dieser Sichtung dreimal „nicht belegt". Entschieden hat er nichts davon: keine Freigabe, kein Commit. Seine Werkzeuge und Grenzen stehen auf Kai, der den Überblick behält.
Kai setzt voraus, dass bei dir schon mehrere Rollen laufen und ihre Ergebnisse ablegen. Wer dort hinwill, baut zuerst die, die Arbeit abliefern: Claude lernen: der Weg in fünf Stufen ist der Einstieg, und welche Aufgaben sich als erste eignen, zeigen die zehn Fälle in KI-Agenten: 10 Beispiele aus der Praxis.
Häufige Fragen
Ab wie vielen KI-Agenten braucht man eine Führungsrolle?
Es gibt dafür keinen Zählwert. Die brauchbare Faustregel ist ein Verhalten: Sobald du Berichte überfliegst statt sie zu lesen, brauchst du eine Stelle, die vor dir liest. Bei mir kam diese Rolle, als die Belegschaft schon eine Weile lief, nicht am ersten Tag.
Was kostet so eine zusätzliche Rolle?
Sie kostet, was ein weiterer Agent kostet, also Rechenzeit plus deine Zeit für die Einarbeitung. Wie viel genau, hängt an Modell, Werkzeugen und Aufgabe. Anthropic maß im eigenen Recherchesystem etwa das Vierfache an Tokens gegenüber einer Chat-Nutzung und etwa das Fünfzehnfache bei mehreren Agenten; das ist eine Hausnummer aus einem fremden Aufbau, keine Prognose für deinen. Wie ich die laufenden Kosten einer Belegschaft rechne, steht in Was ein KI-Mitarbeiter kostet.
Kann ein KI-Agent die Arbeit eines anderen KI-Agenten überhaupt prüfen?
Ja, und zwar mehr, als man ihm meist zutraut. Adressen abrufen, im Projekt nach einem Satz suchen, Dateien gegen einen Bericht halten: Handgriffe mit eindeutigem Ergebnis. Er kann darüber hinaus gegen festgelegte Kriterien bewerten, Fehler finden und begründen, warum etwas nicht trägt. Was ihm nicht gehört, ist die Befugnis: Entscheiden und freigeben bleibt bei dir.
Was darf eine KI-Führungsrolle entscheiden?
Entscheiden bei mir: nichts. Sie sichtet, bewertet gegen Kriterien und Belege, verdichtet, stellt Rückfragen und markiert Lücken, gibt aber nichts frei und ändert keine Ergebnisse anderer. Wo genau die Grenze zwischen Feststellen und Entscheiden liegt, steht in Was darf eine KI-Führungsrolle entscheiden?.
Wie du weitermachst
Mach den Vier-Punkte-Durchgang, er dauert zehn Minuten. Schreib für jeden Agenten auf, was er gestern abgeliefert hat, und such den Beleg dazu. Notiere, wo zwei Rollen dasselbe angefasst haben. Nimm eine Behauptung aus dem letzten Bericht und prüf sie nach. Sieh nach, ob es zu jeder Übergabe eine Datei gibt. Kommst du dabei auf höchstens ein Anzeichen, bau keine Führungsrolle, sondern die drei Mittel aus dem Mittelteil. Kommst du auf drei oder vier, ist die Rolle dran, und dann als eigene Rolle mit einem einzigen Auftrag: Behauptung gegen Beleg.
Den Weg dorthin, von der ersten Sitzung bis zur eigenen Belegschaft, gehen wir Schritt für Schritt in meiner Community durch, mit den fertigen Rollen-Paketen als Startpunkt.