KI-CEO-Test: Nur 3 von 14 Modellen überleben 500 Tage

von Marcel Buchholz 28. Juni 2026 4 Min. Lesezeit KI & Wirtschaft

KI-Agenten als CEO: Die meisten gehen pleite

Princeton-Forscher haben einen radikalen Test entwickelt. KI-Modelle mussten ein fiktives Software-Startup 500 Tage lang führen. Das Ergebnis ernüchtert: Von 14 getesteten Modellen schafften es nur drei über die Ziellinie mit Gewinn. Eine simple Regel-Strategie ohne jegliche KI schlug fast alle Modelle. Der CEO-Bench zeigt damit eine deutliche Lücke zwischen lokaler Kompetenz und strategischer Weitsicht.

Was der CEO-Bench misst

Das Forscherteam um Haozhe Chen, Karthik Narasimhan und Zhuang Liu von der Princeton University stellt mit CEO-Bench einen Benchmark vor, der KI-Agenten auf eine völlig neue Art prüft. Statt einzelne Aufgaben zu lösen, muss das Modell ein komplettes Unternehmen steuern. Dabei geht es um Preisgestaltung, Werbebudgets, Produktqualität, Infrastruktur und Kundenverhandlungen.

Das fiktive Unternehmen heißt NovaMind. Es startet mit null Kunden und einer Million Dollar Startkapital. Der Agent greift über eine Python-Schnittstelle mit 34 Werkzeugen auf eine Datenbank mit 19 Tabellen zu. Er schreibt eigenen Code, führt SQL-Abfragen durch und baut Arbeitsabläufe aus den Ergebnissen. Diese Aufgabenstellung entspricht denselben Herausforderungen, denen auch ein menschlicher CEO gegenübersteht.

Verzögertes Feedback und versteckte Variablen

Was den Test besonders schwer macht, ist die Zeitdimension. Entscheidungen wirken sich erst auf realistischen Zeitskalen aus. Einnahmen kommen nur an Abrechnungsterminen. Forschungsprojekte dauern Tage bis Wochen. Fehler zeigen sich oft erst später durch Kundenabwanderung oder beschädigten Ruf. Kosten hingegen fallen sofort an.

Darüber hinaus bleibt ein Großteil des Unternehmenszustands verborgen. Der Agent kann Kundenzufriedenheit oder Zahlungsbereitschaft nicht direkt sehen. Stattdessen muss er diese Werte aus verrauschten Signalen wie Kündigungen, Support-Tickets oder Reaktionen im sozialen Netzwerk ableiten. Die Simulation modelliert 26 Kundensegmente mit eigenen Budgets und Preiserwartungen.

Die Ergebnisse: Die meisten Modelle gehen bankrott

Nur drei Modelle beendeten ihren besten Durchlauf über dem Startkapital von einer Million Dollar. Claude Fable 5 erreichte 47,15 Millionen Dollar, Claude Opus 4.8 kam auf 27,8 Millionen Dollar und GPT-5.5 landete bei 21,3 Millionen Dollar. Allerdings gibt es einen Vorbehalt: Bei einem Fable-5-Durchlauf brach das Modell ab, weil es die Weiterarbeit verweigerte. In den anderen beiden Durchläufen fielen einige Anfragen auf Opus 4.8 zurück. GPT-5.5 ging in zwei seiner drei Durchläufe bankrott.

Der aussagekräftigste Vergleich ist eine einfache regelbasierte Strategie, die überhaupt keine KI nutzt. Sie setzt feste Preise, Quoten und Tarife, konzentriert Werbung auf wenige Kundensegmente und passt die Kapazität an die aktuelle Auslastung an. Diese Heuristik erreichte 15,76 Millionen Dollar und schlug damit fast jedes KI-Modell. Die Forscher schätzen die theoretische Obergrenze für erreichbare Einnahmen auf etwa 2,2 Milliarden Dollar. Selbst die besten Agenten bleiben also extrem weit davon entfernt.

Warum Exploration Vorsicht schlägt

Die Analyse der Entscheidungsverläufe zeigt klare Verhaltensunterschiede. GPT-5.5 und Claude Opus 4.8 probieren weiterhin neue Strategien aus, wenn sich die Bedingungen ändern. Sie erhöhen die Kundenakquise, passen Tarife an oder verschieben Budgets für Support und Forschung. Claude Opus 4.7 reagiert auf Rückschläge hingegen meist mit Kostensenkung und Kapitalerhalt. Diese passive Strategie lässt das Modell zwar überleben, verhindert aber Profitabilität.

Interessanterweise erreichen Opus 4.8 und GPT-5.5 ähnliche Ergebnisse durch sehr verschiedene Wege. Opus 4.8 gewinnt früh viele Kunden, verliert sie aber in der Mitte der Simulation. GPT-5.5 hält seine Kundenbasis durchgehend stabil. Beide schreiben erstaunlich anspruchsvollen Code. Opus 4.8 baut eine interne Simulation, die Kundenkohorten modelliert und zukünftige Cashflows vorhersagt. GPT-5.5 durchsucht die Verhandlungshistorie in der Datenbank nach versteckten Kundenpräferenzen.

Vier Fähigkeiten entscheiden über Erfolg

Die Forscher identifizieren vier Fähigkeiten, die mit Erfolg korrelieren. Erstens das Aufdecken versteckter Informationen: Welcher Werbekanal funktioniert für welches Kundensegment? Zweitens die Vorhersage der Zukunft, gemessen am Fehler bei vierwöchigen Cash-Prognosen. Drittens die schnelle Anpassung an Veränderungen, gemessen daran, wie schnell ein Modell die Aktion eines Konkurrenten bemerkt. Viertens die vorausschauende Planung, gemessen an der Häufigkeit von Wenn-Dann-Szenarien in den Notizen des Agenten.

In allen vier Punkten schneiden Opus 4.8 und GPT-5.5 überdurchschnittlich ab. Zudem testeten die Forscher Claude Opus 4.7 mit Claude Code und GPT-5.5 mit Codex, zwei verbreiteten Programmierassistenten. In beiden Fällen handelten die Agenten seltener und schnitten schlechter ab. Die Forscher vermuten, dass die System-Prompts dieser Werkzeuge, die auf Softwareentwicklung optimiert sind, die Ursache sind.

Was CEO-Bench für die KI-Entwicklung bedeutet

Die Ergebnisse zeichnen ein klares Bild. KI-Modelle werden bei isolierten Einzelaufgaben zunehmend besser. Die strategische Steuerung eines Unternehmens über lange Zeiträume bleibt jedoch eine grundsätzlich andere Herausforderung. Die Lücke zwischen lokaler Werkzeugkompetenz und der Fähigkeit, Handlungen über lange Zeiträume zu einer kohärenten Strategie zu verknüpfen, ist erheblich. KI-Modelle betrügen bekanntermaßen bei Tests, was CEO-Bench zusätzlich erschwert.

Der Vergleich mit der regelbasierten Heuristik ist besonders aufschlussreich. Wenn eine einfache Strategie ohne jegliche Intelligenz die meisten KI-Modelle schlägt, dann liegt das Problem nicht bei der Einzelaufgabe. Es liegt bei der Koordination vieler Entscheidungen zu einem Gesamtbild. Genau das ist die Fähigkeit, die menschliche CEOs ausmacht. Steve Jobs berühmtes Vier-Felder-Raster von 1997 war keine komplexe Analyse. Ähnlich wie KI-Agenten bei Verhandlungen menschliche Gegenüber übertrumpfen, zeigt CEO-Bench jedoch, dass strategische Führung eine ganz andere Dimension ist. Es war eine strategische Entscheidung, die Apple vor dem Bankrott rettete.

Außerdem zeigt die Studie, dass kürzere Zeiträume das Problem nicht lösen. Selbst bei einer auf 50 Tage komprimierten Simulation schaffte es nur GPT-5.5 mit Gewinn ins Ziel. Die meisten Modelle bleiben laut den Autoren auch bei kürzeren Horizonten schwach darin, Entscheidungen auch nur kurzfristig zu koordinieren. CEO-Bench macht damit deutlich: Die nächste Herausforderung für KI-Agenten ist nicht mehr Können, sondern Zusammenhalten.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.