ByteDance EdgeBench: Das neue Skalierungsgesetz für KI-Agenten

von Marcel Buchholz 04. Juli 2026 3 Min. Lesezeit News, Software & Entwicklung

Die KI-Industrie steht vor einer unangenehmen Wahrheit: Mehr Daten und mehr Rechenleistung bringen nicht mehr das, was sie einst versprachen. Das klassische Pre-Training-Skalierungsgesetz stößt an seine Grenzen. Doch ByteDance, der Mutterkonzern von TikTok, hat jetzt eine Entdeckung veröffentlicht, die den Weg aus dem Dilemma weisen könnte. Denn das Team hinter EdgeBench fand ein neues Skalierungsgesetz für KI-Agenten, das auf etwas völlig anderem beruht als auf bloßer Modellgröße.

EdgeBench: 38.000 Stunden zeigen den Weg

Das Forschungsteam von ByteDance Seed stellte diese Woche EdgeBench vor, einen Benchmark mit 134 realen Aufgaben. Dabei handelt es sich nicht um kurze Chat-Anfragen, sondern um komplexe, langfristige Aufgaben. Jede Aufgabe erfordert mindestens 12 Stunden ununterbrochener KI-Agent-Arbeit. Der durchschnittliche menschliche Aufwand pro Aufgabe liegt bei 57,2 Stunden. Die Kategorien reichen von Softwareentwicklung über wissenschaftliche Analysen bis hin zu formaler Mathematik.

Dabei analysierten die Forscher insgesamt 38.000 Stunden an Interaktionen zwischen KI-Agenten und ihrer Umgebung. Zu den getesteten Modellen gehörten Anthropics Claude Opus 4.8, OpenAIs GPT 5.5 und GPT 5.4 sowie Modelle von Zhipu AI und DeepSeek. Die Ergebnisse zeigen eine klare mathematische Gesetzmäßigkeit.

Verdopplung alle drei Monate

Die zentrale Erkenntnis: KI-Agenten verdoppeln ihre Lerngeschwindigkeit ungefähr alle drei Monate, wenn sie über längere Zeiträume hinweg mit realen Umgebungen interagieren. Das Improvement folgt dabei einer log-sigmoiden Kurve, die langsam beginnt, in der Mitte beschleunigt und sich schließlich einem Plateau nähert. Allerdings ist dieses Plateau nicht fest, sondern hängt von der Art der Aufgabe ab.

Kritisch ist dabei ein Unterschied: Agenten, die Erfahrungen sammeln und wiederverwenden, verbessern sich kontinuierlich. Agenten, die einfach nur Aufgaben wiederholen, ohne zu lernen, zeigen kaum Fortschritt. Das bedeutet, dass nicht bloße Wiederholung den Unterschied macht, sondern die Fähigkeit, aus Interaktionen zu lernen und dieses Wissen zu strukturieren.

Warum das herkömmliche Skalierungsgesetz ausläuft

Bisher galt in der KI-Welt eine einfache Regel: Mehr Parameter, mehr Daten, mehr Rechenleistung führen zu besseren Modellen. Diese Pre-Training-Skalierung hat von GPT-3 bis zu den aktuellen Frontier-Modellen funktioniert. Doch das Institut Epoch AI warnt bereits, dass öffentlich verfügbare, von Menschen erzeugte Textdaten in wenigen Jahren erschöpft sein könnten.

OpenAI-Mitgründer Andrej Karpathy hat ebenfalls öffentlich darauf hingewiesen, dass dieser brute-force-Ansatz nicht ewig weitergeht. Zuckerberg gab diese Woche zu, dass Metas KI-Agenten langsamer vorankommen als erhofft. EdgeBench argumentiert nun, dass Pre-Training die falsche Maßeinheit für die nächste Wettbewerbsphase ist.

Deployment wird zum Forschungs-Hebel

Daraus ergibt sich eine weitreichende Konsequenz: Jede Stunde, die ein KI-Agent in einer realen Unternehmensumgebung verbringt, ist nicht nur abrechenbare Zeit. Sie ist gleichzeitig Trainingsdaten für die nächste Generation von Fähigkeiten. Deployment und Forschung verschmelzen damit zu einem einzigen Prozess. Wer seine Agenten länger und intensiver in echten Szenarien einsetzt, baut einen kumulativen Vorteil auf.

Das erklärt auch, warum Unternehmen wie AWS mit einer Milliarde Dollar für Frontier Deployment Environments und Microsoft mit 2,5 Milliarden Dollar für Frontier Enterprise-Infrastruktur so massive Investitionen tätigen. Beide setzen nicht nur auf den Verkauf von KI-Dienstleistungen. Sie bauen die Infrastruktur, in der Agenten lernen können.

Was EdgeBench für die KI-Strategie bedeutet

EdgeBench ist ein erster empirischer Beweis dafür, dass KI-Fortschritt nicht allein von größeren Trainingsläufen abhängt. Vielmehr gewinnt derjenige, der Agenten am längsten und intensivsten in realen Umgebungen betreibt. ByteDance hat 51 der 134 Aufgaben sowie das gesamte Evaluationsframework als Open-Source veröffentlicht, damit andere Labore die Ergebnisse überprüfen können.

Für Unternehmen heißt das: KI-Agenten nicht nur einzusetzen, sondern sie systematisch lernen zu lassen, wird zum Wettbewerbsvorteil. Die Agenten, die heute noch Fehler machen, könnten in wenigen Monaten genau diese Fehler vermeiden, wenn sie die Erfahrungen strukturieren und zurückführen können. Das neue Skalierungsgesetz legt nahe, dass der KI-Boom kein Ende nimmt, sondern nur seine Form ändert.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.