KI trainiert sich selbst: Amazon A-Evolve korrigiert eigene Fehler

von Marcel Buchholz 27. Juni 2026 5 Min. Lesezeit News

Eine autonome KI hat erstmals ein 30-Milliarden-Parameter-Modell ohne menschliches Eingreifen trainiert. Das System erkannte dabei, dass sein eigener Bewertungsmaßstab fehlerhaft geworden war, und änderte eigenständig seine Suchstrategie. Der Durchbruch stammt von Amazons A-EVO-Lab und wirft fundamentale Fragen zur Zukunft der KI-Entwicklung auf.

Was ist A-Evolve und warum es die KI-Welt bewegt

Das Forscherteam von Amazons A-EVO-Lab hat ein System namens A-Evolve vorgestellt, das einen kompletten Post-Training-Lauf völlig autonom durchführte. Über vier Runden und mehrere Wochen hinweg trainierte die KI ein 30-Milliarden-Parameter-NVIDIA-Nemotron-Modell, ohne dass ein Mensch eingriff. Das Ergebnis landete auf Platz 8 von rund 4.000 Einreichungen auf der öffentlichen Nemotron-Reasoning-Challenge-Rangliste und erzielte einen Score von 0,86 gegen den besten menschlichen Beitrag mit 0,87.

Bisherige Demonstrationen autonomer KI-Forschung operierten im Maßstab von GPT-2, also rund 124 Millionen Parameter. Dort kostet ein einzelner Durchlauf Minuten und ein Fehlversuch ist billig zu wiederholen. Zudem reicht ein einziges GPU aus. A-Evolve hingegen arbeitet auf einer Skala, die um das 240-fache größer ist. Jeder Trainingslauf dauert Tage, der gesamte Durchlauf beansprucht Multi-H200-GPU-Kubernetes-Cluster über Wochen. Dieser Sprung von der Spielwiese zur Frontlinie ist nicht nur quantitativ, sondern qualitativ ein völlig neues Problemfeld.

Drei Design-Entscheidungen die den Unterschied machen

Das Team identifizierte drei architektonische Entscheidungen, die den autonomen Loop bei Frontline-Skala überleben lassen. Erstens ein unveränderlicher Referenz-Substrat: Jede Runde startet vom selben geprüften Trainingsstack, der nie überschrieben wird. Das garantiert Vergleichbarkeit über Runden hinweg. Wenn jeder Trainingslauf Wochen an Rechenzeit kostet, würde ein Rezept, das den Substrat mit Teilergebnissen einer vorherigen Runde kontaminiert, jeden nachfolgenden Vergleich ungültig machen.

Zweitens homogene, speicherlose Worker: Das System setzte anfangs auf spezialisierte Agenten, die Zwischenergebnisse aneinander weitergaben. Dieser Ansatz scheiterte kläglich, weil sich ungewollte Varianz aufschaukelte und das Signal, von dem die Auswahl abhängt, korrumpiert wurde. Stattdessen erzeugte jede Runde acht identische Worker, die unabhängig voneinander starteten. Kein Gedächtnis wird zwischen Runden weitergegeben, nur die Suchstrategie wird gefördert.

Drittens die rundenspezifische Evidenz-Aggregation: Feedback kommt erst nach einer gesamten Runde, nicht in Echtzeit. Nur die Suchstrategie wird aktualisiert, nicht das Modell selbst. Dieser Ansatz verhindert, dass sich Fehler über Runden hinweg kumulieren und ermöglicht saubere Vergleiche zwischen verschiedenen Lösungsansätzen.

Der eigentliche Durchbruch: Selbstkorrektur auf Meta-Ebene

Der bemerkenswerteste Moment des gesamten Experiments war nicht die Platzierung auf der Rangliste. Vielmehr entdeckte das System während des Laufs, dass sein interner Bewertungsmaßstab nicht mehr mit der externen Leistung korrelierte. Die Kandidaten optimierten die interne Metrik auf Rekordwerte, ohne dass sich die externe Zielmetrik verbesserte. Anstatt blind weiterzuoptimieren, änderte A-Evolve seine Suchstrategie radikal: Es suchte nicht länger nach Interventionen, die die interne Metrik maximierten, sondern nach solchen, die die nun irreführende Metrik senkten und gleichzeitig die externe Leistung verbesserten.

Die Autoren sehen darin direkten, überprüfbaren Beweis dafür, dass ein skalierter autonomer Loop nicht nur optimieren, sondern entdecken kann. Das System erkannte, dass sein eigener Messrahmen irreführend geworden war, und änderte eigenständig, was als Beweis galt. Diese Fähigkeit zur Selbstkorrektur auf Meta-Ebene geht deutlich über einfache Optimierung hinaus. Es ist der Unterschied zwischen einem System, das besser wird, weil es ein vorgegebenes Ziel verfolgt, und einem System, das erkennt, dass das Ziel selbst falsch gesetzt ist.

Was bedeutet das für die KI-Forschung?

Die Implikationen sind weitreichend. Wenn ein autonomes System seinen eigenen Bewertungsmaßstab hinterfragt und korrigiert, bewegen wir uns von der reinen Optimierung hin zur echten Entdeckung. Bisher war Post-Training die Domäne menschlicher Forschungsteams, die über Wochen hinweg Daten und Rezeptänderungen vorschlugen, Runs starteten und Ergebnisse bewerteten. A-Evolve schließt diesen Loop ohne menschliches Eingreifen und demonstriert, dass die teuerste Phase der KI-Entwicklung prinzipiell automatisierbar ist.

Gleichzeitig warnt das Team vor übertriebener Euphorie. Das System funktionierte bei 30 Milliarden Parametern konkurrenzfähig. Bei 120 und 550 Milliarden Parametern konnte der Loop zwar geschlossen werden, jedoch ohne vergleichbare menschliche Baseline fehlt der Nachweis der Wettbewerbsfähigkeit dort. Die Autoren betonen ausdrücklich: Dies ist ein Datenpunkt, kein Beweis, dass autonome KI-Entwicklung den Menschen bereits übertrifft.

Rekursive Selbstverbesserung rückt näher

Die Arbeit liefert dennoch einen konkreten Meilenstein in der Debatte um rekursive Selbstverbesserung. Das Autorenteam argumentiert, dass jedes System, das das Label verdient, irgendwann End-to-End-Post-Training eines Frontier-Modells beherrschen muss. A-Evolve ist der erste öffentlich dokumentierte Datenpunkt, der diese Messlatte nimmt.

Die praktischen Konsequenzen könnten gravierend sein. Wenn autonome Systeme den teuersten Teil der KI-Entwicklung übernehmen können, sinken die Kosten für Modellverbesserungen dramatisch. Große KI-Labore könnten ihre Post-Training-Pipelines beschleunigen, während kleinere Akteure Zugang zu Methoden erhalten, die bisher nur Teams mit enormen Ressourcen offenstanden.

Gleichzeitig stellt sich die Frage nach der Kontrolle: Wenn ein System seine eigenen Bewertungskriterien ändern kann, wer überwacht die Überwacher? Die Autoren selbst weisen darauf hin, dass ein autonomer Loop, der seine eigene Erfolgsmetrik neu definiert, fundamentale Fragen zur Sicherheit und Steuerbarkeit aufwirft. Die Fähigkeit zur Selbstkorrektur ist ein Fortschritt, aber sie bedeutet auch, dass menschliche Aufsicht an einer entscheidenden Stelle ersetzt wird.

Die nächsten Schritte

Das A-Evolve-Team hat bereits signalisiert, dass die Arbeit bei größeren Modellen weitergeht. Die Tatsache, dass der Loop auch bei 120 und 550 Milliarden Parametern geschlossen werden konnte, auch ohne menschliche Baseline zum Vergleich, zeigt, dass die Infrastruktur funktioniert. Die entscheidende Frage bleibt jedoch: Wird die autonom erzeugte Qualität auch bei diesen Skalen mit menschlichen Teams konkurrieren können?

Für die KI-Community ist die Arbeit ein Weckruf. Bisher galt Post-Training als Kunstform, die menschliche Intuition und Erfahrung erfordert. Wenn Maschinen diesen Prozess übernehmen können, verschiebt sich die Wertschöpfung in der KI-Entwicklung grundlegend. Die Kompetenz, autonome Systeme zu steuern und zu überwachen, wird wichtiger als die Fähigkeit, Modelle manuell zu trainieren.

Die vollständige Studie ist auf arXiv einsehbar. Amazons A-EVO-Lab hat zudem die Projektdetails auf der offiziellen Projektseite veröffentlicht. Ergänzend berichtet TechTimes über die Ergebnisse.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.