Ein Anthropic-Mitarbeiter hat seit fünf Monaten keine Zeile Code mehr geschrieben. Nicht, weil die Arbeit fehlt, sondern weil Claude das erledigt. Über 90 Prozent des Codes, der heute in Anthromics Produktionscodebase landet, stammt von der eigenen KI. Das Unternehmen veröffentlicht erstmals interne Daten, die zeigen, wie weit die rekursive Selbstverbesserung bereits fortgeschritten ist.
8x mehr Code pro Entwickler
Die Zahlen aus dem neuen Anthropic Institute Bericht sind beachtlich. Im zweiten Quartal 2026 liefern Anthropic-Entwickler im Durchschnitt achtmal so viel Code pro Tag wie noch 2024. Der Anteil von Claude an diesem Code stieg von niedrigen einstelligen Prozenten auf über 80 Prozent im Produktionsbereich. Zählt man Skripte und experimentellen Code hinzu, liegt der Anteil sogar bei mehr als 90 Prozent.
Allerdings räumt Anthropic ein, dass reine Codezeilen ein unvollkommener Maßstab sind. Die Verachtfachung sei fast sicher eine Überschätzung des tatsächlichen Produktivitätsgewinns. Eine interne Umfrage unter 130 Mitarbeitern im März 2026 ergab einen geschätzten Produktivitätsschub von 4x durch das Mythos Preview Modell. Anthropic selbst hält den echten Wert für etwas niedriger und verweist auf METR-Forschung, die zeigt, dass Entwickler KI-Produktivitätsgewinne häufig überschätzen.
Code-Qualität erreicht menschliches Niveau
Bis Ende 2025 war Claude-geschriebener Code noch etwas schlechter als menschlicher. Heute befindet er sich auf Augenhöhe, und Anthropic erwartet, dass er noch in diesem Jahr deutlich besser wird. Ein automatisierter Claude-Reviewer würde retrospektiv etwa ein Drittel der Fehler gefunden haben, die vergangene Ausfälle auf claude.ai verursacht haben.
Zudem lieferte Claude im April 2026 über 800 Fixes, die eine bestimmte Klasse von API-Fehlern um den Faktor 1.000 reduzierten. Ein Mensch hätte dafür vier Jahre benötigt, so der verantwortliche Ingenieur. Die Erfolgsquote bei komplexen Aufgaben stieg innerhalb von sechs Monaten um 50 Prozentpunkte auf 76 Prozent im Mai 2026.
Aufgaben-Horizont verdoppelt sich alle vier Monate
Die Zeitspanne, die eine KI selbstständig bearbeiten kann, verdoppelt sich aktuell etwa alle vier Monate. Im März 2024 bewältigte Claude Opus 3 noch Aufgaben im Bereich von vier Minuten. Ein Jahr später schaffte Claude Sonnet 3.7 anderthalb Stunden. Claude Opus 4.6 kommt heute auf zwölf Stunden. METR stellte fest, dass Mythos Preview mindestens 16 Stunden durchhält.
Hält der Trend an, könnten Tagesaufgaben noch dieses Jahr in Reichweite geraten. Aufgaben, die eine Woche dauern, folgten demnach 2027. Das hat gravierende Konsequenzen für die Arbeitswelt und die KI-Sicherheitsforschung.
Der Widerspruch: Selbstverbesserung und Pausen-Knopf
Was den Bericht besonders bemerkenswert macht, ist die Begleitbotschaft. Gleichzeitig mit den internen Daten veröffentlicht Anthropic einen Aufruf für einen überprüfbaren, globalen Pausenmechanismus für KI-Entwicklung. Das Unternehmen warnt: Rekursive Selbstverbesserung, bei der eine KI vollkommen autonom ihren eigenen Nachfolger entwirft und trainiert, ist noch nicht erreicht. Aber sie könnte früher kommen, als die meisten Institutionen vorbereitet sind.
Der Engpass liegt laut Anthropic bei der sogenannten Research Taste. Also der Fähigkeit, die richtigen Probleme auszuwählen und Sackgassen früh zu erkennen. Hier liegt der vergleichende Vorteil von Menschen noch immer beim großen Ganzen und beim Denken über die Grenzen der unmittelbaren Aufgabe hinaus. Ob heutige Trainingsmethoden und Architekturen diese Fähigkeit überhaupt erschließen können, bleibt offen.
GitHub unter Druck
Die Auswirkungen sind bereits sichtbar. GitHub verzeichnete 2025 rund eine Milliarde Code-Commits. Mitte 2026 sind es bereits 275 Millionen pro Woche, was auf 14 Milliarden im Jahr hochgerechnet wird. Claude Code allein ist für 4,5 Prozent aller öffentlichen Commits auf GitHub verantwortlich. GitHubs COO erklärte, das Unternehmen müsse extrem hart an der Kapazität arbeiten, um Schritt zu halten.
Innerhalb von Anthropic hat sich der Flaschenhals bereits verschoben. Weil Claude so viel Code produziert, wird menschliche Code-Überprüfung zum limitierenden Faktor. Das Unternehmen setzt mittlerweile auf automatisierte Claude-Reviewer, die jeden vorgeschlagenen Code prüfen, bevor er in die Produktion geht.
Die zentrale Frage bleibt: Wenn KI bereits über 90 Prozent ihres eigenen Codes schreibt und sich selbst verbessert, wer kontrolliert dann die Kontrolleure? Anthropic fordert einen Pausen-Knopf für die Welt. Ob die Welt ihn rechtzeitig drückt, ist eine andere Frage.