Richard Sutton hat das Reinforcement Learning mitbegründet. Jetzt verlässt der Turing-Preisträger John Carmacks Startup und gründet Oak Lab in Toronto. Sein Urteil über den Zustand der KI-Industrie ist vernichtend: Aktuelle Methoden seien «schwach und ineffizient» und brauchten «keine kleinen Verbesserungen, sondern grundlegend neue Ideen».
Suttons Diagnose: Deep Learning reicht nicht
Der Mann, der 2019 mit seinem Essay «The Bitter Lesson» die gesamte KI-Welt prägte, hält nicht viel vom aktuellen Kurs der Branche. Sein Punkt: Heutige Modelle lernen aus kuratierten Datensätzen, die Menschen zusammengetragen, bereinigt und gefiltert haben. Echte Intelligenz entsteht aber aus Erfahrung im Moment, nicht aus einer eingefrorenen Momentaufnahme des Internets. Deshalb nennt Sutton aktuelle Deep-Learning-Methoden «schwach und ineffizient». Sie bräuchten keine Anpassungen, sondern einen Neuanfang.
Dabei geht es nicht um Nostalgie. Sutton argumentiert strukturell: Der Standard-Optimierer SGD und seine Verwandten wie Adam verteilen Fehler über alle Parameter. Sie können nicht zwischen echtem Signal und Rauschen unterscheiden. Das Ergebnis ist ein System, das Muster auswendig lernt, aber sie nicht wirklich versteht.
NetworkIDBD: Lernen, was wirklich zählt
Oak Labs Lösung heißt NetworkIDBD, eine Weiterentwicklung von Suttons altem IDBD-Algorithmus für neuronale Netze. Der Kerngedanke: Statt alle Parameter gleich zu behandeln, belohnt NetworkIDBD nur die Signale, die tatsächlich etwas vorhersagen. In Tests lernt der Algorithmus echte Muster dort, wo SGD im Rauschen erstickt. Außerdem braucht er keine gespeicherten Daten oder Replay-Buffer. Er lernt Schritt für Schritt aus einem fortlaufenden Erfahrungsstrom.
Damit steht Oak Lab für einen grundlegend anderen Ansatz: KI soll nicht einmal trainiert und dann eingefroren werden, sondern kontinuierlich aus Echtzeit-Erfahrung lernen. Sutton nennt das «Big World Hypothesis». Die Welt sei zu groß, als dass ein Modell alles vorab lernen könne. Vielmehr müsse ein intelligentes System sich anpassen, während es läuft.
20 Watt: Das Gehirn als Vorbild
Das ehrgeizigste Ziel von Oak Lab liest sich wie Science-Fiction: ein Agent mit einer Billion Parametern, der in Echtzeit lernt und plant und dabei nur 20 Watt verbraucht. Zwanzig Watt entsprechen ungefähr dem Energiebedarf des menschlichen Gehirns. Heute trainieren Frontier-Modelle in Rechenzentren, die Megawatt schlucken, und stehen danach still. Sutton will ein System, das nie aufhört zu lernen, mit einem Bruchteil der Energie.
Dabei ist Sutton nicht allein mit seiner Skepsis gegenüber dem Skalierungs-Paradigma. Yann LeCun, ebenfalls Turing-Preisträger, setzt eine Milliarde Dollar auf World Models statt auf größere Chatbots. David Silver, der AlphaGo miterschaffen hat, setzt ebenfalls auf einen anderen Weg. Alle drei teilen die Überzeugung, dass eine Maschine lernen muss wie ein Kind: aus Erfahrung, nicht aus einem eingefrorenen Daten-Schnappschuss.
Was Oak Lab für die KI-Industrie bedeutet
Das Timing passt. Der KI-Wettlauf hat sich leise von der Frage nach dem größten Modell zur Frage nach Kosten und Effizienz verschoben. Rechenzentren explodieren, Energieverbrauch wächst, und die Investitionen erreichen astronomische Höhen. Suttons Ansatz verspricht das Gegenteil: mehr Intelligenz mit weniger Ressourcen.
Dabei bleibt offen, ob Oak Lab dieses Versprechen einlösen kann. Das Unternehmen steckt in den frühesten Phasen. Sutton und Khurram Javed haben Keen Technologies verlassen, um «einen leicht anderen Weg zum Verständnis von Intelligenz» zu verfolgen. Doch Sutton setzt seinen gesamten Ruf auf diese Karte. Er hat das Lehrbuch zum Reinforcement Learning geschrieben. Er hat die University of Albertas RL-AI-Lab gegründet. Wenn jemand die Glaubwürdigkeit hat, die KI-Branche zum Umdenken aufzufordern, dann er.
Die Zukunft der KI sieht laut Sutton weniger aus wie ein größeres Gehirn in einem größeren Rechenzentrum und mehr wie ein kleines, das nie aufhört zu lernen.