Google DeepMind stellt Gemini Robotics 2 vor, und zum ersten Mal steuert ein einziges KI-Modell einen humanoiden Roboter vom Fuß bis zur Fingerspitze. Der Schritt vom Bildschirm in die physische Welt ist damit deutlich näher gerückt. Was bedeutet das für die Robotik und wo liegen die Grenzen?
Drei Modelle, ein System
Gemini Robotics 2 ist kein Einzelmodell, sondern ein Drei-Komponenten-System. Das Kernstück ist die Vision-Language-Action-Model-Variante, die visuelle und sprachliche Eingaben in Motorsteuerung umwandelt. Der Roboter versteht, was er sieht, und setzt Befehle in Bewegung um. Zusätzlich übernimmt Gemini Robotics ER 2 die höheren Denkprozesse: Planung, Kommunikation mit Menschen und Koordination mehrerer Schritte. Das dritte Modell, On-Device 2, läuft lokal ohne Internetverbindung und passt sich innerhalb weniger Stunden an völlig neue Roboterplattformen an.
Diese Architektur löst eines der ältesten Probleme der Robotik. Bisher brauchte jeder Roboter eigene Programmierung für jede Aufgabe. Jetzt reicht ein einziges System, um verschiedene Maschinentypen zu steuern, von humanoiden Zweibeinern bis hin zu Greifarmen auf Rädern.
Humanoid steuert den gesamten Körper
Der sichtbarste Fortschritt betrifft die Ganzkörpersteuerung. Apptroniks Apollo 2 Roboter führte eine Demo durch, die einfach klingt, aber enorme Koordination erfordert. Der Befehl lautete: Stell die Gießkanne in den grünen Behälter auf dem unteren Regalboden. Apollo ging zum Tisch, hob die Kanne auf, ging zu den Regalen, bückte sich und stellte sie präzise ab. Beine, Rumpf, Arme und Hände arbeiteten als Einheit.
Frühere Modelle steuerten nur den Oberkörper für Tisch-Aufgaben. Gemini Robotics 2 erweitert die Reichweite auf den kompletten Körper. Zudem zeigt das Modell verbesserte Fingerfertigkeit. Mit einer fünffingrigen, 22-Gelenk-Hand kann es Knoten binden und Ziplock-Tüten verschließen. Einfachere Zweifinger-Greifer auf anderen Plattformen werden ebenfalls unterstützt.
Multi-Roboter-Teamwork und schnelle Anpassung
Gemini Robotics ER 2 ermöglicht erstmals die Zusammenarbeit verschiedener Roboter. Ein Radfahrzeug und ein humanoider Roboter können eine Aufgabe aufteilen. Der ER 2 fungiert als zentrale Planungseinheit, die Aufgaben verteilt und den Fortschritt überwacht. Er kann auch Werkzeuge wie die Google-Suche aufrufen und einen Boston Dynamics Spot Roboter losschicken, um einen Snack zu holen.
Besonders bemerkenswert ist die Anpassungsfähigkeit des On-Device-Modells. Mit weniger als 200 Beispielen und wenigen Stunden Training lernt es, völlig neue Roboterplattformen zu steuern. Das schließt Maschinen mit drastisch unterschiedlichen Formen, Sensoren und Freiheitsgraden ein. Dexmate, SO101 und Trossen wurden als Testplattformen genannt.
Realitätscheck: Noch lange nicht perfekt
DeepMind ist ungewöhnlich offen über die Schwächen. Die Zahlen sprechen eine klare Sprache. Das System schraubt eine Glühbirne in 92 Prozent der Fälle ein. Feinmotorische Aufgaben gelingen jedoch deutlich seltener. Das Zuknoten eines Müllbeutels klappt nur in 44 Prozent der Versuche, das Versiegeln einer Ziplock-Tasche sogar nur in 40 Prozent.
Außerdem sind die Roboter langsam. Sie halten inne, um Bewegungen zu planen, die Menschen ohne nachzudenken ausführen. Kanishka Rao, DeepMind-Direktor für Robotik, räumt ein, dass echte Fingerfertigkeit noch in weiter Ferne liegt. Roboter lernen deutlich weniger effizient als Menschen, die sich nach ein oder zwei Fehlern anpassen.
Sicherheit: ASIMOV-Benchmark für Roboter-KI
Mit zunehmender physischer Präsenz wachsen die Sicherheitsanforderungen. DeepMind veröffentlicht parallel den Benchmark ASIMOV-Agentic, der prüft, ob das Planungsmodell unsichere Befehle ablehnt, unmögliche Aufgaben erkennt und menschliche Hilfe anfordert. Der Name ist eine Hommage an Isaac Asimovs Robotergesetze.
ER 2 ist laut DeepMind das bisher sicherste Robotik-Modell. Es erkennt besser, wenn Menschen in der Nähe sind, löst Sicherheitsaufrufe aus und bringt den Roboter zum Stillstand, wenn sich jemand nähert. Das ist eine Voraussetzung für zukünftige Standards der Mensch-Roboter-Zusammenarbeit.
Hardware-Abhängigkeit als Schwachpunkt
Google liefert die Software, nicht die Hardware. Und genau hier liegt ein politisches Problem. Die USA haben kürzlich ein Verbot für künftige Verkäufe chinesischer Roboter aus Sicherheitsgründen erlassen. Viele der Maschinen, auf denen diese Software laufen könnte, werden in China gebaut. DeepMind arbeitet mit westlichen Partnern wie Apptronik, Boston Dynamics und Agile Robots zusammen, aber die Abhängigkeit von chinesischer Hardware bleibt ein branchenweites Risiko.
Demis Hassabis, CEO von DeepMind, vergleicht die Vision mit Android für Smartphones. Ein Betriebssystem für jeden Roboter, unabhängig vom Hersteller. Der Vergleich hinkt allerdings, weil Android auf einer einheitlichen Hardware-Architektur basiert. Die Roboterwelt ist deutlich fragmentierter.
Was bedeutet das für die Branche?
Gemini Robotics 2 markiert einen Wendepunkt. Zum ersten Mal steuert ein generalistisches KI-Modell einen humanoiden Roboter über den ganzen Körper, plant mehrstufige Aufgaben und lernt neue Formen innerhalb von Stunden. Die Konkurrenz von OpenAI und Nvidia arbeitet an ähnlichen Systemen.
Allerdings sind die Erfolgsquoten bei feinmotorischen Aufgaben noch ernüchternd. Zwischen 40 und 44 Prozent bei alltäglichen Handgriffen bedeuten, dass humanoide Roboter im Haushalt oder am Arbeitsplatz noch nicht einsatzbereit sind. Der Weg vom beeindruckenden Demo zur zuverlässigen Alltagsanwendung bleibt lang.