Das Unternehmen Google DeepMind hat offiziell die Einführung einer neuen Generation von künstlicher Intelligenz für die Robotik angekündigt – der Modellfamilie Gemini Robotics 2. Dieses Update markiert den Übergang von einfachen automatisierten Bewegungen zu komplexen kognitiven Prozessen in der physischen Welt. Die Entwickler bezeichnen diese Technologie als „physisches AGI' (Allgemeine Künstliche Intelligenz), deren Hauptziel die Schaffung eines universellen Roboters ist, der in der Lage ist, eine breite Palette von Haushalts- und Produktionsaufgaben zu erfüllen.
„Verkörperte Reflexion' und Echtzeitverarbeitung
Die Schlüsselinnovation ist das Modell Gemini Robotics ER 2, das für die Funktion der „verkörperten Reflexion' (embodied reasoning) verantwortlich ist. Der Algorithmus kann den Videostream der Roboter-Kameras in Echtzeit analysieren und integriert sich dabei mit der Gemini Live API. Dies ermöglicht es Maschinen, den Fortschritt der Aufgabenerfüllung schrittweise zu verfolgen und Fehler eigenständig zu korrigieren, ohne den gesamten Prozess neu starten zu müssen.
Laut den Entwicklern wird das System, falls ein Roboter ein Objekt versehentlich fallen lässt, die Bewegung sofort korrigieren, anstatt die Aktion von vorne zu beginnen. Die Genauigkeit bei der Bestimmung der entscheidenden Momente von Aktionen hat fast 90 Prozent erreicht. Dies ermöglicht es dem Roboter, Nuancen zu verstehen, zum Beispiel den genauen Zeitpunkt zu bestimmen, an dem er aufhören muss, Kaffee in eine Tasse zu gießen, um kein Flüssigkeit zu verschütten.
Verbesserte Koordination und Teamarbeit
Das Modell Gemini Robotics 2 wandelt textliche und visuelle Befehle in unmittelbare Bewegungen mechanischer Gliedmaßen um. Ein erheblicher Fortschritt wurde bei der Steuerung komplexer humanoider Hände mit vielen Fingern erzielt: Die neue Version des Systems gewährleistet eine beispiellose Präzision und Koordination.
Besonderes Augenmerk wurde auf die Fähigkeit der Roboter zur Interaktion gelegt. Während der Tests zeigten die Modelle Apollo 2 und Franka F3 Duo die Fähigkeit, Aufgaben gemeinsam auszuführen, ohne sich gegenseitig zu behindern, und verteilten die Rollen im Team effektiv.
Autonomie und schnelle Anpassung
Um den Betrieb unter Bedingungen ohne Internetzugang zu gewährleisten, wurde eine leichtgewichtige Version vorgestellt – Gemini Robotics On-Device 2. Sie kann lokal direkt auf dem Gerät funktionieren, ohne Verbindung zu Cloud-Servern.
Das System zeichnet sich durch eine hohe Lerngeschwindigkeit aus. Der Algorithmus passt sich einer neuen Roboter-Konstruktion innerhalb weniger Stunden des Trainings an oder basierend auf der Analyse von nur 200 Beispielen. Derzeit werden die Technologien bereits an der Ausrüstung des Unternehmens Boston Dynamics getestet.
Sicherheit und Schutz vor Halluzinationen
Die Entwickler haben die Risiken, die mit KI-Fehlern verbunden sind, berücksichtigt und spezielle Schutzstufen gegen „Halluzinationen' und falsche Aktionen implementiert. Zusammen mit dem Release wurde ein neuer Sicherheits-Benchmark namens ASIMOV-Agentic vorgestellt. Das Modell ER 2 zeigt eine hohe Fähigkeit, potenzielle Gefahren zu erkennen und die Bewegung zu stoppen, wenn sich ein Mensch zu nahe an den Arbeitsbereich bewegt.
Zusammen mit den technischen Spezifikationen hat Google auch die Preispolitik für die neue Entwicklung veröffentlicht und damit den Weg für die kommerzielle Einführung dieser Technologien geebnet.