Gemini Robotics ist eine Modellfamilie von Google DeepMind, die künstliche Intelligenz mit Robotern verbindet. Sie soll Maschinen nicht nur Sprache und Bilder verstehen lassen, sondern daraus auch Handlungen in der realen Welt ableiten.
Die 2025 vorgestellte Technik basiert auf sogenannten Vision-Language-Action-Modellen. Sie verknüpfen visuelle Wahrnehmung und sprachliche Anweisungen mit Bewegungsbefehlen. Roboter können dadurch beispielsweise Gegenstände erkennen, greifen und auf Veränderungen ihrer Umgebung reagieren.
Mit Gemini Robotics 2 wurde das Konzept 2026 erweitert. Das Modell kann auch humanoide Roboter vom Fuß bis zu den Händen steuern und komplexere Aufgaben über mehrere Schritte planen. Ergänzend übernimmt Gemini Robotics ER 2 räumliches Verständnis und übergeordnete Planung. Mehrere Roboter können damit auch gemeinsam an einer Aufgabe arbeiten.
Besonders wichtig ist die Sicherheit. Sobald KI physisch handelt, können Fehlentscheidungen unmittelbare Folgen haben. DeepMind entwickelt deshalb zusätzliche Mechanismen, die unsichere Aktionen erkennen, stoppen oder menschliche Hilfe anfordern sollen.