Gemini Robotics ER 2 ist das neueste Modell für verkörpertes Schlussfolgern von Google DeepMind, das am 30. Juli 2026 vorgestellt wurde und als „übergeordnetes Gehirn“ für Roboter fungiert – es verarbeitet Video-, Sprach- und Sensordaten, um mehrstufige Aufgaben zu planen, mehrere Roboter zu koordinieren und motorische Befehle an ein separates Aktionsmodell weiterzugeben. Es löst Gemini Robotics-ER 1.6 als DeepMinds leistungsfähigste Schlussfolgerungsebene für physische KI ab und ist ab heute über die Gemini-API, Google AI Studio sowie im Rahmen einer privaten Vorschau auf der Gemini Enterprise Agent Platform öffentlich verfügbar.
Dieser Leitfaden behandelt genau, was sich geändert hat, wie die Leistung ist, was es kostet und wie es im Vergleich zum Gemini Robotics ER 1.6 und den übrigen Modellen der Gemini Robotics-Produktfamilie abschneidet.
In diesem Artikel geht es um:
Was Gemini Robotics ER 2 ist und welche Rolle es als „Denkzentrum“ für Roboter mit hochentwickelten Schlussfolgerungsfähigkeiten spielt
Der Unterschied zwischen Vision-Language- (VLM) und Vision-Language-Action- (VLA) Modellen
Das Gemini Robotics-Ökosystem: ER 2, Robotics 2 und On-Device 2
Wichtige Verbesserungen gegenüber ER 1.6 (kontinuierliches Video, Echtzeit-Streaming, Zusammenarbeit mehrerer Roboter)
Wie ER 2 den Aufgabenfortschritt verfolgt und Fehler anhand von Live-Videodaten erkennt
Architektur und Orchestrierung: Wie ER 2 mit Tools, APIs und Robotersteuerungssystemen verbunden wird
Leistungsbenchmarks, Geschwindigkeitssteigerungen und Sicherheitsverbesserungen
Preisstruktur und Kostenvergleich mit ER 1.6
Anwendungsfälle aus der Praxis, einschließlich Multi-Roboter-Koordination und Demos von Boston Dynamics
Erste Schritte, einschließlich SDK, API-Zugriff und Entwickler-Workflow
Was ist Gemini Robotics ER 2?
Gemini Robotics ER 2 ist ein Vision-Language-Modell (VLM) und kein Vision-Language-Action-Modell (VLA) – das heißt, es gibt keine motorischen Befehle direkt aus. Stattdessen fungiert es laut dem offiziellen Ankündigungsbeitrag von Google DeepMind als Koordinator: Es beobachtet eine Szene anhand von kontinuierlichem Videomaterial, leitet daraus ab, was als Nächstes geschehen muss, kommuniziert mit Menschen in natürlicher Sprache und delegiert die physische Ausführung an ein untergeordnetes VLA-Modell oder eine Robotik-API.
Es ist eines von drei Modellen, die Google DeepMind am 30. Juli 2026 gemeinsam veröffentlicht hat:
Gemini Robotics 2 – das „Vision-Language-Action“-Modell (VLA), das Motoren direkt steuert, ist nun in der Lage, einen humanoiden Roboter am ganzen Körper zu steuern.
Gemini Robotics ER 2 – das in diesem Leitfaden behandelte Modell für verkörpertes Denken – ist ab sofort im Google AI Studio verfügbar.
Gemini Robotics On-Device 2 – ein effizientes VLA-Modell, das für die lokale Ausführung auf Roboterhardware ohne Internetverbindung entwickelt wurde – ist derzeit auf Early-Access-Partner beschränkt.
Was ist neu in Gemini Robotics ER 2 im Vergleich zu ER 1.6?
Google's developer blog post introducing the model, authored by DeepMind engineers Steven Hansen and Peng Xu, frames ER 2 as a "significant upgrade" over Gemini Robotics-ER 1.6 in three specific areas:
In dem Beitrag im Google-Entwicklerblog, in dem das Modell vorgestellt wird und der von den DeepMind-Ingenieuren Steven Hansen und Peng Xu verfasst wurde, wird ER 2 in drei konkreten Bereichen als „bedeutende Weiterentwicklung“ gegenüber Gemini Robotics-ER 1.6 beschrieben:
Kontinuierliche Videoauswertung. ER 1.6 stützte sich in erster Linie auf statische Momentaufnahmen. ER 2 beobachtet kontinuierliche Videostreams und kann so den Fortschritt der eigenen Aufgabe verfolgen und Fehler – Verschütten, Ausrutschen, Fehlausrichtungen – bereits während der Ausführung erkennen und nicht erst am Ende.
Echtzeit-Streaming über die Live-API. ER 2 lässt sich über einen bidirektionalen Streaming-Endpunkt, der für latenzempfindliche Aufgaben entwickelt wurde, in die Gemini Live API integrieren und beseitigt so die „Stop-and-Think“-Pausen, die frühere Schlussfolgerungsmodelle einschränkten.
Zusammenarbeit mehrerer Roboter. Zum ersten Mal können verschiedene Robotertypen über ein gemeinsames semantisches Verständnis kommunizieren und eine Aufgabe entsprechend den physischen Stärken jedes Roboters aufteilen – etwas, das weder ER 1.6 noch das ursprüngliche Gemini Robotics-ER unterstützten.
Architektur des Gemini Robotics ER 2
Architektonisch folgt Gemini Robotics ER 2 derselben zentralen Designphilosophie, die DeepMind bereits seit dem ursprünglichen Gemini Robotics-ER verfolgt: Es handelt sich um ein auf Gemini basierendes multimodales Modell, das auf räumliches Denken, Aufgabenplanung und Erfolgserkennung spezialisiert ist und über dem Motorsteuerungs-Stack angesiedelt ist.
Entwickler integrieren es, indem sie Low-Level-Steuerungsschnittstellen wie VLA-Modelle oder Navigations-APIs als aufrufbare Tools deklarieren und anschließend multimodale Video-, Audio- oder Textdaten direkt in das Modell streamen. ER 2 kann während seines Schlussfolgerungsprozesses zudem nativ externe Tools aufrufen, darunter die Google-Suche. Google hat funktionierende Beispiele für diese Konfiguration veröffentlicht, darunter eine Integration mit dem „Spot“ von Boston Dynamics, bei der ER 2 die Navigations- und Manipulator-APIs von Spot koordiniert, um auf einen Sprachbefehl hin autonom ein Objekt zu holen.
Benchmarks für den Gemini Robotics ER 2
DeepMind veröffentlichte anlässlich der Einführung konkrete, überprüfbare Leistungsdaten – ein bemerkenswertes Maß an Transparenz, da Entwickler das Modell so anhand realer Bewertungsdaten beurteilen können und nicht allein anhand von Marketingaussagen.
Fähigkeit | Ergebnis des Gemini Robotics ER 2 |
Fortschrittsklassifizierung (5-stufige Erfassung der Aufgabenbearbeitung) | 57,4 % Genauigkeit, womit es ER 1.6 und konkurrierende Frontier-Modelle übertrifft |
Moment-Ermittlung (genaue Bestimmung des Bildes, in dem ein Schlüsselereignis stattfindet) | 91,3 % Genauigkeit, 0,96 s mittlere absolute Entfernung |
Ausführungsgeschwindigkeit im Vergleich zu größeren Konkurrenzmodellen | Vergleichbare Genauigkeit bei etwa vierfacher Ausführungsgeschwindigkeit und einem Bruchteil der Rechenkosten |
Werkzeugkoordination (Modus „Real VLA“, „Simulated VLA“ und „Human Tele-Op“) | Übertrifft den ER-Wert von 1,6 in allen drei Betriebsmodi durchweg |
Einhaltung von Sicherheitsanweisungen und Abstand zu Personen | Beste Ergebnisse, die bisher für ein Modell von Gemini Robotics erzielt wurden, darunter das zuverlässige Anhalten eines Humanoiden, wenn sich eine Person zu nahe nähert |
Über diese Kernzahlen hinaus berichtet DeepMind auch von Fortschritten beim allgemeinen räumlichen Denkvermögen: Die Erkennung von Erfolg bzw. Misserfolg erfolgt nun anhand von Rohvideomaterial statt statischer Einzelbilder, und das Ablesen von Messgeräten wurde über einfache Skalen hinaus auf digitale Anzeigen, lineare Skalen, Lineale und Flüssigkeitsthermometer ausgeweitet, wobei zehn verschiedene Gerätetypen getestet wurden. Die vollständige Methodik ist im technischen Sicherheitsbericht „Gemini Robotics 2“ von DeepMind nachzulesen.
Preis des Gemini Robotics ER 2 und Preis des Gemini Robotics ER 1.6
Im Gegensatz zu einigen Robotikplattformen für Unternehmen, bei denen ein Verkaufsgespräch erforderlich ist, sind die Preise für den Gemini Robotics ER 2 transparent auf der offiziellen Gemini-API-Preisseite von Google aufgeführt – derselben Seite, auf der auch alle anderen Gemini-Modelle aufgeführt sind.
Modell | Standardeingabe (pro 1 Mio. Token) | Standardausgabe (pro 1 Mio. Token) | Zwischengespeicherte Eingabe |
Gemini Robotics ER 2 – Vorschau | 2,00 $ (Text/Bild/Video/Audio) | $10.00 | $0.20 |
Gemini Robotics ER 2 – Vorschau im Live-Stream | $2.00 | $10.00 | n/a |
Gemini Robotics – ER 1.6 Vorschau | 1,00 $ (Text/Bild/Video); 2,00 $ (Audio) | $5.00 | n/a |
Ein paar praktische Hinweise zur Preisgestaltung:
Sowohl ER 2 als auch ER 1.6 bieten über Google AI Studio eine kostenlose Nutzungsstufe für Entwicklungs- und Testzwecke an, wobei wie üblich zu beachten ist, dass die im Rahmen der kostenlosen Nutzungsstufe erzeugten Inhalte zur Verbesserung der Google-Produkte verwendet werden können.
Die Batch-API-Verarbeitung senkt die Kosten für beide Modelle um etwa die Hälfte – nützlich für die Offline-Auswertung, die Beschriftung von Trainingsdaten oder die Robotikforschung außerhalb der Echtzeit.
ER 2 kostet sowohl bei der Eingabe als auch bei der Ausgabe genau doppelt so viel wie ER 1.6 – ein klarer Kompromiss, den man gegen die Fähigkeiten von ER 2 im Bereich des Videoverständnisses und der Multi-Roboter-Steuerung abwägen muss, die ER 1.6 schlichtweg nicht unterstützt.
Die Preise für die vollständigen VLA-Modelle – Gemini Robotics 2 und Gemini Robotics On-Device 2 – wurden noch nicht veröffentlicht, da beide weiterhin auf Early-Access-Partner beschränkt sind und noch keinen offenen API-Zugang bieten.
Gemini Robotics ER 2 vs. Gemini Robotics ER 1.6: Umfassender Vergleich
Gemini Robotics – ER 1.6 | Gemini Robotics ER 2 | |
Erscheinungsdatum | April 2026 | 30. Juli 2026 |
Kernkompetenz | Räumliche Logik, Aufgabenplanung, Erfolgserkennung | Erweitert um kontinuierliche Videoauswertung, Echtzeit-Streaming und Zusammenarbeit mehrerer Roboter |
Videoeingang | Vorwiegend statische Rahmenanalyse | Kontinuierliche Videoübertragung mit Fortschrittsanzeige |
Unterstützung mehrerer Roboter | Wird nicht unterstützt | Unterstützt – Roboter koordinieren sich über ein gemeinsames semantisches Verständnis |
Latenzprofil | Standard-Anfrage/Antwort | Bidirektionales Streaming über die Gemini Live-API |
Verständnis des Fortschritts | Begrenzt | Fortschrittsklassifizierung (57,4 %) und Momentbestimmung (91,3 %) |
Sicherheitsstandards | Vergleichsgrundlage | Bisher beste Ergebnisse bei der Einhaltung von Sicherheitsanweisungen und der Einhaltung des Mindestabstands zu anderen Personen |
Preis (Eingabe/Ausgabe pro 1 Mio. Token) | $1.00 / $5.00 | $2.00 / $10.00 |
Verfügbarkeit | Google AI Studio | Google AI Studio, Gemini-API, private Vorschau auf der Gemini Enterprise Agent Platform |
Fazit: Wenn Ihre Anwendung Live-Videoüberwachung, die Koordination mehrerer Roboter oder Reaktionsfähigkeit beim Echtzeit-Streaming erfordert, ist ER 2 die klare Wahl. Wenn Sie einfachere, zeitunkritische Entscheidungsaufgaben mit einem einzelnen Roboter ausführen, steht ER 1.6 weiterhin zum halben Token-Preis zur Verfügung.
Gemini Robotics On-Device: Das Offline-Pendant
Gemini Robotics On-Device 2 ist das Schwestermodell, das speziell für den lokalen Betrieb auf Roboterhardware entwickelt wurde, ohne auf eine Cloud-Anbindung angewiesen zu sein – ein entscheidender Vorteil für Fabriken, Lagerhäuser oder Feldroboter, die mit eingeschränktem oder gar keinem Internetzugang arbeiten. Laut DeepMind kann es sich anhand von weniger als 200 Trainingsbeispielen, die innerhalb weniger Stunden gesammelt wurden, an völlig neue Ausführungen von Zweiarmen-Robotern anpassen und nutzt dabei die erstmals in Gemini Robotics 1.5 eingeführte „Motion Transfer“-Technik. Im Gegensatz zu Gemini Robotics ER 2 ist das On-Device-Modell derzeit auf Early-Access-Partner beschränkt und nicht über eine offene API zugänglich.
Gemini Robotics SDK: Entwicklung auf Ihrer eigenen Hardware
Das Gemini Robotics SDK ist Googles Entwickler-Toolkit zum Testen und Anpassen von Gemini Robotics-Modellen an bestimmte Roboter und Aufgaben. Das SDK, das ursprünglich zusammen mit dem ersten Gemini Robotics On-Device-Modell veröffentlicht wurde, unterstützt die Auswertung im MuJoCo-Physiksimulator von Google und ermöglicht es Entwicklern, das Modellverhalten für neue Roboterausführungen mit nur 50 bis 100 Demonstrationen fein abzustimmen.
Speziell für Gemini Robotics ER 2 hat Google auf GitHub gebrauchsfertige Jupyter-Notebook-Beispiele veröffentlicht, darunter die vollständige Boston Dynamics Spot-Demo. Damit ist es einer der leichter zugänglichen Einstiegspunkte in die Entwicklung physischer KI für Teams, die bereits mit der Gemini-API arbeiten.
Gemini Robotics-Artikel: Die Forschung hinter den Modellen
Für Leser, die sich eher für die zugrunde liegende Forschung als für die Produktankündigung interessieren, hat DeepMind für jede wichtige Generation einen zur Begutachtung freigegebenen technischen Bericht veröffentlicht:
„Gemini Robotics: Bringing AI into the Physical World“ (arXiv:2503.20020, März 2025) – die grundlegende Veröffentlichung, in der die ursprünglichen Modelle „Gemini Robotics“ und „Gemini Robotics-ER“ vorgestellt werden, die auf Gemini 2.0 basieren.
„Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots“ (arXiv:2510.03342) – stellt den Mechanismus der Bewegungsübertragung und den Denkansatz „Erst denken, dann handeln“ vor, auf denen ER 2 aufbaut.
Gemini Robotics 2 Safety Technical Report – die sicherheitsspezifische Bewertung, die der Veröffentlichung im Juli 2026 beigefügt ist.
Zum Zeitpunkt der Erstellung dieses Artikels war noch kein eigener technischer Bericht speziell zur Generation „Gemini Robotics 2 / ER 2“ vom Juli 2026 als eigenständiges arXiv-Papier veröffentlicht worden; der Sicherheitsbericht und offizielle Blogbeiträge sind derzeit die wichtigsten dokumentierten Quellen.
Beispiel aus der Praxis: „Spot“ von Boston Dynamics holt einen Snack
Um die Fähigkeiten von ER 2 zur Werkzeugkoordination in der Praxis zu demonstrieren, arbeitete DeepMind mit Boston Dynamics zusammen und zeigte, wie Gemini Robotics ER 2 die Navigations- und Manipulator-APIs von Spot vollständig über natürliche Sprache steuert.
Unabhängig davon demonstrierte der Humanoid „Apollo 2“ von Apptronik, auf dem das zugehörige VLA-Modell „Gemini Robotics 2“ läuft, die Koordination des gesamten Körpers – er ging zu einem Tisch, hob eine Gießkanne auf und stellte sie präzise auf ein Regal, alles koordiniert durch die übergeordnete Planung von ER 2.
Wie fängt man mit Gemini Robotics ER 2 an?
Beziehen Sie einen kostenlosen API-Schlüssel über Google AI Studio.
Lesen Sie die Gemini-API-Dokumentation zum Thema Robotik, um Anleitungen zu räumlichem Denken, agentenbasiertem Sehen und Aufgabenkoordination zu erhalten.
Klonen Sie das offizielle GitHub-Repository „robotics-samples“, um funktionierende Notebook-Beispiele zu erhalten.
Für Unternehmensbereitstellungen beantragen Sie den Zugriff auf die private Vorschau der Gemini Enterprise Agent Platform.
FAQs
Was ist Gemini Robotics ER 2?
Es handelt sich um das leistungsfähigste Modell für verkörpertes Schlussfolgern von Google DeepMind, das am 30. Juli 2026 eingeführt wurde und als übergeordnete Entscheidungsebene eines Roboters dient – es interpretiert Video- und Sprachdaten, plant mehrstufige Aufgaben und koordiniert die Zusammenarbeit mit anderen Robotern, während die eigentliche Bewegung an ein separates Aktionsmodell übergeben wird.
Wie hoch ist der Preis für Gemini Robotics ER 2?
Über die offizielle Gemini-API beträgt der Standardpreis 2,00 US-Dollar pro Million Eingabetoken und 10,00 US-Dollar pro Million Ausgabetoken, wobei über Google AI Studio ein kostenloses Kontingent zur Verfügung steht und über die Batch-API etwa 50 % niedrigere Tarife gelten.
Wie hoch ist der Preis für Gemini Robotics ER 1.6?
Gemini Robotics ER 1.6 kostet 1,00 US-Dollar pro Million Eingabetoken (Text/Bild/Video), 2,00 US-Dollar für Audioeingaben und 5,00 US-Dollar pro Million Ausgabetoken – das ist die Hälfte der Kosten von ER 2.
Wodurch unterscheidet sich Gemini Robotics ER 2 von Gemini Robotics ER 1.6?
ER 2 bietet zusätzlich kontinuierliches Videoverständnis zur Echtzeit-Fortschrittsverfolgung, bidirektionales Streaming mit geringer Latenz über die Gemini Live API sowie die Zusammenarbeit mehrerer Roboter – Funktionen, die ER 1.6 nicht unterstützt. Außerdem schneidet es bei Benchmarks zu Sicherheit und räumlichem Denken deutlich besser ab.
Was ist „Gemini Robotics On-Device“?
Es handelt sich um ein eigenständiges, effizientes Modell für Bildverarbeitung, Sprache und Aktion, das für die lokale Ausführung auf Roboterhardware ohne Internetverbindung konzipiert ist und derzeit nur für Early-Access-Partner, nicht jedoch für die breite Öffentlichkeit verfügbar ist.
Was ist das Gemini Robotics SDK?
Ein Entwickler-Toolkit, mit dem Teams Gemini-Robotics-Modelle anhand ihrer eigenen Aufgaben und Roboterausführungen evaluieren und optimieren können – mithilfe des MuJoCo-Simulators von Google und, speziell für ER 2, anhand der auf GitHub veröffentlichten Notebook-Beispiele.