Google DeepMind opdaterer sin familie af robot-modeller med to nye udgaver, der skal flytte robotter fra at udføre enkeltkommandoer til at løse flertrins-opgaver mere selvstændigt. Det fremgår af en blogpost fra DeepMind den 25. september 2025.
Den første model hedder Gemini Robotics 1.5 og er en såkaldt vision-language-action-model (VLA). Den oversætter det robotten ser, sammen med en instruktion i almindeligt sprog, til konkrete bevægelser. Det nye er, at modellen ifølge DeepMind “tænker, før den handler” og viser sin tankegang undervejs, så det bliver mere gennemskueligt, hvordan den griber en sammensat opgave an. DeepMind fremhæver også, at modellen kan overføre bevægelser mellem forskellige robotplatforme uden at skulle specialtrænes til hver enkelt maskine.
Den anden model er Gemini Robotics-ER 1.5, hvor ER står for embodied reasoning, altså evnen til at ræsonnere om den fysiske verden. Modellen skal holde styr på, hvor ting er i forhold til hinanden, og hvad der skal ske i hvilken rækkefølge. DeepMind beskriver den som et planlægningslag, der “ræsonnerer om den fysiske verden, kalder digitale værktøjer og laver detaljerede planer i flere trin.” I praksis kan ER-modellen lægge en plan og bruge digitale hjælpemidler som søgning undervejs, mens VLA-modellen står for selve udførelsen.
Det er den tankegang DeepMind kalder agent-lignende. I stedet for at få én instruktion ad gangen kan robotten bryde en større opgave ned i delmål og arbejde sig igennem dem. Som eksempel beskriver DeepMind opgaver, der kræver flere skridt og brug af information, robotten ikke har på forhånd.
Til at underbygge det henviser DeepMind til topresultater på 15 akademiske benchmarks, blandt andet ERQA og Point-Bench, samt en opdateret version af deres ASIMOV-benchmark, der måler robotters forståelse af sikkerhed. Det er DeepMinds egne målinger, og hvor godt modellerne klarer sig uden for laboratoriet, fremgår ikke af blogposten.
For udviklere er der forskel på, hvad der kan afprøves. Gemini Robotics-ER 1.5 er tilgængelig nu via Gemini API gennem Google AI Studio. VLA-modellen Gemini Robotics 1.5 er fortsat forbeholdt udvalgte partnere, og DeepMind inviterer interesserede til at melde sig til virksomhedens trusted tester-program.
Modellerne bygger videre på den Gemini Robotics-familie DeepMind præsenterede i marts 2025 og den on-device-variant, der kom i juni.