Google DeepMind har den 28. juli 2023 præsenteret RT-2, en ny type AI-model, der skal styre robotter ud fra det, de ser, og det, de får besked på. Selskabet kalder den en vision-language-action-model og den første af sin slags. RT-2 er ikke en robot, men et stykke software, og DeepMind har demonstreret den på en robotarm, ikke en humanoid.

RT-2 står for Robotic Transformer 2. Navnet på modeltypen, vision-language-action (forkortet VLA), beskriver hvad den gør. Den tager billeder fra robottens kamera og en instruktion i almindeligt sprog ind, og sender robothandlinger ud. Syn og sprog ind, bevægelse ud, i én og samme model.

Web-viden bæres med ind i robotten

Det nye er hvor robotten har sin viden fra. RT-2 er bygget oven på to af selskabets store sprog- og billedmodeller, PaLI-X og PaLM-E, der i forvejen er trænet på enorme mængder tekst og billeder fra internettet. Den slags modeller har lært begreber om verden, hvad en banan er, hvad der er skrald, hvilke ting der kan vælte ned fra et bord, uden nogensinde at have rørt ved noget.

DeepMind har så finpudset modellen med robotdata, og pointen er at den web-viden følger med over i robotstyringen. Et trick gør det muligt. Selskabet beskriver robottens handlinger som tekst-tokens, altså samme byggesten en sprogmodel bruger til at danne ord. For modellen ligner det at styre en arm dermed det at skrive en sætning.

Resultatet er, ifølge DeepMind, at robotten kan udføre kommandoer den aldrig er trænet i. Selskabet nævner eksempler som at “samle posen op, der er ved at falde af bordet” og at “flytte bananen hen til summen af to plus en”, hvor robotten skal forstå både objekter og et lille regnestykke, den ikke har set i sine robotdata.

Tallene bag

DeepMind oplyser, at RT-2 klarer sig markant bedre end forgængeren RT-1 på opgaver den ikke er trænet i. På scenarier robotten ikke har set før, steg succesraten fra RT-1’s 32 procent til 62 procent. På det selskabet kalder “emergent” evner, altså færdigheder der ikke lå i robottens egne træningsdata, melder DeepMind om mere end en tredobling i forhold til tidligere modeller. Resultaterne hviler på over 6.000 forsøg med fysiske robotter.

Det var en robotarm, ikke en humanoid

Her er det vigtige forbehold for vores læsere. RT-2 blev ikke demonstreret på en humanoid robot. DeepMinds eksempler viser en robotarm, der griber genstande på et bord, ikke en tobenet maskine, der går rundt. Modellen er et software-lag, ikke en krop.

Men det er netop derfor RT-2 er værd at holde øje med for den, der følger humanoide robotter. Den hårde nød i humanoid-robotik er ikke længere kun mekanikken, det er styringen: at få en maskine til at forstå en opgave og selv finde ud af hvordan den løses. En model, der oversætter syn og sprog direkte til handling og bærer web-skala-viden med ind i den fysiske verden, er præcis den type “hjerne” en humanoid skal bruge. DeepMind beskriver selv arbejdet som et skridt mod “en universel fysisk robot, der kan ræsonnere, løse problemer og fortolke information for at udføre en bred vifte af opgaver i den virkelige verden”.

RT-2 er på dette tidspunkt forskning, vist i selskabets egne forsøg, og DeepMind oplyser ikke planer om at sætte den i produkter. Men retningen er sat. De samme store modeller, der driver chatbots, er på vej ind i robotterne. Hvilke kroppe de ender i, og hvor godt de virker uden for laboratoriet, er det de kommende år skal vise.