Google DeepMind je napravio ogroman korak naprijed u robotici lansiranjem Gemini Robotics 2, svog najnaprednijeg modela vida, jezika i djelovanja . Ovaj novi sloj inteligencije obećava da će transformirati robote u zaista prilagodljive mašine, sposobne za rasuđivanje o svakom pokretu i izvršavanje složenih zadataka u stvarnim okruženjima. Kompanija ga predstavlja kao univerzalni mozak koji se može instalirati na bilo koju vrstu robotskog hardvera, od industrijskih ruku do potpunih humanoida.
Sistem je strukturiran oko tri specijalizirana modela koji rade zajedno. Prvo, VLA (Vizija, Jezik i Akcija) model prevodi instrukcije u fizičke pokrete. ER 2 model djeluje kao mozak višeg nivoa, planira zadatke i komunicira s ljudima. A On-Device 2 model je optimiziran za lokalno pokretanje na robotu, bez oslanjanja na internet vezu. Ova arhitektura omogućava robotu da istovremeno razmišlja i djeluje , eliminirajući pauze koje su do sada bile uobičajene u sličnim sistemima.
Tri modela za potpunu robotsku inteligenciju

Model vida, jezika i akcije (VLA) odgovoran je za direktno upravljanje tijelom robota. Po prvi put, može upravljati kompletnim humanoidima, od prstiju na nogama do ruku , omogućavajući im da hodaju, čuče, istežu se i manipulišu predmetima sa spretnošću. U testovima, pokazao je 90% tačnosti u zadacima umetanja robotskim hvataljkama i 92% tačnosti u odvijanju sijalica petoprstim rukama i 22 stepena slobode.
S druge strane, model Gemini Robotics ER 2 fokusira se na integrirano zaključivanje. Djeluje kao agent koji promatra svoju okolinu, planira višekoračne sekvence i koordinira s VLA-om kako bi ih izvršio . Može koristiti vanjske alate poput Google pretrage kada su mu potrebne dodatne informacije i sposoban je analizirati video u stvarnom vremenu kako bi pratio napredak zadatka. Prema Googleu, ovaj model postiže 57,4% tačnosti u procjeni napretka i 91,3% tačnosti u identificiranju ključnih događaja, s marginom greške manjom od jedne sekunde.
Treći model, Gemini Robotics On-Device 2, dizajniran je za rad van mreže. Može se prilagoditi potpuno novom robotu za samo nekoliko sati, obučavajući ga s manje od 200 primjera . To ga čini idealnim za okruženja gdje su latencija ili privatnost kritični, kao što su tvornice ili povezani uređaji u privatnim domovima.
Potpuna kontrola tijela i neviđena spretnost

Jedna od najupečatljivijih novih karakteristika je kontrola cijelog tijela. Dok su prethodni modeli kontrolirali samo gornji dio robota za zadatke na stolu, Gemini Robotics 2 proširuje fizičku umjetnu inteligenciju na pokrete cijelog tijela. Roboti sada mogu hodati, čučati, istezati se i manipulirati objektima dok planiraju složene radnje . U demonstracijama, Apptronikov robot Apollo 2, opremljen SharpaWave rukama, bio je u stanju organizirati police i vezati čvorove s potpunom preciznošću.
Fine motoričke sposobnosti su se također značajno poboljšale. Model može kontrolirati paralelne hvatove s dva prsta za zadatke koji zahtijevaju snagu, kao i ruke s pet prstiju za delikatne radnje. Demonstrirane vještine uključuju zatvaranje vrećica, vezivanje čvorova, odvrtanje sijalica i sastavljanje malih dijelova . Google je objavio podatke koji podržavaju ove sposobnosti: precizni zadaci umetanja postižu stopu uspjeha od 90%, a zadaci odvijanja stopu uspjeha od 92%.
Saradnja između robota i zaključivanje u stvarnom vremenu

Još jedna velika inovacija je mogućnost koordinacije više robota u istom radnom prostoru. Gemini Robotics ER 2 omogućava različitim tipovima mašina da dijele zajedničko razumijevanje svog okruženja i podijele zadatke . U jednom testu, robot Franka F3 Duo je postavljao predmete u kutije, dok ih je humanoid Apollo 2 postavljao na policu. Prema Googleu, nijedan od njih ne bi mogao sam završiti zadatak, ali radeći zajedno uspješno su ga završili.
Sistem također uključuje praćenje napretka u realnom vremenu. Kontinuiranom analizom videa koji je snimio robot, model klasificira svaki kadar na skali od pet nivoa, od početka do završetka aktivnosti. Ako se pojavi neočekivani problem, robot može precizno odrediti lokaciju kvara i nastaviti odatle nakon što ga ispravi , bez potrebe za ponovnim pokretanjem cijelog radnog procesa. Ovo predstavlja značajno poboljšanje u odnosu na prethodne verzije, gdje je svaka greška zahtijevala pokretanje od nule.
Sigurnost i dostupnost za programere

Google je stavio poseban naglasak na sigurnost ove nove generacije. Model uključuje višeslojni pristup s robusnim zaštitnim okvirima i novim alatom za procjenu pod nazivom ASIMOV-Agentic , koji mjeri da li roboti odbijaju opasne komande, detektuju neizvjesne situacije i zaustavljaju se kada se osoba previše približi. U demonstracijama, sistem je bio u stanju automatski zaustaviti kretanje humanoidnog robota nakon što otkrije osobu u njegovom radnom području i nastaviti aktivnost kada se područje oslobodi.
Gemini Robotics ER 2 je sada dostupan programerima putem Gemini API-ja, Google AI Studija i u privatnoj pretpremijeri na Gemini Enterprise Agent Platformi. Međutim, modeli VLA i On-Device 2 dostupni su samo partnerima s ranim pristupom . Google očekuje da će ova tehnologija ubrzati usvajanje robota u sektorima kao što su logistika, proizvodnja i kućna automatizacija, gdje su svestranost i sigurnost ključne.
Kombinacija kontinuiranog razmišljanja, ekološke svijesti, višestepenog planiranja, saradnje robota i integracije s vanjskim alatima pozicionira Gemini Robotics 2 kao jedan od najnaprednijih DeepMindovih dostignuća do danas. Ovim izdanjem, Google pojačava svoju posvećenost fizičkoj vještačkoj inteligenciji, s ciljem da omogući robotima da obavljaju bilo koji zadatak koji bi obavljao čovjek, od punjenja mašine za pranje posuđa do rada u fabrici, sve uz fluidnost i sigurnost potrebnu za koegzistenciju s ljudima.
