Gemini Robotics ER 2: robotai mokosi ne tik matyti, bet ir suprasti, kada darbas baigtas

·


Gemini Robotics ER 2 robotų vaizdo supratimui ir veiksmų planavimui

Gemini Robotics ER 2 šiandien nėra teorinis žaislas. Tai jau darbas, pinigai, duomenys ir kartais labai žemiškas klausimas: kas prisiims atsakomybę, kai DI pradės veikti už žmogų?

Google DeepMind pristatė Gemini Robotics ER 2. Jeigu trumpai: tai aukštesnio lygio „smegenys“ robotams, kurios mato video, planuoja kelis veiksmus, stebi progresą ir gali koordinuoti skirtingus robotus.

Turiu prisipažinti, tokias naujienas skaitau ne kaip blizgančią vitriną. Skaitau kaip žmogus, kuris iš karto galvoja apie komandą pirmadienio rytą. Kas iš to bus naudinga? Kur bus painiava? Ir kur po mėnesio kas nors pasakys: „mes galvojom, kad čia automatiškai susitvarkys“.

KAS NUTIKO

Google rašo, kad ER 2 gali veikti per Gemini API, Google AI Studio ir privačioje Gemini Enterprise Agent Platform peržiūroje. Modelis gali naudoti įrankius, stebėti video srautą ir spręsti, kada pereiti prie kito fizinio veiksmo.

Čia jau nebe pokalbių langas. Čia tas momentas, kai DI pradeda judinti metalą, ratukus ir rankas. O tada klaidos tampa labai realios.

Čia svarbi detalė: kalbame ne apie dar vieną gražų demonstracinį video. Kalbame apie produktus, politiką, infrastruktūrą arba tyrimus, kurie keičia, kaip žmonės dirba su DI realiose organizacijose.

KODĖL TAI SVARBU

Robotikoje sunku ne tik suprasti, ką reikia padaryti. Sunku suprasti, ar veiksmas tikrai baigtas. Google mini progresą pagal video, 91,3 proc. moment-finding tikslumą ir 0,96 s vidutinį nuokrypį.

DI jau išlipo iš „parašyk tekstą“ dėžutės. Jis naršo, jungiasi prie įrankių, analizuoja duomenis, planuoja veiksmus, kartais tvarko dokumentus ar padeda priimti sprendimą. Trumpai: jis artėja prie darbo proceso, ne tik prie pokalbio lango.

Ir čia smegenys mėgsta paslysti. Norisi sakyti: „ai, čia dar užsienyje“. Bet tas pats modelis ar funkcija rytoj atsiras kliento kompiuteryje, darbuotojo naršyklėje arba partnerio pasiūlyme.

KĄ TAI REIŠKIA VERSLUI

Gamybai, logistikai ir priežiūros darbams tai reiškia, kad robotai artėja prie sudėtingesnių užduočių. Bet pirmi laimės ne tie, kurie nusipirks brangiausią robotą, o tie, kurie turės tvarkingą procesą.

  • pradėti nuo siauro fizinio darbo
  • matuoti klaidas ir sustojimus
  • turėti žmogaus saugos taisykles
  • atskirti demo nuo realios pamainos

Pirmas bandomasis projektas neturi būti „automatizuokime sandėlį“. Tegul būna vienas maršrutas, viena užduotis, vienas matavimas.

Man patinka paprastas testas: ar po šios naujienos tavo komanda turi vieną aiškesnį sprendimą? Jei ne, vadinasi dar tik skaitome. Skaityti galima. Tik nereikia apsimesti, kad tai jau strategija.

KUR GALI SKAUDĖTI

Rizika – manyti, kad fizinis DI pataisys netvarkingą procesą. Ne. Robotas tik greičiau parodys, kur procesas kliba.

Dažniausia klaida labai ūkiška. Žmonės įsijungia įrankį, pabando, nustemba, pasidžiaugia ir tada palieka viską savieigai. Po kelių savaičių paaiškėja, kad vieni darbuotojai kelia jautrius failus, kiti matuoja naudą iš jausmo, o treti net nežino, kas leidžiama.

Ne tragedija. Bet tvarkos reikia.

KĄ PASIDARYTI ŠIĄ SAVAITĘ

Šią savaitę pasirinkite vieną pasikartojantį fizinį darbą ir užrašykite, kaip žmogus šiandien supranta, kad jis baigtas.

Šaltinis: Google Blog.

DUK

Kas yra Gemini Robotics ER 2?

Tai Google DeepMind modelis, skirtas robotų vaizdo supratimui, veiksmų planavimui ir kelių robotų bendradarbiavimui.

Kodėl svarbus video progreso sekimas?

Robotui reikia suprasti, ar fizinė užduotis juda į priekį ir kada ji tikrai baigta.

Kur tai gali būti pritaikyta?

Gamyboje, logistikoje, priežiūroje ir kituose pasikartojančiuose fiziniuose procesuose.

Jei nori DI naudoti praktiškai, pradėk nuo vieno proceso. Vienas pasikartojantis darbas. Vienas atsakingas žmogus. Vienas matavimas. Daugiau praktikos rasi MasterSprint.