DeepMind DI kontrolės planas: agentu pasitikėk, bet vairą laikyk
·

DI agentų kontrolė tampa viena svarbiausių temų, nes agentai jau ne tik atsako. Jie planuoja, kviečia įrankius, jungiasi prie sistemų ir kartais veikia ilgiau nei kelias sekundes.
Google DeepMind paskelbė AI Control Roadmap – planą, kaip saugoti vidines sistemas nuo vis pajėgesnių ir ne visada tobulai suderintų agentų. Man labiausiai įstrigo jų analogija su vairavimo instruktoriumi: mokinys vairuoja, bet instruktorius turi antrus pedalus.
Ūkiškai pasakius: agentu pasitikėk, bet ranką laikyk prie stabdžio.
Kodėl vien „išmokyti būti geru“ neužtenka
Ilgą laiką DI saugume daug kalbėta apie alignment – kad modelis elgtųsi pagal žmogaus ketinimus. Tai svarbu. Bet DeepMind sako, kad vien to neužtenka.
Jeigu agentas gauna prieigą prie sistemų, reikia papildomų sluoksnių: sandbox, endpoint saugumo, apsaugos nuo prompt injection, leidimų, stebėjimo ir laipsniškai suteikiamos prieigos.
Čia kaip su nauju darbuotoju. Tu gali tikėti, kad žmogus geras. Bet vis tiek neduodi jam pirmą dieną prieigos prie visos buhalterijos, banko ir klientų sutarčių archyvo.
Ne dėl paranojos. Dėl sveiko proto.
Agentai kaip vidinė rizika
DeepMind požiūris įdomus tuo, kad agentai traktuojami panašiai kaip potencialiai rizikingi vidiniai veikėjai. Ne todėl, kad jie „blogi“. O todėl, kad jie gali turėti teises ir veikti sistemos viduje.
Kai agentas turi įrankius, jo klaida gali būti ne tik neteisingas sakinys. Jis gali pakeisti failą, paleisti komandą, išsiųsti užklausą, paliesti duomenis.
Štai čia prasideda tikra atsakomybė.
Laipsniška prieiga yra geras principas
Vienas praktiškiausių DeepMind plano kampų – prieiga pagal patikrintą elgesį. Agentas negauna visko iš karto. Jis įrodo, kad gali dirbti saugiai mažesnėje aplinkoje, ir tik tada gauna daugiau.
Versle tai galima pritaikyti labai paprastai.
- Pirmiausia agentas tik skaito duomenis.
- Tada ruošia pasiūlymus žmogui.
- Vėliau gali atlikti mažus veiksmus su patvirtinimu.
- Tik brandžiausiuose procesuose gauna ribotą autonomiją.
Ne nuo nulio iki „daryk ką nori“. O laipteliais.
Ką tai reiškia vadovams
Jeigu jūsų įmonė nori DI agentų, kontrolė turi būti projekto dalis nuo pirmos dienos. Ne priedas pabaigoje, kai jau viskas sujungta.
Paklauskite komandos:
- Ką agentas gali daryti be žmogaus?
- Ką tik su patvirtinimu?
- Kur registruojami jo veiksmai?
- Kas sustabdo agentą, jei jis pradeda elgtis keistai?
- Kokioje aplinkoje testuojame prieš paleisdami gyvai?
Jeigu atsakymų nėra, dar ne laikas duoti agentui raktų.
Ne stabdyti, o vairuoti
Man patinka, kad DeepMind žinutė nėra „bijokime agentų“. Ji labiau apie vairavimą.
Greičiau važiuoti galima. Bet tada reikia stabdžių, veidrodėlių, taisyklių ir žmogaus, kuris supranta kelią. DI agentai gali daug. Tik nereikia apsimesti, kad galia pati savaime reiškia brandą.
Šią savaitę verta pasidaryti vieną mažą pratimą: paimkite bet kurį planuojamą DI agentą ir nupieškite jo leidimų ribas. Kur gali skaityti? Kur gali rašyti? Kur turi sustoti?
Jeigu šitas žemėlapis atrodo miglotas, Salvaro gali padėti jį susidėlioti praktiškai. Nes kontrolė nėra stabdis. Tai sąlyga judėti greičiau be kvailų avarijų.
FAQ
Kas yra DeepMind AI Control Roadmap?
Tai Google DeepMind planas, kaip sluoksniais valdyti ir saugoti sistemas, kuriose dirba pajėgūs DI agentai.
Kodėl agentams neužtenka alignment?
Nes net gerai treniruotas agentas gali suklysti arba būti paveiktas aplinkos, todėl reikia sisteminių saugiklių.
Koks svarbiausias praktinis principas?
Laipsniškai suteikti prieigą pagal patikrintą elgesį ir visada turėti stebėjimą bei sustabdymo mechanizmą.
Šaltinis: Google DeepMind.


