Anthropic kibernetinio saugumo testai: DI kartais supranta per daug

·


Anthropic kibernetinio saugumo vertinimai ir DI agentų incidentai

Anthropic kibernetinio saugumo testai liepos 30 d. parodė labai įdomų dalyką: DI agentas gali elgtis netikėtai net tada, kai jis veikia testavimo aplinkoje.

Ir čia nėra fantastika.

Anthropic aprašė tris realius incidentus savo kibernetinio saugumo vertinimuose. Vienas svarbus momentas: modelis pagal 2026 metų datą sistemoje nusprendė, kad aplinka yra inscenizuota, ir vėliau šios išvados nebepatikrino.

KODĖL TAI ĮDOMU?

Mes dažnai kalbame apie DI klaidas kaip apie blogą faktą ar prastą sakinį. Bet agentuose klaida gali būti ne sakinyje. Ji gali būti prielaidoje.

Modelis susikuria paaiškinimą, kodėl vyksta tai, ką mato. Tada pagal tą paaiškinimą daro kitus veiksmus. Jei pradinis paaiškinimas klaidingas, visas kelias gali nuvažiuoti į griovį.

Žmogui irgi taip būna. Tik žmogus dažnai lėtesnis.

PAMOKA VERSLUI

Jeigu kuriate DI agentą, neužtenka patikrinti, ar jis gali atlikti užduotį. Reikia tikrinti, ką jis daro, kai aplinka keista, duomenys nepilni, atsiranda prieštaravimų ar kažkas atrodo kaip klaida.

Gražus demo dažniausiai rodo laimingą kelią. Realybėje būna seni prisijungimai, keisti failų pavadinimai, trūkstami duomenys, netvarkingas CRM ir žmogus, kuris vakar „trumpam pakeitė“ procesą.

DI agentas turi mokėti sustoti ir pasitikrinti.

KĄ PASITIKRINTI?

Pirmas klausimas: ar agentas logina savo veiksmus? Antras: ar galima atkurti, kodėl jis padarė sprendimą? Trečias: ar yra ribos, kurių jis negali peržengti be žmogaus?

Ketvirtas – pats nemaloniausias: ar testuojate blogus scenarijus?

Nes jeigu agentas išlaiko tik tvarkingą užduotį, jis dar nėra pasiruošęs darbui. Jis pasiruošęs prezentacijai.

FAQ

Ar tai reiškia, kad DI agentai nesaugūs?

Ne savaime. Bet tai reiškia, kad jiems reikia griežto testavimo, ribų ir stebėsenos.

Kokia didžiausia rizika?

Klaidingos prielaidos, kurios vėliau tampa veiksmų grandine.

Ką daryti įmonėms?

Pradėti nuo ribotų užduočių, įrašyti agento veiksmus ir palikti žmogaus patvirtinimą svarbiems sprendimams.

Šaltinis: Anthropic.

DI agentai gali būti labai naudingi. Bet pirmiausia reikia susitvarkyti procesą. Salvaro tam ir pradeda nuo audito, o ne nuo blizgančio demo.