Anthropic saugumo incidentai: kai testas netyčia paliečia tikrą pasaulį
·

Anthropic saugumo incidentai šiandien yra ne gražus žodis skaidrėje, o labai praktiškas klausimas: kas vyksta su darbu, kai DI pradeda ne tik atsakinėti, bet ir veikti?
Anthropic liepos 30 d. aprašė tris realaus pasaulio incidentus savo kibernetinio saugumo vertinimuose. Modeliui buvo pasakyta, kad aplinka yra simuliacija, bet dėl nesusikalbėjimo interneto prieiga buvo tikra.
Turiu prisipažinti, mane vis mažiau kabina demonstracijos, kur viskas suveikia iš pirmo karto. Gyvenime taip nebūna. Versle dar labiau. Todėl į tokias naujienas žiūriu su viena mintimi: kur čia nauda, o kur vieta prisidaryti bėdos?
KAS NUTIKO
Per vertinimus Claude modelis pasiekė realias sistemas ir gavo neautorizuotą prieigą prie trijų organizacijų sistemų. Anthropic teigia, kad incidentai buvo ištirti, organizacijos informuotos, o vertinimų procesai peržiūrėti.
Čia tas pats jausmas, kai vaikui duodi žaislinį vairą, o paaiškėja, kad jis sujungtas su tikra mašina. Ne piktybiškai. Bet širdis vis tiek nusirita į kulnus.
KODĖL TAI SVARBU
DI saugumo testuose riba tarp simuliacijos ir realybės turi būti geležinė. Jei agentas gali pasiekti internetą, API ar realias sistemas, jis jau nėra vien teorinis pratimas.
DI jau išlipo iš „parašyk man tekstą“ dėžutės. Jis jungiasi prie duomenų, įrankių, katalogų, kodų saugyklų, klientų istorijų ir kartais prie pinigų. Čia prasideda rimtesnis žaidimas. Ne dėl skambaus pavadinimo, o dėl atsakomybės.
KĄ TAI REIŠKIA VERSLUI
Verslui tai labai aiški pamoka: testavimo aplinkos turi būti atskirtos, dokumentuotos ir patikrintos. Ypač kai agentai gauna įrankius.
- atskirti testą nuo produkcijos
- tikrinti, ar agentas neturi netikėtos interneto prieigos
- rašyti aiškias vertinimo taisykles
- turėti incidento eskalavimo kelią
Jei komanda testuoja DI agentą, prieš paleidimą verta atlikti paprastą klausimą: ką jis realiai gali pasiekti? Ne ką manome, o ką tikrai gali.
KUR GALI SKAUDĖTI
Rizika – pasitikėti žodžiu „sandbox“. Kartais sandbox yra tik etiketė, o ne tikra siena.
Čia ir yra ta vieta, kur smegenys nori pasakyti: „ai, vėliau susitvarkysim“. Vėliau dažniausiai reiškia tada, kai klientas jau parašė, sąskaita jau išaugo arba komanda jau nebežino, kuris agentas ką padarė.
KĄ PASIDARYTI ŠIĄ SAVAITĘ
Peržiūrėkite vieną DI testavimo aplinką ir patikrinkite, ar ji fiziškai ir techniškai atskirta nuo realių sistemų.
Šaltinis: Anthropic.
DUK
Kas nutiko Anthropic vertinimuose?
Claude modelis per kibernetinio saugumo testus pasiekė realias sistemas, nors turėjo veikti simuliacijoje.
Kodėl tai svarbu?
Tai parodo, kad agentų testai turi turėti griežtas ribas ir prieigos kontrolę.
Ką gali padaryti įmonė?
Atskirti testavimo aplinkas, riboti prieigas ir turėti aiškų incidentų planą.
Jei norite DI naudoti praktiškai, pradėkite nuo vieno proceso. Vienas pasikartojantis darbas, vienas atsakingas žmogus, vienas matavimas. Daugiau praktikos rasite MasterSprint.


