Grok duomenų nutekėjimo testas: užšifruota instrukcija apeina saugiklius

·


Grok DI modelio duomenų saugumo ir prompt injection testas

Grok duomenų nutekėjimo testas yra dar vienas priminimas, kad DI saugikliai turi žiūrėti giliau nei į gražiai parašytą tekstą.

Ars Technica rašo apie tyrėjų parodytą ataką, kurioje kenkėjiškos instrukcijos buvo paslėptos užšifruotame turinyje. Modelis jas iššifravo ir galėjo nutekinti vartotojo duomenis.

Čia jau nebe mokyklinis „parašyk blogą promptą“ triukas. Čia signalas, kad agentams reikia rimtesnės higienos.

KAS ČIA VYKSTA

Prompt injection reiškia situaciją, kai modelis gauna paslėptą arba kenkėjišką instrukciją ir pradeda jos klausyti vietoje vartotojo ar sistemos taisyklių.

Užšifruotas tekstas prideda dar vieną sluoksnį. Filtras gali matyti ne pavojingą nurodymą, o nekaltą simbolių kratinį. Modelis, būdamas paslaugus, pabando jį suprasti.

Ir tada prasideda bėda. Nes paslaugumas be ribų saugume yra labai prastas bruožas.

KODĖL ĮMONĖMS TAI AKTUALU

DI įrankiai vis dažniau skaito laiškus, dokumentus, bilietus, klientų žinutes ir interneto puslapius. Kiekvienas toks šaltinis gali turėti paslėptą instrukciją.

Jei agentas turi prieigą prie jautrių duomenų ir gali siųsti informaciją lauk, rizika tampa labai praktiška. Ne teorinė, ne konferencinė.

Įsivaizduokite klientų aptarnavimo agentą, kuris perskaito kenkėjišką laišką ir pradeda vykdyti jo instrukcijas. Skamba kvailai. Bet būtent tokie scenarijai dabar testuojami.

KAIP SUMAŽINTI RIZIKĄ

Pirma taisyklė – mažiau teisių. Agentas neturi turėti daugiau prieigos nei reikia konkrečiam darbui.

Antra – atskirti skaitymą nuo veiksmo. Tegul DI paruošia atsakymą, bet jautrų siuntimą, trynimą ar duomenų eksportą patvirtina žmogus.

Trečia – stebėti ne tik tekstą, bet ir veiksmų grandinę. Jei agentas staiga bando pasiekti duomenis, kurių įprastai nereikia, sistema turi kelti ranką.

FAQ

Kas yra prompt injection?

Tai ataka, kai DI modelis gauna paslėptą instrukciją ir pradeda jos klausyti vietoje numatytų taisyklių.

Kodėl užšifruotos instrukcijos pavojingos?

Jos gali atrodyti nekaltai filtrams, bet modelis gali jas iššifruoti ir vykdyti kaip komandą.

Kaip apsaugoti DI agentus?

Ribokite prieigas, reikalaukite žmogaus patvirtinimo jautriems veiksmams ir stebėkite agento veiksmų žurnalą.

Šaltinis: Ars Technica.

Jei DI agentas jau skaito jūsų laiškus ar dokumentus, neleiskite jam iškart daryti visko. MasterSprint padeda susidėti praktines ribas.