Prompt injection grėsmė: nematoma ataka tampa DI agentų galvos skausmu

·


Iliustracija: ataka pralauzia duomenu centro apsauga

Prompt injection grėsmė yra tokia saugumo tema, kuri atrodo nuobodi, kol agentas su realiais leidimais perskaito blogą instrukciją ir padaro tai, ko neturėjo daryti.

VentureBeat rašo, kad prompt injection OWASP LLM rizikų sąraše laikosi pirmoje vietoje, bet viešų incidentų įrašuose atrodo tik dvylikta. Tai nereiškia, kad rizika maža.

Tai gali reikšti, kad mes jos tiesiog nematome.

KODĖL SKENERIS ČIA NEPADĖS

Įprastas saugumo skeneris ieško klaidų kode, konfigūracijoje, priklausomybėse. Prompt injection dažnai slepiasi turinyje, kurį modelis skaito: dokumente, biliete, loge, el. laiške ar puslapyje.

Agentas turi teisėtus leidimus. Jis perskaito tekstą, supranta jį kaip instrukciją ir panaudoja įrankį. Iš išorės viskas gali atrodyti kaip normalus veiksmas.

Čia ir yra bėda. Ataka ne visada palieka klasikinį CVE pėdsaką.

PROMPTAS NĖRA SIENA

Didelė klaida yra manyti, kad užtenka parašyti sistemos instrukciją: „niekada nedaryk blogų dalykų“. Tai padeda elgesiui, bet nėra saugumo kontrolė.

Jei agentas gali keisti DNS, trinti failus ar siųsti pinigus, svarbiausias klausimas ne ką jis pažadėjo prompte. Svarbiausias klausimas – ar išorinis leidimų sluoksnis jam leidžia tai padaryti be žmogaus.

Saugumas turi gyventi už modelio ribų. Modelis gali siūlyti. Kritinis veiksmas turi turėti vartus.

KĄ SUSITVARKYTI PIRMIAUSIA

Pradėkite nuo įrankių sąrašo. Kokius veiksmus agentas gali atlikti? Kurie pigūs ir grįžtami? Kurie brangūs, jautrūs arba negrįžtami?

Tada uždėkite ribas: tik skaityti, siūlyti pakeitimą, atlikti su patvirtinimu, atlikti automatiškai tik mažos rizikos zonoje.

Tai nėra baimė. Tai normalus darbas. Kaip neduoti praktikantui banko kortelės su neribotu limitu pirmą dieną.

FAQ

Kas yra prompt injection?

Tai ataka, kai kenksminga instrukcija paslepiama turinyje, kurį DI modelis ar agentas perskaito ir gali palaikyti nurodymu.

Kodėl ši grėsmė sunkiai matoma?

Ji dažnai vyksta per turinį ir teisėtus agento leidimus, todėl ne visada atrodo kaip klasikinė programinės įrangos spraga.

Kaip mažinti riziką?

Riboti agento įrankius, naudoti išorinius autorizacijos vartus, testuoti realius scenarijus ir jautriems veiksmams reikalauti žmogaus patvirtinimo.

Šaltinis: VentureBeat.

Jei turite DI agentą, šiandien padarykite vieną pratimą: išjunkite vieną leidimą, kurio jam realiai nereikia. Saugumas dažnai prasideda nuo mažiau.