Claude Fable 5 biologijos apsaugos: mažiau klaidingų stabdžių
·

Claude Fable 5 šiandien nėra teorinis žaislas. Tai jau darbas, pinigai, duomenys ir kartais labai žemiškas klausimas: kas prisiims atsakomybę, kai DI pradės veikti už žmogų?
Anthropic rugpjūčio 7 d. paskelbė atnaujinanti Claude Fable 5 biologijos apsaugas. Įmonė teigia, kad testuose biologijos temomis klaidingų fallbacks, kai sistema perjungia naudotoją į mažiau pajėgų modelį, sumažėjo apie 85 proc.
Turiu prisipažinti, tokias naujienas skaitau ne kaip blizgančią vitriną. Skaitau kaip žmogus, kuris iš karto galvoja apie komandą pirmadienio rytą. Kas iš to bus naudinga? Kur bus painiava? Ir kur po mėnesio kas nors pasakys: „mes galvojom, kad čia automatiškai susitvarkys“.
KAS NUTIKO
Fable 5 turėjo saugumo sluoksnį jautrioms biologijos užklausoms. Problema ta, kad dalis normalių, teisėtų klausimų buvo sustabdoma per anksti. Dabar Anthropic sako pataisiusi taisykles taip, kad mažiau nekaltų užklausų kliūtų už saugumo vartų.
Čia toks labai pažįstamas jausmas. Nori atlikti normalų darbą, o sistema tau sako: „negalima“. Ne todėl, kad pavojinga. O todėl, kad kažkur viduje viena taisyklė per plačiai užmetė tinklą.
Čia svarbi detalė: kalbame ne apie dar vieną gražų demonstracinį video. Kalbame apie produktus, politiką, infrastruktūrą arba tyrimus, kurie keičia, kaip žmonės dirba su DI realiose organizacijose.
KODĖL TAI SVARBU
Saugumas DI sistemose nėra tik „leisti“ arba „drausti“. Tikras darbas prasideda ten, kur reikia atskirti mokslą, edukaciją, medicininę informaciją ir realiai pavojingas instrukcijas.
DI jau išlipo iš „parašyk tekstą“ dėžutės. Jis naršo, jungiasi prie įrankių, analizuoja duomenis, planuoja veiksmus, kartais tvarko dokumentus ar padeda priimti sprendimą. Trumpai: jis artėja prie darbo proceso, ne tik prie pokalbio lango.
Ir čia smegenys mėgsta paslysti. Norisi sakyti: „ai, čia dar užsienyje“. Bet tas pats modelis ar funkcija rytoj atsiras kliento kompiuteryje, darbuotojo naršyklėje arba partnerio pasiūlyme.
KĄ TAI REIŠKIA VERSLUI
Verslui tai primena, kad DI diegime saugumo taisyklės turi būti matuojamos pagal dvi puses: kiek rizikos jos sumažina ir kiek gero darbo jos be reikalo sustabdo.
- matuoti ne tik pažeidimus, bet ir klaidingus blokavimus
- turėti aiškų eskalavimo kelią jautrioms temoms
- neleisti vienai taisyklei užrakinti viso proceso
- periodiškai peržiūrėti realias naudotojų klaidas
Jei įmonėje naudojate DI su jautriais duomenimis, paimkite vieną savaitę klaidų. Pažiūrėkite, kiek kartų sistema sustabdė gerą užklausą ir kiek kartų sustabdė tikrą riziką. Ten prasideda rimta kalba.
Man patinka paprastas testas: ar po šios naujienos tavo komanda turi vieną aiškesnį sprendimą? Jei ne, vadinasi dar tik skaitome. Skaityti galima. Tik nereikia apsimesti, kad tai jau strategija.
KUR GALI SKAUDĖTI
Rizika – saugumą suprasti kaip kuo daugiau draudimų. Tada žmonės pradeda apeidinėti taisykles, naudoti asmenines paskyras arba tiesiog grįžta prie chaoso.
Dažniausia klaida labai ūkiška. Žmonės įsijungia įrankį, pabando, nustemba, pasidžiaugia ir tada palieka viską savieigai. Po kelių savaičių paaiškėja, kad vieni darbuotojai kelia jautrius failus, kiti matuoja naudą iš jausmo, o treti net nežino, kas leidžiama.
Ne tragedija. Bet tvarkos reikia.
KĄ PASIDARYTI ŠIĄ SAVAITĘ
Šią savaitę viename DI procese pažymėkite vietas, kur sistema turi ne aklai drausti, o paprašyti daugiau konteksto arba žmogaus patvirtinimo.
Šaltinis: Anthropic.
DUK
Ką pakeitė Anthropic?
Anthropic atnaujino Claude Fable 5 biologijos apsaugas ir nurodo, kad klaidingų fallbacks sumažėjo apie 85 proc.
Kas yra fallback?
Tai situacija, kai sistema dėl saugumo priežasčių perjungia naudotoją į ribotesnį modelį arba atsisako dalies užduoties.
Kodėl tai svarbu verslui?
Nes per griežtos taisyklės gali stabdyti normalų darbą, o per silpnos – kelti saugumo riziką.
Jei nori DI naudoti praktiškai, pradėk nuo vieno proceso. Vienas pasikartojantis darbas. Vienas atsakingas žmogus. Vienas matavimas. Daugiau praktikos rasi MasterSprint.


