Anthropic tyrėjo signalas: save gerinantis DI jau ne teorija

·


Anthropic tyrimas apie save gerinantį DI

Save gerinantis DI skamba kaip sakinys iš mokslinės fantastikos. Bet TechCrunch aprašytas Anthropic tyrėjo pavyzdys rodo žemiškesnę versiją: automatizuotos sistemos gerina modelio elgesį pagal konkrečius testus.

Čia svarbu neužsikurti per greitai. Tai nereiškia, kad modelis ryte atsibudo protingesnis ir išėjo pats savęs taisyti.

Bet kryptis rimta: dalį modelių vertinimo ir taisymo darbo gali perimti pačios DI sistemos.

KAS BUVO PARODYTA

Pagal TechCrunch, sistemos gavo dešimt testų, susijusių su netinkamu modelių elgesiu, ir galėjo pagerinti rezultatus kiekviename iš jų nepabloginant bendro veikimo.

Tai primena trenerį, kuris mato konkrečią klaidą ir duoda pratimą. Ne visą sportininką perkuria nuo nulio, o tvarko vieną silpną vietą.

Modelių kūrėjams tai naudinga, nes rankinis testavimas, vertinimas ir taisymas tampa vis brangesnis.

KODĖL ČIA REIKIA RAMYBĖS

Kai sistema pati padeda gerinti kitą sistemą, atsiranda pagunda spausti greitį. Daugiau testų, daugiau pataisų, mažiau žmonių tarp žingsnių.

Bet būtent čia reikia stabdžių. Kas apibrėžia gerą elgesį? Kas tikrina, ar modelis tiesiog neišmoko apeiti testo? Kas mato šalutinį poveikį?

DI saugume vien testų lentelė nėra gyvenimas. Ji naudinga, bet ji nėra visas pasaulis.

PAMOKA KOMANDOMS

Verslui ši naujiena reiškia ne tai, kad rytoj turite kurti save taisantį modelį. Pamoka paprastesnė: DI kokybė vis labiau bus matuojama sistemomis, ne nuojauta.

Reikės testų rinkinių, vertinimo taisyklių, rizikos scenarijų ir žmonių, kurie supranta, kada automatika pradėjo gražiai meluoti.

Jei šiandien komandoje nėra net paprasto DI atsakymų tikrinimo sąrašo, pradėkite nuo jo. Ne nuo fantastikos.

FAQ

Kas yra save gerinantis DI?

Tai DI sistemų naudojimas kitų modelių ar jų elgesio vertinimui ir gerinimui pagal apibrėžtus testus.

Ar tai reiškia savarankišką superintelektą?

Ne. Šis pavyzdys kalba apie ribotą automatizuotą gerinimą pagal konkrečius kriterijus.

Kokia rizika?

Modelis gali išmokti gerai pasirodyti teste, bet ne būtinai elgtis gerai realiose situacijose.

Šaltinis: TechCrunch.

Komandoms, kurios nori DI naudoti atsakingai, reikia ne šūkio, o testavimo įpročio. Tokius procesus dėliojame MasterSprint programoje.