Claude Opus 4.8: agentai gauna daugiau savikontrolės

·


Claude Opus 4.8 DI modelio pristatymo iliustracija

KAS NUTIKO

Claude Opus 4.8 yra naujas Anthropic modelis, kuris labiausiai taiko į agentų darbą: kodą, naršyklės veiksmus, analizę ir ilgas užduotis. Skamba kaip dar vienas modelio pristatymas? Taip. Bet čia yra viena detalė, kuri man užkliuvo labiausiai.

Anthropic daug kalba ne tik apie greitį ar testų rezultatus. Jie pabrėžia, kad modelis dažniau pastebi savo darbo klaidas ir ne taip drąsiai apsimeta, kad viską padarė, kai įrodymų tam dar mažoka. Atvirai? Būtent čia šiandien ir lūžta didelė dalis DI projektų.

Versle gražus atsakymas nėra rezultatas. Rezultatas yra tada, kai sistema padaro užduotį, pasitikrina, parodo kur abejoja ir nepalieka žmogui gaudyti klaidų po fakto.

KODĖL TAI SVARBU VERSLUI

DI agentai po truputį keliasi iš demonstracijų į tikrą darbą. Ne į „parašyk man tekstą“ lygį, o į užduotis, kur reikia naudoti įrankius, prisiminti kontekstą, taisyti klaidas ir judėti per kelis žingsnius.

Čia atsiranda paprastas klausimas: ar galite tokiam agentui patikėti darbą, kurio patys nematote kiekvieną minutę? Jeigu agentas tik užtikrintai kalba, bet nepasako „čia nesu tikras“, jis tampa brangiu triukšmu. Jeigu jis moka sustoti ir pasitikrinti, jis jau panašesnis į kolegą, o ne į spalvingą autocomplete.

Man tai primena pirmą kartą, kai komandoje žmogui deleguoji rimtesnę užduotį. Neužtenka, kad jis būtų protingas. Reikia, kad jis grįžtų su klausimais, parodytų rizikas ir nepaslėptų vietų, kur pats abejoja.

KĄ DARYTI DABAR

Jeigu jūsų komanda jau testuoja Claude ar kitus DI įrankius, pradėkite ne nuo „kuris modelis protingiausias?“. Pradėkite nuo trijų mažų testų:

  • duokite agentui užduotį su tyčia įdėta klaida;
  • paprašykite parodyti, kur jis nėra tikras;
  • matuokite ne atsakymo grožį, o pataisymų skaičių po žmogaus peržiūros.

Šaltinis: Anthropic pranešimas apie Claude Opus 4.8.

Trumpai: ką verta žinoti?

Kas yra Claude Opus 4.8?

Tai Anthropic DI modelis, orientuotas į sudėtingas užduotis, kodavimą, agentų darbą ir ilgesnį kontekstą.

Ar tai aktualu Lietuvoje?

Taip, nes tos pačios agentų problemos pasirodo ir mažose komandose: klaidos, pasitikrinimas, atsakomybė.

Nuo ko pradėti testą?

Duokite vieną realią, bet nerizikingą užduotį ir vertinkite, kiek žmogaus taisymų reikėjo po DI darbo.

Norite ne tik skaityti apie DI, bet ir susidėti savo darbo sistemą? Peržiūrėkite MasterSprint programą arba Salvaro sprendimus verslui.