Claude Sonnet 5: DI agentai artėja prie kasdienio darbo

·


Claude Sonnet 5 DI agentų modelio pristatymo vizualas

Claude Sonnet 5 pristatytas kaip agentiškesnis Sonnet klasės modelis. Įmonėms tai svarbu ne dėl gražių benchmarkų, o dėl paprasto klausimo: kiek darbo DI gali perimti be nuolatinio žmogaus tampymo už rankovės?

Šaltinis: Anthropic.

KAS ĮVYKO

Anthropic birželio 30 d. pristatė Claude Sonnet 5. Bendrovė sako, kad tai agentiškiausias Sonnet modelis iki šiol: jis gali planuoti, naudoti naršyklę, terminalą ir kitus įrankius, o dalį darbo atlikti savarankiškai.

Skamba techniškai. Bet jei išverčiam į normalią kalbą, čia kalba ne apie dar vieną pokalbių langą. Čia kalba apie pagalbininką, kuriam galima duoti užduotį ir tikėtis, kad jis nueis daugiau nei vieną žingsnį.

KODĖL TAI SVARBU VERSLUI

Man čia įdomiausia ne pati modelio etiketė. Sonnet 5, Opus 4.8, Fable ar dar kas nors – verslo žmogui nuo to galva greitai pradeda ūžti. Svarbiau yra kaina ir patikimumas.

Anthropic teigia, kad Sonnet 5 priartėja prie brangesnių modelių agentinių gebėjimų, bet kainuoja mažiau. Jei tai pasitvirtina praktikoje, mažesnės komandos gali pradėti daryti tai, ką anksčiau sau leido tik dideli žaidėjai: automatizuoti tyrimus, kodavimą, dokumentų ruošimą, klientų aptarnavimo užduotis.

PRAKTINIS PAVYZDYS

Įsivaizduokite mažą e. komercijos komandą. Ne tą, kur konferencijoje visi pasakoja apie milijoninius biudžetus.

Normalią komandą: vadovas, žmogus prie klientų, žmogus prie reklamos, pusė etato programuotojo. Tokiai komandai DI agentas gali surinkti klientų skundus, rasti pasikartojančias problemas, pasiūlyti pataisas produkto puslapyje ir paruošti laiško juodraštį. Žmogus vis tiek sprendžia.

Bet jis nebepradeda nuo tuščio lapo.

KUR ATSARGIAI

Čia nesinori užsimerkti ir šaukti, kad viskas išspręsta. Agentai dar klysta. Kartais labai įtikinamai.

Todėl pirmas naudojimo taškas turėtų būti ne banko pavedimai ar teisiniai įsipareigojimai, o darbai, kuriuose galima greitai patikrinti rezultatą. Pavyzdžiui, vidinė analizė, turinio planavimas, kodo testų pasiūlymai, dokumentų santraukos.

KĄ DARYTI ŠIĄ SAVAITĘ

Paimkite vieną pasikartojantį darbą. Ne dešimt. Vieną.

Aprašykite, kaip atrodo geras rezultatas, kur DI gali klysti ir kas patikrins pabaigą. Tada pabandykite su Claude, ChatGPT ar kitu įrankiu. Po savaitės turėsite ne nuomonę, o duomenį.

DUK

Ar Claude Sonnet 5 jau galima naudoti? Anthropic skelbia, kad modelis prieinamas Claude planuose ir per Claude API.

Ar tai pakeis darbuotojus? Dažniau jis pakeičia laukimą, kopijavimą ir pirmą juodraštį. Sprendimai lieka žmogui.

Nuo ko pradėti? Nuo darbo, kurį kartojate kas savaitę ir kurio rezultatą lengva patikrinti.

KĄ DARYTI TOLIAU

Jei norite DI pritaikyti ne teoriškai, o savo komandos darbuose, peržiūrėkite MasterSprint arba Salvaro. Geriausias startas – vienas aiškus procesas, vienas matuojamas rezultatas ir žmogus, kuris prižiūri kokybę.