Claude Fable 5: pigesnis modelis ilgesniems DI darbams

·


Claude Fable 5 ir Claude Mythos 5 modelių pristatymas

Claude Fable 5 skamba kaip dar viena DI naujiena iš didelės kompanijos. Bet aš į tokias naujienas žiūriu paprastai: ar tai padeda žmogui pirmadienio rytą, kai Outlook’as pilnas, Slack’as mirksi, o vadovas klausia, kur rezultatas?

Anthropic pristatė Claude Fable 5 kaip saugesnę, plačiai prieinamą Mythos klasės versiją. Skaičiai gražūs, bet man įdomiausia ne lentelė. Įdomiausia, ką toks modelis reiškia komandai, kuri nori patikėti DI ne vieną laišką, o visą gabalą darbo.

Ir čia prasideda įdomioji dalis. Ne spaudos pranešime. Darbe. Ten, kur gražūs pažadai arba tampa procesu, arba tampa dar vienu įrankiu, kurį nusipirkome ir po dviejų savaičių pamiršome.

KAS NUTIKO

Claude Fable 5 jau prieinamas per Claude API, o Claude Mythos 5 lieka ribotam partnerių ir tyrėjų naudojimui. Anthropic akcentuoja ilgesnį autonominį darbą, programavimo gebėjimus, žinių analizę, vaizdų supratimą, atmintį ir mokslinius scenarijus.

Kaina taip pat kalba garsiai: 10 dolerių už milijoną įvesties žetonų ir 50 dolerių už milijoną išvesties žetonų. Kitaip tariant, ilgi agentiniai darbai po truputį keliauja iš „brangu pažaisti“ zonos į „galima planuoti biudžete“ zoną.

KODĖL TAI SVARBU

Kai modelis gali ilgiau laikyti kryptį, jis tampa ne tik atsakymų generatoriumi. Jis pradeda panašėti į praktikantą, kuris gali išdirbti kelias valandas, bet vis tiek turi turėti aiškią užduotį ir žmogų, kuris patikrina rezultatą.

Man čia labai norisi įjungti šaltą dušą sau pačiam. DI nėra stebuklinga šluota. Jei komandoje nėra aiškių taisyklių, kas ką daro, DI tik greičiau pagamins triukšmą. Kartais labai gražų triukšmą.

KĄ TAI REIŠKIA VERSLUI

Verslui Claude Fable 5 įdomus ten, kur reikia ilgesnių užduočių: kodo migracijų, dokumentų analizės, klientų laiškų suvestinių, tyrimų ir vidinių procesų tvarkymo.

  • pradėti nuo darbo, kurį galima aiškiai patikrinti
  • nustatyti, kiek žmogaus peržiūros būtina
  • matuoti ne tik sutaupytą laiką, bet ir klaidas
  • neleisti modeliui veikti su jautriais duomenimis be ribų

Pirmas testas gali būti labai žemiškas: duokite modeliui 30 klientų užklausų, paprašykite sugrupuoti temas, surašyti rizikas ir pasiūlyti atsakymų juodraščius. Tada žmogus lygina su realybe.

KUR PASISLĖPUSI RIZIKA

Didžiausia rizika – supainioti ilgą darbą su savarankišku sprendimu. Modelis gali atrodyti ramus ir užtikrintas net tada, kai remiasi silpnu įrodymu.

Gera ribų taisyklė: jeigu DI gali atlikti veiksmą, kažkas turi matyti pėdsaką. Kas paprašė? Ką sistema padarė? Kokiais duomenimis rėmėsi? Kur sustojo? Be šitų klausimų agentai virsta ne pagalbininkais, o mandagiais improvizatoriais.

KĄ PASIDARYTI ŠIĄ SAVAITĘ

Šią savaitę išsirinkite vieną 2-3 valandų pasikartojantį darbą ir aprašykite, kokį rezultatą laikytumėte geru. Be to matavimo net stiprus modelis bus tik įspūdis.

Šaltinis: Anthropic.

DUK

Kas yra Claude Fable 5?

Tai naujas Anthropic modelis, skirtas sudėtingiems ir ilgesniems DI darbams.

Kuo jis svarbus verslui?

Jis gali padaryti ilgesnes užduotis pigiau nei ankstesni aukščiausios klasės modeliai.

Ar galima juo pasitikėti be žmogaus?

Ne. Ilgesnis darbas vis tiek turi būti tikrinamas, ypač kai liečiami klientai, pinigai ar saugumas.

Jei norite DI įsidiegti ne dėl mados, o dėl realaus darbo rezultato, pradėkite nuo vieno proceso. Vieno. Aprašykite jį, pamatuokite laiką ir tik tada junkite įrankius. Praktinių DI diegimo pavyzdžių daugiau rasite MasterSprint.