SageMaker moko agentus keliais ėjimais: vienas atsakymas nebėra visas darbas

·


SageMaker multi-turn reinforcement learning DI agentų mokymui

SageMaker multi-turn RL skamba kaip techninis terminas. Bet kai pažiūri praktiškai, čia yra labai žemiškas klausimas: kiek darbo darome rankomis tik todėl, kad niekas neprisėdo sutvarkyti proceso?

AWS aprašė gerąsias praktikas, kaip su SageMaker AI treniruoti agentus kelių ėjimų užduotims. Čia esmė paprasta: agentas ne visada turi pataikyti vienu atsakymu. Kartais jis turi bandyti, gauti grįžtamąjį ryšį, taisyti ir tęsti.

Man tokiose naujienose visada įsijungia mažas vidinis buhalteris. Ne tas, kuris skaičiuoja sąskaitas, o tas, kuris klausia: kiek tai kainuos, kas prižiūrės ir kur gali lūžti?

KAS NUTIKO

SageMaker AI multi-turn reinforcement learning suteikia treniravimo ciklą agentinėms užduotims. AWS kalba apie patikimą aplinką, išorinį vertinimą, atlygį pagal galutinį tikslą, kelių ėjimų metrikas ir stebėjimą.

Žmonės taip mokosi nuo vaikystės. Nepavyko surinkti lentynos – pasižiūrėjai instrukciją, pataisei, vėl bandai. Agentams tas pats, tik be pykčio ant varžtų.

KODĖL TAI SVARBU

SageMaker multi-turn RL svarbus todėl, kad realūs darbai retai telpa į vieną klausimą ir vieną atsakymą. Kodavimas, duomenų analizė, tyrimai, dokumentų tikrinimas, procesų automatizavimas – visur reikia kelių žingsnių.

DI jau nebe vien langelis, į kurį įmetame tekstą. Jis jungiasi prie įrankių, moka kviesti servisus, gali veikti keliais žingsniais ir pradeda liesti tikrus verslo pinigus. Čia romantika baigiasi. Prasideda tvarka.

KĄ TAI REIŠKIA VERSLUI

Verslui tai primena, kad agento kokybę reikia vertinti ne pagal gražiausią atsakymą, o pagal užduoties baigtį. Ar jis pasiekė rezultatą? Kiek kainavo? Kiek kartų pasiklydo? Kur reikėjo žmogaus?

  • vertinti galutinį rezultatą, ne tik tekstą
  • kurti testines aplinkas agentams
  • matuoti klaidų tipus per visą užduotį
  • nepalikti atlygio vien pagal greitį

Pavyzdys: jei agentas turi pataisyti klaidą kode, matas gali būti ne „parašė gražų paaiškinimą“, o „testai praėjo ir pakeitimas nepagadino kitų vietų“.

KUR PASISLĖPUSI RIZIKA

Rizika – duoti agentui blogą atlygį. Jei matuosite tik greitį, jis skubės. Jei tik kainą, taupys ten, kur nereikia. Kaip žmogus su blogai suformuluotu KPI.

Blogiausia DI klaida dažnai neatrodo kaip klaida. Ji ateina gražiai parašytu sakiniu, mandagiu tonu ir labai užtikrintu veidu. Todėl verslui reikia ne tik įrankių, bet ir įpročio tikrinti.

KĄ PASIDARYTI ŠIĄ SAVAITĘ

Paimkite vieną agento užduotį ir parašykite, kas yra sėkmė po penkių žingsnių. Ne po pirmo atsakymo. Po tikro darbo.

Šaltinis: Amazon Web Services.

DUK

Kas yra multi-turn RL?

Tai mokymas, kai agentas treniruojamas kelių žingsnių užduotims su grįžtamuoju ryšiu.

Kodėl tai svarbu?

Nes realūs agentai turi planuoti, bandyti, taisyti ir tęsti.

Ką matuoti?

Galutinį rezultatą, kainą, klaidų tipus ir žmogaus įsikišimo poreikį.

Jei norite DI naudoti ne dėl mados, pradėkite nuo vieno proceso. Paimkite užduotį, kuri kartojasi kas savaitę, susirašykite žingsnius ir tik tada junkite įrankį. Daugiau praktinių DI taikymo pavyzdžių rasite MasterSprint.