Multi-turn RL ir Amazon Nova: DI mokosi ne atsakyti, o kalbėtis
·

multi-turn RL skamba kaip techninis terminas. Bet kai pažiūri praktiškai, čia yra labai žemiškas klausimas: kiek darbo darome rankomis tik todėl, kad niekas neprisėdo sutvarkyti proceso?
AWS aprašė multi-turn reinforcement learning infrastruktūrą Amazon Nova modeliams su SageMaker HyperPod. Skamba akademiškai. Bet esmė paprasta: DI turi mokytis ne tik gražiai atsakyti į vieną klausimą, o išlaikyti pokalbį per kelis žingsnius.
Man tokiose naujienose visada įsijungia mažas vidinis buhalteris. Ne tas, kuris skaičiuoja sąskaitas, o tas, kuris klausia: kiek tai kainuos, kas prižiūrės ir kur gali lūžti?
KAS NUTIKO
Multi-turn RL leidžia modeliams mokytis iš kelių posūkių sąveikų, kur svarbus ne vien pirmas atsakymas, bet visas kelias iki rezultato. AWS pavyzdyje kalbama apie infrastruktūrą, kuri leidžia tokį mokymą vykdyti dideliu mastu.
Klientų aptarnavime vienas geras sakinys nieko neišgelbėja, jei trečiame žingsnyje sistema pameta kontekstą. Čia kaip pokalbis su žmogumi, kuris kas minutę klausia: „o apie ką mes?“
KODĖL TAI SVARBU
Multi-turn RL svarbus todėl, kad agentai dirba grandinėmis. Jie klausia, tikslinasi, kviečia įrankius, grįžta prie naudotojo ir tik tada užbaigia užduotį. Tam reikia kitokio mokymo ir kitokio testavimo.
DI jau nebe vien langelis, į kurį įmetame tekstą. Jis jungiasi prie įrankių, moka kviesti servisus, gali veikti keliais žingsniais ir pradeda liesti tikrus verslo pinigus. Čia romantika baigiasi. Prasideda tvarka.
KĄ TAI REIŠKIA VERSLUI
Verslui tai reiškia, kad DI kokybės matavimas turi keistis. Neužtenka patikrinti vieno atsakymo. Reikia matuoti visą dialogą: ar agentas suprato tikslą, ar nepasimetė, ar neprašė to paties tris kartus.
- testuoti pokalbius su keliais žingsniais
- matuoti užduoties užbaigimą, ne tik atsakymo grožį
- kurti klaidų scenarijus
- mokyti agentą kada klausti žmogaus
Pavyzdys: klientas nori pakeisti užsakymą. Agentui reikia patikrinti statusą, paklausti datos, pasiūlyti variantus ir tik tada patvirtinti veiksmą.
KUR PASISLĖPUSI RIZIKA
Rizika – vertinti DI pagal vieną screenshotą. Realus darbas prasideda tada, kai pokalbis pasuka ne pagal scenarijų.
Blogiausia DI klaida dažnai neatrodo kaip klaida. Ji ateina gražiai parašytu sakiniu, mandagiu tonu ir labai užtikrintu veidu. Todėl verslui reikia ne tik įrankių, bet ir įpročio tikrinti.
KĄ PASIDARYTI ŠIĄ SAVAITĘ
Išsirinkite vieną klientų aptarnavimo procesą ir parašykite 5 žingsnių testinį dialogą. Jis geriau parodys agento vertę nei vienas promptas.
Šaltinis: Amazon Web Services.
DUK
Kas yra multi-turn RL?
Tai mokymas, kai modelis vertinamas per kelių žingsnių sąveiką, o ne tik vieną atsakymą.
Kodėl tai svarbu agentams?
Agentai dažnai turi atlikti užduotis per kelis klausimus, veiksmus ir patikrinimus.
Kaip tai taikyti versle?
Testuoti ne pavienius atsakymus, o visą darbo eigą nuo užklausos iki rezultato.
Jei norite DI naudoti ne dėl mados, pradėkite nuo vieno proceso. Paimkite užduotį, kuri kartojasi kas savaitę, susirašykite žingsnius ir tik tada junkite įrankį. Daugiau praktinių DI taikymo pavyzdžių rasite MasterSprint.


