Agent-EvalKit: AWS siūlo matuoti DI agentus, ne tik jais žavėtis

·


Agent-EvalKit AWS DI agentų vertinimo įrankis

Agent-EvalKit šiandien yra viena iš tų naujienų, kuri iš pirmo žvilgsnio atrodo techninė. Bet tada pagalvoji apie realią komandą: pardavimus, klientų klausimus, dokumentus, sprendimus ir tą vieną žmogų, kuris vis dar viską nešioja savo galvoje.

AWS paskelbė apie Agent-EvalKit – būdą sistemingai vertinti DI agentų elgesį ir rezultatų kokybę.

Atvirai? Man tokios žinios rūpi tik tada, kai jos nusileidžia ant stalo. Ne konferencijų salėje. Ant tikro darbo stalo, kur yra per daug langų, per mažai laiko ir vienas labai žmogiškas klausimas: ar tai man padės šiandien?

KAS NUTIKO

Agent-EvalKit orientuotas į agentų testavimą: ar agentas pasiekia tikslą, ar teisingai naudoja įrankius, ar nepažeidžia taisyklių ir ar jo veiksmai atsekami.

Man čia labai patinka kryptis. Nes agentas be testų yra kaip naujas darbuotojas be bandomojo laikotarpio: gal ir talentingas, bet palikti vieną su klientais būtų drąsu.

KODĖL VERTA SUSTOTI

Demo dažnai parodo geriausią scenarijų. Darbe svarbesni blogi scenarijai: neaiški užklausa, trūkstamas dokumentas, konfliktuojantys duomenys, pavargęs vartotojas.

Čia yra pavojinga vieta. Labai lengva pasakyti: „nu va, dabar agentai viską padarys“. Nepadarys. Jei procesas kreivas, DI jį tik greičiau nuneš į kitą kambarį. Kaip su dokumentų spinta: nauja etiketė nepadeda, jei viduje guli 2019 metų sutartys, trys versijos ir niekas nežino, kuri galutinė.

KĄ TAI REIŠKIA VERSLUI

Jei įmonė nori agentą paleisti į klientų aptarnavimą, pardavimus ar operacijas, jai reikia matuoti ne įspūdį, o stabilumą.

  • turėti testinių užklausų rinkinį
  • įtraukti klaidinančius ir ribinius atvejus
  • matuoti sėkmę pagal verslo rezultatą
  • saugoti agento veiksmų žurnalą

Pirmas testų rinkinys gali būti labai žemiškas: 30 realių klausimų, 10 netvarkingų dokumentų ir aiškus vertinimo lapas.

RIZIKA, APIE KURIĄ NORISI KALBĖTI GARSIAU

Jei agentas vertinamas tik pagal tai, ar atsakymas gražiai skamba, anksčiau ar vėliau jis pridarys brangių nesąmonių.

Gera praktika paprasta: kuo daugiau veiksmų DI gali atlikti pats, tuo aiškesnės turi būti ribos. Kas tvirtina? Kur sustoja? Ką įrašo į žurnalą? Kas atsako, jei atsakymas gražus, bet klaidingas?

KĄ PASIDARYTI ŠIĄ SAVAITĘ

Sukurkite mažą agento egzaminą: penkios lengvos užduotys, penkios sunkios ir penkios, kuriose jis turi pasakyti „nežinau“.

Šaltinis: Amazon Web Services.

DUK

Kas yra Agent-EvalKit?

Tai AWS siūlomas būdas sistemingai vertinti DI agentų veikimą.

Kodėl agentus reikia testuoti?

Nes jie gali naudoti įrankius ir atlikti veiksmus, o ne tik rašyti tekstą.

Ką matuoti?

Tikslo pasiekimą, klaidas, taisyklių laikymąsi, įrankių naudojimą ir atsekamumą.

Norite DI naudoti kaip sistemą, o ne kaip vieną triuką? Išsirinkite vieną procesą, susitarkite dėl ribų ir tik tada junkite įrankius. Daugiau praktikos galite rasti MasterSprint.