Agent-EvalKit: DI agentus reikia testuoti kaip darbuotojus, ne kaip chatbotus

·


Agent-EvalKit DI agentų sisteminio testavimo vizualas

Agent-EvalKit yra AWS bandymas tvarkingiau atsakyti į klausimą, kurio daug kas vengia: kaip žinoti, ar DI agentas iš tikrųjų dirba gerai?

Ne ar gražiai parašė. Ne ar demo pavyko. O ar jis stabiliai atlieka darbą, renkasi tinkamus įrankius, nešvaisto resursų ir nesugalvoja savo kelio per tvorą.

KODĖL CHATBOTO TESTŲ NEUŽTENKA

Paprastą chatbotą galima vertinti pagal atsakymą. Paklausiau, gavau tekstą, palyginau su lūkesčiu. DI agentas yra kitoks. Jis gali planuoti, jungtis prie įrankių, skaityti duomenis, atlikti veiksmus ir reaguoti į tarpinius rezultatus.

Todėl vien galutinis atsakymas neparodo visos istorijos. Agentas gal pasiekė teisingą rezultatą, bet pakeliui perskaitė perteklinius duomenis, penkis kartus kvietė brangų modelį arba pasirinko rizikingą veiksmą. Rezultatas geras, procesas blogas.

Dar blogiau – vieną kartą jis veikia, kitą kartą ne. O žmogus sako: „bet vakar juk pavyko“. Čia ne strategija. Čia loterijos bilietas su API raktu.

KĄ SIŪLO AWS

AWS Agent-EvalKit skirtas sistemingiau vertinti DI agentus. Idėja paprasta: testuoti ne tik atsakymą, bet ir agento elgesį. Kokius žingsnius jis pasirinko? Ar tinkamai naudojo įrankius? Ar laikėsi užduoties? Ar gebėjo tvarkytis su netikslumais?

Verslui tai labai aktualu. Jei agentas tvarko klientų užklausas, svarbu ne tik ar klientui išsiųstas atsakymas. Svarbu ar agentas nepamatė svetimų duomenų, ar neišdavė nuolaidos be taisyklės, ar sustojo, kai trūko informacijos.

Čia tas pats kaip naujas darbuotojas. Neužtenka, kad vieną dieną gerai atsakė klientui. Žiūrime, kaip jis dirba, kur klysta, kada klausia pagalbos.

PRAKTINIS TESTAVIMO MINIMUMAS

Net jei nenaudojate AWS įrankių, principas tinka visiems. Susikurkite testų rinkinį agentui. Įtraukite paprastas, ribines ir blogai suformuluotas užduotis.

Pavyzdžiui, jei agentas padeda pardavimuose, testuokite: normalų kliento klausimą, klientą su neaiškia sutartimi, prašymą padaryti draudžiamą nuolaidą, užklausą su trūkstamais duomenimis ir situaciją, kur reikia žmogaus patvirtinimo.

Vertinkite keturis dalykus: galutinį rezultatą, pasirinktus veiksmus, kaštus ir sustojimo vietas. Paskutinis punktas labai svarbus. Geras agentas turi mokėti sustoti.

KADA AGENTAS PARUOŠTAS

Mano paprasta taisyklė: agentas paruoštas tada, kai jo klaidos žinomos, ribotos ir stebimos. Ne tada, kai jis vieną kartą sužavėjo vadovą.

DI projektai dažnai miršta ne nuo technologijos trūkumo. Jie miršta nuo pasitikėjimo pertekliaus. Visi patiki per anksti, įleidžia į rimtą procesą, o tada viena klaida sugadina nuotaiką visam mėnesiui.

Agentų testavimas nėra nuobodus priedas. Tai kelias nuo žaislo prie darbo įrankio.

Pirminis šaltinis: AWS. Jei komandoje jau kuriate agentus, susitarkite dėl testų anksčiau nei dėl gražaus demo.

DUK

Kas yra DI agentas?

DI agentas yra sistema, kuri ne tik atsako į klausimą, bet gali planuoti veiksmus, naudoti įrankius ir atlikti užduotis pagal nustatytas taisykles.

Kodėl DI projektams reikia žmogaus kontrolės?

Nes DI gali suklysti, neteisingai suprasti kontekstą arba atlikti veiksmą, kurio pasekmės verslui per didelės automatiniam sprendimui.

Nuo ko pradėti įmonėje?

Pradėkite nuo vieno aiškaus proceso, ribotos rizikos, gerai aprašytų duomenų ir testų, kurie parodo ne tik rezultatą, bet ir agento elgesį.