LLM inference SageMaker HyperPod: greitis slepiasi eilėje

·


LLM inference prefill ir decode atskyrimas Amazon SageMaker HyperPod

LLM inference skamba kaip techninis terminas. Bet kai pažiūri praktiškai, čia yra labai žemiškas klausimas: kiek darbo darome rankomis tik todėl, kad niekas neprisėdo sutvarkyti proceso?

AWS liepos 10 d. rašo apie disaggregated prefill and decode LLM inference darbams SageMaker HyperPod aplinkoje. Skamba kaip labai gili infrastruktūra. Bet praktinė mintis paprasta: DI greitis dažnai slepiasi eilėje, ne pačiame atsakyme.

Man tokiose naujienose visada įsijungia mažas vidinis buhalteris. Ne tas, kuris skaičiuoja sąskaitas, o tas, kuris klausia: kiek tai kainuos, kas prižiūrės ir kur gali lūžti?

KAS NUTIKO

Didelių kalbos modelių aptarnavime prefill etapas apdoroja pradinį kontekstą, o decode etapas generuoja atsakymą. AWS rodo, kaip šiuos etapus galima atskirti, kad infrastruktūra būtų geriau išnaudojama.

Čia kaip restorane. Viena komanda priima užsakymus, kita gamina. Jei visi daro viską, virtuvė gali atrodyti užimta, bet klientai vis tiek laukia.

KODĖL TAI SVARBU

LLM inference svarbus todėl, kad produkcijoje vartotojas nejaučia benchmarko. Jis jaučia laukimą. Jei atsakymas ateina per lėtai, žmonės grįžta prie seno proceso.

DI jau nebe vien langelis, į kurį įmetame tekstą. Jis jungiasi prie įrankių, moka kviesti servisus, gali veikti keliais žingsniais ir pradeda liesti tikrus verslo pinigus. Čia romantika baigiasi. Prasideda tvarka.

KĄ TAI REIŠKIA VERSLUI

Verslui tai ypač aktualu tada, kai DI naudojamas klientų aptarnavime, vidiniuose agentuose ar realaus laiko įrankiuose. Kaina, vėlavimas ir stabilumas tampa produkto dalimi.

  • matuoti laukimo laiką, ne tik modelio kokybę
  • atskirti ilgo konteksto užduotis nuo trumpų atsakymų
  • stebėti piko valandas
  • planuoti infrastruktūrą pagal naudojimo scenarijus

Jei vidinis DI įrankis lėtai atsako ryte, kai visi jungiasi į darbą, problema gali būti ne modelio protas, o aptarnavimo architektūra.

KUR PASISLĖPUSI RIZIKA

Rizika – pirkti daugiau skaičiavimo galios vietoj proceso supratimo. Kartais problema sprendžiama ne didesniu varikliu, o geresniu eismo valdymu.

Blogiausia DI klaida dažnai neatrodo kaip klaida. Ji ateina gražiai parašytu sakiniu, mandagiu tonu ir labai užtikrintu veidu. Todėl verslui reikia ne tik įrankių, bet ir įpročio tikrinti.

KĄ PASIDARYTI ŠIĄ SAVAITĘ

Pažiūrėkite savo DI įrankių logus: kada užklausos lėčiausios, kokios jos ilgio ir ar visoms tikrai reikia to paties modelio.

Šaltinis: Amazon Web Services.

DUK

Kas yra LLM inference?

Tai etapas, kai kalbos modelis apdoroja užklausą ir generuoja atsakymą.

Kas yra prefill ir decode?

Prefill apdoroja pradinį kontekstą, decode generuoja atsakymo tokenus.

Kodėl tai svarbu verslui?

Nes greitis ir kaina lemia, ar žmonės realiai naudos DI įrankį.

Jei norite DI naudoti ne dėl mados, pradėkite nuo vieno proceso. Paimkite užduotį, kuri kartojasi kas savaitę, susirašykite žingsnius ir tik tada junkite įrankį. Daugiau praktinių DI taikymo pavyzdžių rasite MasterSprint.