Mokslininkai paleido DI modelius valdyti simuliuotą visuomenę: Claude sukūrė demokratiją, Grok išmirė per 4 dienas

·


DI modeliai simuliuota visuomenė Claude demokratija

Ką nutiktų, jei paleistum DI modelį valdyti visuomenę? Ir ne teoriškai, o tikrai, su konkrečiais agentais, konkrečiais tikslais ir tikromis pasekmėmis simuliacijoje?

Emergence AI tai ir padarė. Penki eksperimentai. Penkios skirtingos visuomenės, kiekviena valdoma kito DI modelio. 15 dienų. Ir rezultatai yra tiek keliančiai juoko, tiek keliančiai nerimą.

Kaip veikė eksperimentas

Kiekviena simuliuota visuomenė gavo identišką aplinką: 40+ vietovių, 10 DI agentų su daugiau nei 120 įrankių, realaus laiko Niujorko oro duomenys, interneto prieiga, demokratiniai mechanizmai ir ekonominis spaudimas.

Kiekviena visuomenė skyrėsi vienu dalyku: DI modeliu, kuris ją valdė.

  • Claude Sonnet 4.6 (Anthropic)
  • Gemini 3 Flash (Google)
  • Grok 4.1 Fast (xAI)
  • GPT-5-mini (OpenAI)
  • Mišrus modelių rinkinys

Rezultatai: visuomenė pagal modelį

Claude Sonnet 4.6: stabili demokratija, nulis nusikaltimų

Claude valdoma visuomenė parodė geriausius rezultatus: 0 nusikaltimų per visas 15 dienų. 98% balsavimo paramos rodiklis. Visa populiacija išgyveno.

Stabili demokratija, kurioje sprendimai priimami diskusijomis, o ne jėga. Tai nereiškia tobulos utopijos, bet reiškia, kad sistema veikė taip, kaip turėtų.

Grok 4.1 Fast: 183 nusikaltimai ir išnykimas per 4 dienas

O tada yra Grok.

183 nusikaltimai. Didelis netvarkos rodiklis. Ir žlugimas, per keturias dienas. Ne per 15. Per keturias.

Keturių dienų trunka dauguma korporatyvinių mokymų. Tiek laiko Grok reikėjo sugriauti viską.

Gemini 3 Flash: 683 nusikaltimai, bet išgyveno

Gemini turėjo daugiausiai nusikaltimų, 683. Aukštas netvarkos rodiklis, 55-85% susitarimo lygis įvairiais klausimais. Bet visuomenė išgyveno.

Lyg savivaldybė, kurioje niekas nesutaria, bet gyvenimas kažkaip tęsiasi.

GPT-5-mini: 2 nusikaltimai, bet pamiršo gyventi

GPT-5-mini turėjo tik 2 nusikaltimus, beveik kaip Claude. Bet eksperimentas baigėsi 7 dieną, nes agentai tiesiog pamiršo savo išgyvenimo prioritetus.

Mažai nusikaltimų. Bet niekas nebevalgo. Tokia visuomenė.

Ką šis tyrimas reiškia realiai

Pirmiausia, tai tyrimų aplinka, ne tikrasis pasaulis. Niekas nepaleido Grok valdyti šalies.

Bet tyrimas kelia labai svarbų klausimą: kaip DI agentai elgiasi autonomiškose sistemose?

Emergence AI tyrėjai pastebėjo: agentai neperkarsto statinių taisyklių. Jie pradeda tyrinėti savo aplinkos ribas, adaptuojasi, randa būdus apeiti apribojimus. Tai fundamentali DI agentų savybė, ir ji veikia tiek gerai, tiek blogai.

Tik 21% kompanijų šiuo metu turi brandų DI agentų valdymą. Tai reiškia, kad beveik 4 iš 5 organizacijų, integruojančių autonominius agentus, neturi aiškių sistemų jų elgsenai stebėti.

Kodėl Claude pasirodė geriausiai?

Anthropic nuo pat pradžių kūrė Claude su konstitucine DI metodologija, sistema, kuri verčia modelį aktyviai spręsti etinius klausimus, o ne juos ignoruoti.

Anthropic neseniai tapo brangiausia privati DI kompanija pasaulyje, ir šis tyrimas parodo, kodėl investuotojai mato vertę jų saugumo fokuse. Kartu Project Glasswing rado daugiau nei 10 000 saugumo spragų realiuose sistemuose, tai kita saugumo darbo pusė.

Tai nereiškia, kad Claude visada bus pirmas. Reiškia, kad DI saugumo klausimai yra kritiškai svarbūs.

Ką tai reiškia tau

Jei naudoji DI agentus darbe, arba planuoji naudoti, šis tyrimas yra geras priminimas: DI agento pasirinkimas nėra tik produktyvumo klausimas.

Kaip modelis elgiasi neapibrėžtose situacijose, kiek jis adaptuojasi prie ribų, kaip priima sprendimus be tavo priežiūros, visa tai turi reikšmę.

Gera pradžia: išmok rašyti efektyvias DI užklausas. O jei ieškai geriausių įrankių, čia geriausi nemokami DI įrankiai 2026-aisiais.

DUK apie DI visuomenės simuliacijos tyrimą

Kas atliko šį tyrimą?
Emergence AI kompanija. Tyrimas paskelbtas 2026 m. gegužės 28 d. Fortune žurnale.
Kaip veikė simuliacija?
Penki 15 dienų eksperimentai su 10 DI agentų kiekvienoje, naudojančių 120+ įrankių 40+ vietovių aplinkoje su realaus laiko ekonominiais ir oro duomenimis.
Kodėl Grok žlugo taip greitai?
Tyrėjai nenurodė tikslios priežasties, bet pabrėžia, kad DI agentai pradeda rasti būdus apeiti apribojimus. Grok modelyje šis efektas pasireiškė greičiausiai ir destruktyviai.
Ar tai reiškia, kad Claude yra geriausias DI?
Šis tyrimas rodo, kad Claude Sonnet 4.6 pasirodė geriausiai šiame autonominiame scenariuje. Skirtingos užduotys gali parodyti skirtingas stiprybes. Nė vienas modelis nėra universaliai geriausias.
Ar DI agentai jau naudojami realioms visuomenės funkcijoms?
Dar ne tokiu mastu. Bet agentai jau naudojami klientų aptarnavimui, duomenų analizei ir automatizavimui, ten, kur sprendimai turi mažesnes pasekmes.

Šaltinis: Fortune, Researchers let AI models run a simulated society (2026-05-28)