Nukleáris fegyvert épített AI a Civilization VI-ben, mégis vesztett
lwilko szerint a Civilization VI-ben az AI által kezelt döntési tér becslés szerint 10^166 lehetséges akciót tartalmaz egy körben, ami rávilágít a kormányzati AI korlátaira.

A lwilko, a kormányzati AI-alkalmazások szakértője, a lwilko.com blogon publikált elemzésben. A szerző azt állítja, hogy a jelenlegi AI-tesztek, például a GovBench, nem mérik a valódi stratégiai gondolkodást, és ezért félrevezethetik a döntéshozókat.
A GovBench korlátai
A GovBench teszt 3 497 kérdésből áll, és a Gemma 3 27B modell 94 %-os pontszámot ért el, míg a GPT-5 99,26 %-ot érte el. A szerző szerint a magas pontszámok nem bizonyítják, hogy egy modell képes a komplex, többváltozós döntéshozatalra, mert a teszt csak egyszerű visszahívási feladatokat tartalmaz.
Kapcsolódó: AI és sebezhetőségek felfedezése
Stratégiai játékban a valóságos próbája
A Civilization VI kísérletben az AI két nukleáris fegyvert épített, és a 305. körben lerombolta Toulouse-t, de Franciaország mégis nyert. A játék döntési tere egy körben becslés szerint 10^166 lehetséges akciót tartalmaz, ami rámutat, hogy a modell képes hosszú távú tervet fenntartani, de nehezen alkalmazkodik a hirtelen változásokhoz.
Kapcsolódó: homelab-kezelés AI-vel
A sensorium hatás
A sensorium hatás lényege, hogy az AI csak a kérésekre kap válaszokat, így a nem lekérdezett információk láthatatlanok maradnak. A szerző példaként hozza fel, hogy amikor az AI Indiát Gandhi vezetésével játszotta, a vallási terjeszkedést figyelte, de a tudományos fejlődésre összpontosított, így Franciaország a vallási győzelmet érte el.
Kapcsolódó: helyi AI-modellek
lwilko szerint a kormányzati döntéshozatalra való AI-alkalmazások esetében a jelenlegi mérőszámok helyett szimulációs teszteket kell bevezetni, amelyek a komplex, többváltozós környezetet modellezik. Javasolja, hogy a kormányok bevezessenek egy valós-időben frissülő tesztkeretet, amelyben a Civilization VI-hez hasonló szimulációkat is használnak.
Kapcsolódó: fork bomba Claude Code-tól