Szimulált világban tanult AI-ügynökök jobbak a valósnál — Alibaba kutatása
Az Alibaba Qwen-AgentWorld modellje a környezeti állapotok előrejelzésére összpontosít, nem a cselekvésre, hét domainben javítva az ügynökök teljesítményét.

Az Alibaba Qwen csapata kedden mutatta be a Qwen-AgentWorldöt — két olyan modellt, amelyeket nem ügynökök környezetében való cselekvésre, hanem a környezetek válaszainak előrejelzésére képeztek. A hét domain — MCP, Keresés, Terminál, Szoftverfejlesztés, Android, Web és OS — egyetlen architektúrába integrálódik. Ez a lépés az Alibaba autonóm ügynökök terén tett erőfeszítéseit hosszabbítja meg.
A korábbi, májusban kiadott Qwen3.7-Max modell 35 órás autonóm végrehajtási képességgel rendelkezett. A kutatók szerint a valós környezetekben történő skálázott ügynökképzés korlátot jelent, mivel a valós keresőmotorok nem tudnak kontrollált feltételeket injektálni, és a rendszerek ritkán teszik ki az ügynököket az éles helyzeteknek. Az Alibaba kutatói a szimulált világban képezett ügynökökkel jobb eredményeket értek el, mint kizárólag valós környezetben tanított társaikkal. Egy külön tesztben a világmodell-képzést bemelegítésként használták, ami hét teljesítményteszten javított az ügynökök teljesítményén, köztük három olyanon, amelyet a modell a képzés során nem látott.
Kapcsolódó: Qwen3.6 kódolási teljesítménye
A kutatók szerint a világmodell-képzés hiányzik az általános ügynökök fejlesztéséből. Míg a legtöbb ügynökmodell arra válaszol, hogy „mit tegyek legközelebb”, a Qwen-AgentWorld arra, hogy „mi fog történni ezután”. Ez a fordulat egy nyelvi világmodell lényege, amely nem az akció kiválasztására optimalizál, hanem a következő környezeti állapot előrejelzésére. A korábbi munkák, mint a WebWorld vagy a Snowflake Agent World Model, csak egy-egy környezetre koncentráltak.
Kapcsolódó: Qwen gondolkodási láncjainak fejlesztése
Az Alibaba mindkét modellt három szakaszban, több mint 10 millió környezeti interakciós trajektórián képezte. Az első szakaszban a modell megtanulja a környezetek viselkedését, a másodikban a következő lépés előrejelzését, a harmadikban pedig megerősítéses tanulással finomítja az előrejelzéseket. Mindkét modell Mixture-of-Experts (MoE) kialakítású, ahol a 35B modell 3 milliárd, a 397B modell pedig 17 milliárd paramétert aktivál tokenenként. Mindkettő 256 ezer tokenes kontextusablakot támogat.
Kapcsolódó: Qwen3.7-Max autonóm működése
A teljesítménytesztek pontossága mellett a képzési eredmények is fontosak. A kutatók szerint a szimulált világban képzett ügynökök felülmúlták a valós környezetben tanultakat. A célzott perturbációk — például extra ügynöklépéseket kikényszerítő válaszok — a MCPMark pontszámot 24,6-ról 33,8-ra emelték. A Keresés teljesítményteszten a fikciós világokban tanult ügynökök 34,02-ről 50,31-re javították a WideSearch F1 Item mutatót a 35B modellen. A világmodell előképzés 62,29-ről 71,25-re javította a BFCL v4-et és 53,60-ról 64,88-ra a Claw-Evalt, ügynökspecifikus finomhangolás nélkül.
Kapcsolódó: Qwen3.6-27B paraméterei
A kutatók szerint a szimulált környezetekben tanult ügynökök túlzottan ráhangolódhatnak a szimulátor sajátosságaira. Azonban a kontollálható szimuláció és a valós keresési feladatokra átvitt eredmények ellensúlyozzák ezt az aggályt. Az Alibaba a 35B modell súlyait és az AgentWorldBench adatkészletet Apache 2.0 licenc alatt elérhetővé tette, a 397B modell súlyai nem nyilvánosak.
Kapcsolódó: Qwen3.6-35B-A3B kódoló ügynöke