Alibaba robotikai AI-ja látásból cselekvésbe vált — új modellekkel
Az Alibaba Qwen-Robot Suite-ja a látás és cselekvés közötti szakadékot hidalja át, három új modellel, amelyek a fizikai világban való mozgást és manipulációt célozzák.

Az Alibaba bemutatta a Qwen-Robot Suite-ot, amely a korábbi, csak kódolási és nyelvi feladatokra korlátozódó Qwen család fizikai világban való cselekvésre is képes verziója. A lépés a mesterséges intelligencia (AI) egy új határát célozza meg: az embodied AI, vagyis a fizikai tárgyakkal interakcióba lépni képes AI képességeit.
A Tongyi Lab csapata szerint a legnagyobb kihívás nem az AI intelligenciájában, hanem a látottakat fizikai mozdulatokká alakító fordítórétegben rejlik. A korábbi modellek képesek voltak részletesen leírni egy tárgyat, de nem tudták azt fizikailag megmozdítani. Ezt a szakadékot hivatott áthidalni az új robotikai csomag.
Kapcsolódó: Claude Opus 4.8 kódírási javítása
Új modellek a fizikai világért
Az Alibaba három új modellt vezetett be: a Qwen-RobotNav-ot a navigációhoz, a Qwen-RobotManip-ot a tárgyak manipulálásához, és a Qwen-RobotWorld-öt a környezet változásainak előrejelzéséhez. Ezek a modellek arra hivatottak, hogy a robotok képesek legyenek előre látni tetteik következményeit, mielőtt azokat végrehajtanák. A Sequence szerint a modellcsalád érdekesebb a fogalmazott megközelítés miatt, mint bármelyik konkrét teljesítményteszt-szám miatt.
Kapcsolódó: Qwen 10 ezer tokenes gondolkodás
Tokenizáció, nem intelligencia a szűk keresztmetszet
A kutatás kiemeli, hogy a fő akadály a fizikai világban való cselekvésben nem az AI intelligenciája, hanem a tokenizáció. Ez a folyamat alakítja át a vizuális és szenzoros adatokat a modell által feldolgozható formátummá. Az Alibaba szerint a Qwen-Robot Suite arra összpontosít, hogy ezt a fordítóréteget optimalizálja, lehetővé téve a robotok számára a valós idejű, fizikai interakciót — közölte a The Sequence.
Kapcsolódó: Qwen-Scope és az AI értelmezhetősége