A Qwen3 modellcsaládot új ügynökökkel fejlesztette tovább az Alibaba
Junyang Lin, az Alibaba Qwen-projekt korábbi vezetője szerint az ügynökök tanítása jelenti a jövőt, nem csupán a modellek finomhangolása. A Qwen3 modell 119 nyelvet és dialektust támogat.

Junyang Lin, az Alibaba Qwen-projekt korábbi technikai vezetője szerint az AI-modellek fejlesztésében a hangsúlyt az ügynökök tanítására kell helyezni. Lin, aki 2026. március 3-án lépett ki az Alibaba kötelékéből, most független kutatóként dolgozik, és korábbi előadásait, valamint részletes posztjait összevetve mutatja be a Qwen család fejlődését, kiemelve, hogy a jövő az ügynökökben rejlik.
A Qwen3 modell részletezése során Lin a hibrid gondolkodásmódokat emeli ki: a lépésről lépésre történő érvelést segítő 'thinking mode' és a közel azonnali válaszokat biztosító 'instruct mode' mellett dinamikus gondolkodási kereteket is bevezetett, amelyekkel a felhasználók korlátozhatják a modell által végzett érvelés mértékét. A Qwen3 emellett jelentősen bővítette többnyelvű támogatását, 29-ről 119 nyelvre és dialektusra.
Kapcsolódó: 10 ezer tokenes gondolkodás
A Qwen3 architektúrája és a hibrid gondolkodás kihívásai
A Qwen3 architektúrája többféle modellt foglal magában, 0,6 milliárd és 235 milliárd paraméter közötti méretekben, beleértve a sűrű és a Mixture-of-Experts (MoE) változatokat. A kisebb sűrű modellek 32K kontextushosszal rendelkeznek, míg a nagyobb sűrű és MoE modellek 128K kontextushosszt támogatnak, ahol a MoE modellek tokenenként 8 szakértőt aktiválnak a 128 elérhetőből. A modell kvantált formátumokban is elérhető, mint a GGUF, GPTQ, AWQ és MLX, Apache 2.0 licenc alatt.
Kapcsolódó: szimulált AI-ügynökök
Lin szerint a 'thinking' és 'instruct' módok összevonása nehézségekbe ütközött, mivel ezek a módok ellentétes irányba húzzák a modellt. A 'instruct' mód az egyenességet, tömörséget és alacsony késleltetést díjazza, míg a 'thinking' mód a bonyolult problémák megoldására fordított több tokenet. A Qwen3 kezdetben egy négylépcsős utókövetési folyamattal próbálta ezeket integrálni, de később, 2025-ben, külön 'Instruct' és 'Thinking' változatokat adtak ki. Lin ezt inkább adatproblémának tartja, mintsem modellproblémának, és megemlíti az Anthropic ellentétes megközelítését, ahol a Claude 3.7 Sonnet hibrid modellként, a Claude 4 pedig a kódoláshoz és hosszú feladatokhoz a gondolkodás és az eszközhasználat interleavingjével jelent meg.
Az érveléstől az ügynöki gondolkodásig
Lin két korszakot különböztet meg: az érvelő gondolkodást ('reasoning thinking') és az ügynöki gondolkodást ('agentic thinking'). Az előbbi, melyet az o1 és a DeepSeek-R1 képvisel, a determinisztikus, ellenőrizhető jutalmak fontosságára tanította a területet, főként a matematika, kódolás és logika terén. Az új korszak, az ügynöki gondolkodás, a cselekvés érdekében történő gondolkodást jelenti: az ügynökök terveket fogalmaznak meg, döntenek a cselekvésről, eszközöket használnak, visszajelzést dolgoznak fel a környezetből, és módosítanak. Ez a megközelítés a világban való zárt körű interakciót helyezi előtérbe, szemben a hosszú belső monológokkal.
Kapcsolódó: Qwen3.6 kódolási eredményei
Az ügynöki gondolkodás olyan feladatokat kezel, amelyeket a tiszta érvelés nem tud: eldönti, mikor hagyja abba a gondolkodást és cselekedjen, kiválasztja és sorrendbe állítja az eszközöket, beépíti a zajos vagy részleges környezeti megfigyeléseket, és módosítja a terveket a kudarcok után. Az optimalizálási cél is megváltozik: az érvelő gondolkodás a válasz minőségét, míg az ügynöki gondolkodás a feladat sikeres végrehajtását méri az interaktív környezetben.
Kapcsolódó: 35B paraméteres kódoló modell
Konkrét példák és az infrastruktúra kihívásai
A különbség a gyakorlatban is megmutatkozik. Kódolási ügynökök például tesztek futtatásával, hibák olvasásával és iteratív javítással dolgoznak, míg mély kutatási ügynökök al-lekérdezéseket generálnak, gyenge forrásokat elvetnek, és megalapozott hivatkozásokat adnak vissza. A Qwen saját Deep Research demója is ebbe a kategóriába tartozik. Lin szerint a többügynökös orchestrációban a 'harness engineering' válik kulcsfontosságúvá, ahol egy orchestrátor tervezi és irányítja a munkát, míg a speciális al-ügynökök szűkebb feladatokat végeznek.
A Qwen3-ban a 'hybrid thinking' közvetlenül kódolható a `enable_thinking` flag segítségével, amely a chat sablonban kapcsolható. A `enable_thinking=True` alapértelmezett, és a kimenet az érvelést egy `` blokkba foglalja. A `enable_thinking=False` pedig közel azonnali, nem gondolkodó módot aktivál. A Qwen3 per turn vezérlést is elfogad, `/think` vagy `/no_think` hozzáfűzésével a felhasználói üzenethez, ami a dinamikus gondolkodási keretek alapját képezi.
Kapcsolódó: multimodális AI fejlődése
A kutatás fő mérnöki pontja az infrastruktúra. Míg az érvelő RL-ben a rollouts nagyrészt önálló pályák, addig az ügynöki RL-ben a politika egy eszközszerverek, böngészők, terminálok és sandboxok alkotta 'harness'-ben él. Ez új követelményeket támaszt a rendszerrel szemben, melyek közül az egyik a train-serve decoupling.