ÉlőUtoljára: 2 órájaMa: 5
Modellek & LLMfrissítve: 10:10

ByteDance új diffúziós nyelvi modellje, az iLLaDA, felveszi a versenyt a Qwen2.5-tel

A ByteDance és a Renmin Egyetem kutatói által fejlesztett iLLaDA nevű 8 milliárd paraméteres diffúziós nyelvi modell alap teljesítményben enyhén, 63,9 ponttal meghaladja a Qwen2.5 7B modell 63,3 pontos eredményét.

ByteDance új diffúziós nyelvi modellje, az iLLaDA, felveszi a versenyt a Qwen2.5-tel
Fotó: Ecliptic Graphic / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

A hagyományos, szóról szóra szöveget generáló autoregresszív modellekkel szemben a ByteDance és a Renmin Egyetem kutatói által fejlesztett iLLaDA egy új megközelítést, a diffúziós nyelvi modellezést alkalmazza. A 8 milliárd paraméteres iLLaDA a szövegalkotást párhuzamos, többlépéses finomítással végzi, hasonlóan a képalkotó diffúziós modellekhez. Ez a megközelítés lehetővé teszi a mondat minden pozíciójának egyidejű figyelembevételét, így a folyamat kétirányúvá válik.

A Google DiffusionGemma modelljéhez hasonlóan az iLLaDA is a diffúziós technológiát használja, de míg a Google modellje sebességre optimalizált, addig az iLLaDA a minőségre fókuszál. A kutatók 12 trillió tokenen tanították elő a modellt, ami jelentősen több, mint elődje, a LLaDA 2,3 trillió tokenje. Az iLLaDA alap teljesítménye átlagosan 63,9 pontot ér el, ami enyhén meghaladja a Qwen2.5 7B modell 63,3 pontját.

Kapcsolódó: Dynin-Omni 19 multimodális modell

Összehasonlítás más diffúziós modellekkel

A Dream 7B diffúziós modellel összehasonlítva is az iLLaDA bizonyul jobbnak, átlagosan 63,9 pontot ér el, míg a Dream 61,4 pontot. A Dream modell korábbi Qwen2.5 ellenőrzőpontból lett finomhangolva, míg az iLLaDA a nulláról épült. A kódolási feladatokban a Dream modellnek van némi előnye.

Kapcsolódó: AntAngelMed orvosi AI

A finomhangolás hatása a teljesítményre

A finomhangolás után azonban az iLLaDA lemarad a Qwen2.5 mögött, különösen az instrukciós és kódolási feladatokban. Az iLLaDA-Instruct 67,1 pontot ér el, míg a Qwen2.5 7B Instruct 77,1 pontot. A szerzők ezt a különbséget a Qwen2.5 fejlettebb reinforcement learning (RL) illesztésének tulajdonítják, ami az iLLaDA-ból hiányzik. A kutatók megjegyzik, hogy a modell nehezebb feladatoknál hajlamos lehet ismétlődő gondolatmenetekbe ragadni.

Kapcsolódó: Alibaba Qwen multimodális fejlesztés

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom