ÉlőUtoljára: 5 órájaMa: 3
Modellek & LLMfrissítve: 10:50

MiniMax új eljárása 28-szorosára csökkenti az AI-figyelem számítási igényét

A MiniMax Sparse Attention (MSA) eljárás 28,4-szeresére csökkenti a tokenenkénti figyelem számítási igényét, miközben 1 millió tokenes kontextust képes kezelni.

MiniMax új eljárása 28-szorosára csökkenti az AI-figyelem számítási igényét
Fotó: Zach M / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Kétfiókos figyelmi blokkok

A MSA két szakaszra bontja a figyelmi folyamatot: egy Index Branch-re (indexelő ág) és egy Main Branch-re (fő ág). Az indexelő ág határozza meg, hogy mely kulcs-érték (key-value) blokkokat olvassa be az egyes lekérdezések (query). A fő ág ezután pontos softmax figyelmet alkalmaz csak ezeken a blokkokon.

Hogyan működik az indexelő és a fő ág?

Az Index Branch mindössze két projekciós mátrixot ad egy standard GQA réteghez. Egy index lekérdezési fejet és egy megosztott index kulcs fejet definiál. Ez pontozza a látható kulcs tokeneket, majd ezeket a pontszámokat blokkszintre max-poololja. A lekérdezés helyi blokkja mindig bekerül, így a kiválasztó nem hagyja ki a lekérdezés közvetlen környezetét.

Kapcsolódó: Together AI fejlesztés

A betanítás és a kernel-optimalizáció

Mivel a Top-k kiválasztás nem differenciálható, a nyelvi modellezési veszteség nem tudja betanítani az index projekciókat. A MSA ezt egy KL-divergencia alapú veszteséggel oldja meg, amely az Index Branch eloszlását a Main Branch figyelmi mintázatához igazítja.

Kapcsolódó: ART-rendszer

Összehasonlítás más sűrű módszerekkel

A MiniMax kutatói négy, natívan betanított sűrű dizájnnal hasonlították össze a MSA-t. A MSA megkülönböztető párosa a csoportonkénti Top-k megosztás, amely blokkszintű kiválasztással párosul. A teljesítményadatok szerint a MSA-PT és a MSA-CPT modellek szorosan versenyeznek a Full-Attention (teljes figyelmet használó) alapmodellel.

Kapcsolódó: FlashQLA

Alkalmazási területek

A MSA olyan munkaterheléseket céloz, ahol a kontextus hossza a fő korlátozó tényező. Ilyenek a hosszú távú ügynökök, amelyek több száz érvelési és cselekvési lépést halmoznak fel; a tároló-méretű kódok elemzését végző AI-k, amelyek több százezer tokent is betölthetnek.

Kapcsolódó: Moonshot AI

Elérhetőség

A MSA inferencia kernel a Hugging Face kernellibrary-n keresztül érhető el, és támogatja a BF16, FP8, NVFP4 és FP4 precíziós formátumokat. A MiniMax-M3 modell már használható, és a 3T tokenes betanítási költségvetés mellett a teljesítményadatok alapján a 109 milliárd paraméteres MoE modell kiemelkedő eredményeket mutatott a MMLU teljesítményteszten, ahol 67,2-es eredményt ért el.

Kapcsolódó: DeepSeek V3.2

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom