MiniMax új eljárása 28-szorosára csökkenti az AI-figyelem számítási igényét
A MiniMax Sparse Attention (MSA) eljárás 28,4-szeresére csökkenti a tokenenkénti figyelem számítási igényét, miközben 1 millió tokenes kontextust képes kezelni.

Kétfiókos figyelmi blokkok
A MSA két szakaszra bontja a figyelmi folyamatot: egy Index Branch-re (indexelő ág) és egy Main Branch-re (fő ág). Az indexelő ág határozza meg, hogy mely kulcs-érték (key-value) blokkokat olvassa be az egyes lekérdezések (query). A fő ág ezután pontos softmax figyelmet alkalmaz csak ezeken a blokkokon.
Hogyan működik az indexelő és a fő ág?
Az Index Branch mindössze két projekciós mátrixot ad egy standard GQA réteghez. Egy index lekérdezési fejet és egy megosztott index kulcs fejet definiál. Ez pontozza a látható kulcs tokeneket, majd ezeket a pontszámokat blokkszintre max-poololja. A lekérdezés helyi blokkja mindig bekerül, így a kiválasztó nem hagyja ki a lekérdezés közvetlen környezetét.
Kapcsolódó: Together AI fejlesztés
A betanítás és a kernel-optimalizáció
Mivel a Top-k kiválasztás nem differenciálható, a nyelvi modellezési veszteség nem tudja betanítani az index projekciókat. A MSA ezt egy KL-divergencia alapú veszteséggel oldja meg, amely az Index Branch eloszlását a Main Branch figyelmi mintázatához igazítja.
Kapcsolódó: ART-rendszer
Összehasonlítás más sűrű módszerekkel
A MiniMax kutatói négy, natívan betanított sűrű dizájnnal hasonlították össze a MSA-t. A MSA megkülönböztető párosa a csoportonkénti Top-k megosztás, amely blokkszintű kiválasztással párosul. A teljesítményadatok szerint a MSA-PT és a MSA-CPT modellek szorosan versenyeznek a Full-Attention (teljes figyelmet használó) alapmodellel.
Kapcsolódó: FlashQLA
Alkalmazási területek
A MSA olyan munkaterheléseket céloz, ahol a kontextus hossza a fő korlátozó tényező. Ilyenek a hosszú távú ügynökök, amelyek több száz érvelési és cselekvési lépést halmoznak fel; a tároló-méretű kódok elemzését végző AI-k, amelyek több százezer tokent is betölthetnek.
Kapcsolódó: Moonshot AI
Elérhetőség
A MSA inferencia kernel a Hugging Face kernellibrary-n keresztül érhető el, és támogatja a BF16, FP8, NVFP4 és FP4 precíziós formátumokat. A MiniMax-M3 modell már használható, és a 3T tokenes betanítási költségvetés mellett a teljesítményadatok alapján a 109 milliárd paraméteres MoE modell kiemelkedő eredményeket mutatott a MMLU teljesítményteszten, ahol 67,2-es eredményt ért el.
Kapcsolódó: DeepSeek V3.2