81-125 százalékkal növelte a kiszolgálási sebességet a Together AI
A Together AI a MiniMax M3 modell segítségével érte el a jelentős sebességnövekedést. A modell fejlett kódolási teljesítményt és natív multimodális érvelést kínál.

A MiniMax M3 egy új, minden az egyben AI-modell, amely fejlett kódolási teljesítményt, ügynökszerű munkafolyamat-támogatást és natív multimodális érvelést kínál. A modell 1 millió tokenes kontextusablakot támogat, miközben gazdaságosan kiszolgálható, így ideális hosszú dokumentumokkal, kódokkal, képekkel és iteratív érveléssel dolgozó feladatokhoz.
A Together AI lett a MiniMax M3 hivatalos felhőszolgáltató partnere. A cég mérnökei jelentős optimalizálásokat hajtottak végre, beleértve a KV-Block-Major sparse attention kernelt, a paged attention integrációt és a Rust-alapú multimodális előfeldolgozó átjárót. Ezeknek köszönhetően a kiszolgálási sebesség 81-125%-kal nőtt különböző terhelési szinteken.
Kapcsolódó: M5 Max Macbook Pro
MiniMax Sparse Attention (MSA)
A M3 legfontosabb újdonsága a MiniMax Sparse Attention (MSA), amely a korábbi M2.7 modell figyelmi számítási szűk keresztmetszetét hivatott megoldani. A MSA blokkos figyelmi mechanizmusa korlátozza, hogy egy lekérdezés (query) hány tokenre figyelhet, csökkentve a hosszú kontextus feldolgozásának költségeit. Ez a prefill fázisban több mint 9-szeres, a dekódolás során pedig több mint 15-szeres gyorsulást eredményez.
Kapcsolódó: LLM pontosság
Multimodális képességek és optimalizálás
A M3 natív multimodális támogatással is rendelkezik, beleértve egy vizuális komponenst, valamint új kép- és videó-előfeldolgozási funkciókat. A 1 millió tokenes kontextus támogatása mérnöki kihívást jelent, különösen a videó- és képfeldolgozás esetében, amelyek bonyolultabbak a szöveges tokenizálásnál. A KV-Block-Major sparse attention optimalizálása során a KV-mozgatás hatékonyságát növelték, iterálva a kulcs-érték csoportokat (key-value groups) a külső ciklusban.
Kapcsolódó: Proxy-Pointer RAG
Paged Attention integráció
A Together AI új módszert dolgozott ki a MiniMax Sparse Attention integrálására a paged attention motorba. A dekódolás során először egy lapozótáblát (page table) építenek a kiválasztott blokkok alapján, majd a lapozott KV-cache tenzorok segítségével biztosítják a figyelmi kernel számára a szükséges mutatókat. Ez a kialakítás lehetővé teszi a meglévő GQA-támogatással rendelkező figyelmi kernelek használatát, további 5%-os növekedést hozva a dekódolási sebességben.
Kapcsolódó: EAGLE3 dekódolás
A Together AI a MiniMax M3 nyílt súlyú modelljének publikus megjelenése után fejlesztői végpontként is elérhetővé teszi, az NVIDIA B200 chipeken végzett tesztek 81-125%-os átviteli sebesség-javulást mutattak, a MiniMax M3 modell segítségével.
Kapcsolódó: Gemma 4 modell