ÉlőUtoljára: 3 órájaMa: 4
Modellek & LLMfrissítve: 22:50

81-125 százalékkal növelte a kiszolgálási sebességet a Together AI

A Together AI a MiniMax M3 modell segítségével érte el a jelentős sebességnövekedést. A modell fejlett kódolási teljesítményt és natív multimodális érvelést kínál.

81-125 százalékkal növelte a kiszolgálási sebességet a Together AI
Fotó: Pietro Jeng / Unsplash
forrás: Hetzner: Together AI·AI Forradalom szerk.·
Megosztás

A MiniMax M3 egy új, minden az egyben AI-modell, amely fejlett kódolási teljesítményt, ügynökszerű munkafolyamat-támogatást és natív multimodális érvelést kínál. A modell 1 millió tokenes kontextusablakot támogat, miközben gazdaságosan kiszolgálható, így ideális hosszú dokumentumokkal, kódokkal, képekkel és iteratív érveléssel dolgozó feladatokhoz.

A Together AI lett a MiniMax M3 hivatalos felhőszolgáltató partnere. A cég mérnökei jelentős optimalizálásokat hajtottak végre, beleértve a KV-Block-Major sparse attention kernelt, a paged attention integrációt és a Rust-alapú multimodális előfeldolgozó átjárót. Ezeknek köszönhetően a kiszolgálási sebesség 81-125%-kal nőtt különböző terhelési szinteken.

Kapcsolódó: M5 Max Macbook Pro

MiniMax Sparse Attention (MSA)

A M3 legfontosabb újdonsága a MiniMax Sparse Attention (MSA), amely a korábbi M2.7 modell figyelmi számítási szűk keresztmetszetét hivatott megoldani. A MSA blokkos figyelmi mechanizmusa korlátozza, hogy egy lekérdezés (query) hány tokenre figyelhet, csökkentve a hosszú kontextus feldolgozásának költségeit. Ez a prefill fázisban több mint 9-szeres, a dekódolás során pedig több mint 15-szeres gyorsulást eredményez.

Kapcsolódó: LLM pontosság

Multimodális képességek és optimalizálás

A M3 natív multimodális támogatással is rendelkezik, beleértve egy vizuális komponenst, valamint új kép- és videó-előfeldolgozási funkciókat. A 1 millió tokenes kontextus támogatása mérnöki kihívást jelent, különösen a videó- és képfeldolgozás esetében, amelyek bonyolultabbak a szöveges tokenizálásnál. A KV-Block-Major sparse attention optimalizálása során a KV-mozgatás hatékonyságát növelték, iterálva a kulcs-érték csoportokat (key-value groups) a külső ciklusban.

Kapcsolódó: Proxy-Pointer RAG

Paged Attention integráció

A Together AI új módszert dolgozott ki a MiniMax Sparse Attention integrálására a paged attention motorba. A dekódolás során először egy lapozótáblát (page table) építenek a kiválasztott blokkok alapján, majd a lapozott KV-cache tenzorok segítségével biztosítják a figyelmi kernel számára a szükséges mutatókat. Ez a kialakítás lehetővé teszi a meglévő GQA-támogatással rendelkező figyelmi kernelek használatát, további 5%-os növekedést hozva a dekódolási sebességben.

Kapcsolódó: EAGLE3 dekódolás

A Together AI a MiniMax M3 nyílt súlyú modelljének publikus megjelenése után fejlesztői végpontként is elérhetővé teszi, az NVIDIA B200 chipeken végzett tesztek 81-125%-os átviteli sebesség-javulást mutattak, a MiniMax M3 modell segítségével.

Kapcsolódó: Gemma 4 modell

Forrás

Feldolgozott sajtóforrás·Hetzner: Together AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom