ÉlőUtoljára: 27 perceMa: 8
Modellek & LLMfrissítve: 18:50

Bemutatta a MiniMax M3 modellt az NVIDIA, 428 milliárd paraméterrel és 1 millió token kontextusával

A 428 milliárd paraméteres MiniMax M3 modell 1 millió token kontextusával és natív multimodalitásával az NVIDIA Blackwell infrastruktúrán fut, egyesítve a szöveg-, látás- és kódfeladatokat.

Bemutatta a MiniMax M3 modellt az NVIDIA, 428 milliárd paraméterrel és 1 millió token kontextusával
Fotó: Mohamed Nohassi / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

A MiniMax M3, egy 428 milliárd paraméteres, 1 millió token kontextusú és natív multimodális képességekkel rendelkező modell érkezik az NVIDIA Blackwell infrastruktúrájára. A modell képes lesz ügynöki munkafolyamatok és kiterjesztett kreatív alkalmazások futtatására egyetlen architektúrán belül.

A MiniMax M3 modell 4x gyorsabb kontextus-hozzáférést és 1/20-ad per-token számítási költséget biztosít 1 millió token kontextus mellett, jelentős gyorsulást kínálva előzetes betöltésben és dekódolásban, veszteség vagy tömörítés nélkül – közölte az Nvidia Developer Blog.

Kapcsolódó: NVIDIA Star Elastic

MiniMax Sparse Attention

A modell alapvető építészeti újítása a MiniMax Sparse Attention (MSA), amely standard kvadratikus figyelmet egy előzetes szűrési szakaszra cseréli. Ez azonosítja a releváns kontextusblokkokat, és csak azokra összpontosít. Az operátori szinten minden KV gyorsítótár blokkot egyszer olvasnak ki, ami több mint 4x gyorsabb a jelenlegi ritka figyelmi implementációknál.

Kapcsolódó: Nemotron 3 Nano

Nyílt forráskódú és skálázható telepítés

A fejlesztők választhatnak nyílt forráskódú inference engine-ek közül, mint az NVIDIA TensorRT LLM, SGLang vagy vLLM. Az NVIDIA Dynamo platformmal a MiniMax M3 nagy léptékű alkalmazásokhoz telepíthető, diszkretizált inference-szel, amely szétválasztja az előzetes betöltési és dekódolási fázisokat. A testreszabáshoz az NVIDIA NeMo Framework használható, amely támogatja a teljes N-D párhuzamosságot és a kontextus párhuzamosságot 128k tokenig.

Kapcsolódó: Trinity Large Thinking

A MiniMax M3 modell súlyai letölthetők a Hugging Face-ről, a modell az NVIDIA build.nvidia.com API-ján keresztül kipróbálható, az NVIDIA Dynamo platformon június 12-től érhető el.

Kapcsolódó: Edge AI fejlesztés

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom