Bemutatta a MiniMax M3 modellt az NVIDIA, 428 milliárd paraméterrel és 1 millió token kontextusával
A 428 milliárd paraméteres MiniMax M3 modell 1 millió token kontextusával és natív multimodalitásával az NVIDIA Blackwell infrastruktúrán fut, egyesítve a szöveg-, látás- és kódfeladatokat.

A MiniMax M3, egy 428 milliárd paraméteres, 1 millió token kontextusú és natív multimodális képességekkel rendelkező modell érkezik az NVIDIA Blackwell infrastruktúrájára. A modell képes lesz ügynöki munkafolyamatok és kiterjesztett kreatív alkalmazások futtatására egyetlen architektúrán belül.
A MiniMax M3 modell 4x gyorsabb kontextus-hozzáférést és 1/20-ad per-token számítási költséget biztosít 1 millió token kontextus mellett, jelentős gyorsulást kínálva előzetes betöltésben és dekódolásban, veszteség vagy tömörítés nélkül – közölte az Nvidia Developer Blog.
Kapcsolódó: NVIDIA Star Elastic
MiniMax Sparse Attention
A modell alapvető építészeti újítása a MiniMax Sparse Attention (MSA), amely standard kvadratikus figyelmet egy előzetes szűrési szakaszra cseréli. Ez azonosítja a releváns kontextusblokkokat, és csak azokra összpontosít. Az operátori szinten minden KV gyorsítótár blokkot egyszer olvasnak ki, ami több mint 4x gyorsabb a jelenlegi ritka figyelmi implementációknál.
Kapcsolódó: Nemotron 3 Nano
Nyílt forráskódú és skálázható telepítés
A fejlesztők választhatnak nyílt forráskódú inference engine-ek közül, mint az NVIDIA TensorRT LLM, SGLang vagy vLLM. Az NVIDIA Dynamo platformmal a MiniMax M3 nagy léptékű alkalmazásokhoz telepíthető, diszkretizált inference-szel, amely szétválasztja az előzetes betöltési és dekódolási fázisokat. A testreszabáshoz az NVIDIA NeMo Framework használható, amely támogatja a teljes N-D párhuzamosságot és a kontextus párhuzamosságot 128k tokenig.
Kapcsolódó: Trinity Large Thinking
A MiniMax M3 modell súlyai letölthetők a Hugging Face-ről, a modell az NVIDIA build.nvidia.com API-ján keresztül kipróbálható, az NVIDIA Dynamo platformon június 12-től érhető el.
Kapcsolódó: Edge AI fejlesztés