Az NVIDIA Nemotron 3 Embed modellje vezeti a RTEB ranglistát
Az NVIDIA Nemotron 3 Embed modellek, köztük a Nemotron-3-Embed-8B-BF16, a RTEB ranglistán értek el első helyet, javítva az AI-ügynökök válaszait és a RAG-rendszerek hatékonyságát.

Az NVIDIA bemutatta a Nemotron 3 Embed modellek gyűjteményét, amelyek célja a visszakeresési minőség javítása és praktikus üzembehelyezési lehetőségek biztosítása gyártási méretű RAG (Retrieval-Augmented Generation), ügynöki visszakeresés, kódvisszakeresés és ügynök memória rendszerek számára. A gyűjtemény három nyílt modellt tartalmaz, amelyek az NVIDIA saját mérései szerint a pontosság-hatékonyság görbén állnak a legfejlettebb helyen, élükön egy 8 milliárdos paraméterű modellel, amely a RTEB (Retrieval Embedding teljesítményteszt) ranglistát vezeti.
A Nemotron-3-Embed-8B-BF16 modell 78,5%-os eredményt ért el a RTEB teszten, és 75,5%-ot a MMTEB Retrieval teljesítményteszten. A kisebb, 1 milliárd paraméteres Nemotron-3-Embed-1B-BF16 modell 72,4%-ot ért el a RTEB-en, ami 27%-os hibacsökkenést jelent elődjéhez képest. A Nemotron-3-Embed-1B-NVFP4 pedig a Blackwell GPU-kra optimalizált változat, amely 4-bites kvantálással magas átviteli sebességet kínál kisebb memóriaprofillal.
Kapcsolódó: NVIDIA ASR-modell
A visszakeresés pontossága és hatékonysága
A több lépésből álló ügynöki munkafolyamatokban a rossz visszakeresés relevánstalan kontextusok lekéréséhez, ismételt lekérdezésekhez, token-költség pάζarlásához és zaj beviteléhez vezethet a későbbi érvelési lépésekbe. A Nemotron 3 Embed modellek célja, hogy ezt kiküszöböljék. Az NVIDIA által végzett értékelések szerint az erősebb visszakeresés csökkenti a lekérdezésenkénti downstream ügynöki tokenköltséget, mivel a pontosabb visszakeresők korábban szolgáltatják a releváns bizonyítékokat, ami kevesebb ismételt kereséshez és érvelési fordulóhoz vezet.
Kapcsolódó: Nemotron 3 Nano Omni
Optimalizált modellek Blackwell architektúrán
A nagy átviteli sebességű üzembe helyezésekhez a kisebb embedding modellek választása gyakori, hogy megfeleljenek a késleltetési és költségcéloknak. A Nemotron-3-Embed-1B-NVFP4 modell célja, hogy szűkítse a különbséget a kiszolgálási hatékonyság és a visszakeresési minőség között azáltal, hogy natív NVFP4 gyorsítást használ az NVIDIA Blackwell architektúrákon. A modell kvantálja a súlyokat és az aktivációkat NVFP4-re az effektív következtetés érdekében, és Quantization-Aware Distillation (QAD) technikát alkalmaz a pontosság helyreállítására hosszú bemeneti szekvenciák esetén.
Kapcsolódó: NVIDIA Nemotron 3 Ultra
A modellek azonnal elérhetők a Hugging Face-en, NVIDIA NIM mikroszervízként telepíthetők, támogatottak a vLLM által, és hozzáférhetők a vezető AI Cloud és következtetési partnereken keresztül. Az NVIDIA NeMo AutoModel receptek támogatják az adaptációt és a modell tömörítését.
Kapcsolódó: NVIDIA Star Elastic