ÉlőUtoljára: 1 órájaMa: 3
Modellek & LLMfrissítve: 10:15

Az NVIDIA Nemotron 3 Embed modellje vezeti a RTEB ranglistát

Az NVIDIA Nemotron 3 Embed modellek, köztük a Nemotron-3-Embed-8B-BF16, a RTEB ranglistán értek el első helyet, javítva az AI-ügynökök válaszait és a RAG-rendszerek hatékonyságát.

Az NVIDIA Nemotron 3 Embed modellje vezeti a RTEB ranglistát
Fotó: Thufeil M / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

Az NVIDIA bemutatta a Nemotron 3 Embed modellek gyűjteményét, amelyek célja a visszakeresési minőség javítása és praktikus üzembehelyezési lehetőségek biztosítása gyártási méretű RAG (Retrieval-Augmented Generation), ügynöki visszakeresés, kódvisszakeresés és ügynök memória rendszerek számára. A gyűjtemény három nyílt modellt tartalmaz, amelyek az NVIDIA saját mérései szerint a pontosság-hatékonyság görbén állnak a legfejlettebb helyen, élükön egy 8 milliárdos paraméterű modellel, amely a RTEB (Retrieval Embedding teljesítményteszt) ranglistát vezeti.

A Nemotron-3-Embed-8B-BF16 modell 78,5%-os eredményt ért el a RTEB teszten, és 75,5%-ot a MMTEB Retrieval teljesítményteszten. A kisebb, 1 milliárd paraméteres Nemotron-3-Embed-1B-BF16 modell 72,4%-ot ért el a RTEB-en, ami 27%-os hibacsökkenést jelent elődjéhez képest. A Nemotron-3-Embed-1B-NVFP4 pedig a Blackwell GPU-kra optimalizált változat, amely 4-bites kvantálással magas átviteli sebességet kínál kisebb memóriaprofillal.

Kapcsolódó: NVIDIA ASR-modell

A visszakeresés pontossága és hatékonysága

A több lépésből álló ügynöki munkafolyamatokban a rossz visszakeresés relevánstalan kontextusok lekéréséhez, ismételt lekérdezésekhez, token-költség pάζarlásához és zaj beviteléhez vezethet a későbbi érvelési lépésekbe. A Nemotron 3 Embed modellek célja, hogy ezt kiküszöböljék. Az NVIDIA által végzett értékelések szerint az erősebb visszakeresés csökkenti a lekérdezésenkénti downstream ügynöki tokenköltséget, mivel a pontosabb visszakeresők korábban szolgáltatják a releváns bizonyítékokat, ami kevesebb ismételt kereséshez és érvelési fordulóhoz vezet.

Kapcsolódó: Nemotron 3 Nano Omni

Optimalizált modellek Blackwell architektúrán

A nagy átviteli sebességű üzembe helyezésekhez a kisebb embedding modellek választása gyakori, hogy megfeleljenek a késleltetési és költségcéloknak. A Nemotron-3-Embed-1B-NVFP4 modell célja, hogy szűkítse a különbséget a kiszolgálási hatékonyság és a visszakeresési minőség között azáltal, hogy natív NVFP4 gyorsítást használ az NVIDIA Blackwell architektúrákon. A modell kvantálja a súlyokat és az aktivációkat NVFP4-re az effektív következtetés érdekében, és Quantization-Aware Distillation (QAD) technikát alkalmaz a pontosság helyreállítására hosszú bemeneti szekvenciák esetén.

Kapcsolódó: NVIDIA Nemotron 3 Ultra

A modellek azonnal elérhetők a Hugging Face-en, NVIDIA NIM mikroszervízként telepíthetők, támogatottak a vLLM által, és hozzáférhetők a vezető AI Cloud és következtetési partnereken keresztül. Az NVIDIA NeMo AutoModel receptek támogatják az adaptációt és a modell tömörítését.

Kapcsolódó: NVIDIA Star Elastic

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom