ÉlőUtoljára: 1 perceMa: 1
Modellek & LLMfrissítve: 13:30

Két új többnyelvű keresőmodellt dob piacra a Liquid AI, 350 millió paraméterrel

A Liquid AI két új, 350M paraméteres keresőmodellt dobott piacra, amelyek 11 nyelven képesek gyors, többnyelvű és cross-lingual keresésre, miközben kis lábnyomukkal szinte bárhol futtathatók.

Két új többnyelvű keresőmodellt dob piacra a Liquid AI, 350 millió paraméterrel
Fotó: ZHENYU LUO / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Liquid AI bemutatta a LFM2.5-Embedding-350M és a LFM2.5-ColBERT-350M modelleket, amelyek a cég LFM családjának első kétirányú tagjai. A márciusban megjelent LFM2.5-350M-Base alapjaira épülő páros célja a gyors, többnyelvű és cross-lingual keresés 11 nyelven, és mindkettő azonnal elérhető a Hugging Face-en a LFM Open License v1.0 alatt.

A LFM2.5-Embedding-350M egy sűrű bi-encoder, amely minden dokumentumot egyetlen vektorrá alakít, így a leggyorsabb keresést és a legkisebb, legolcsóbb indexet kínálja. Ezzel szemben a LFM2.5-ColBERT-350M egy late-interaction modell, amely minden tokent vektorrá alakít, nem pedig dokumentumonként egyet. Ez lehetővé teszi a szókulcsszavas illesztést a magasabb pontosság és jobb általánosítás érdekében, cserébe nagyobb indexméretet igényel. A ColBERT modell lekérdezési hossza 32 tokenre korlátozódik, és képes az első körös retriever eredményeit átvizsgálni indexépítés nélkül.

Kapcsolódó: LFM2.5-350M tanulása

Architektúraváltás: kauzálisból kétirányúvá

Mindkét modell a LFM2.5-350M-Base köztes, általános célú checkpointjából indul ki. A Liquid AI apró, kétirányú javításokat alkalmaz a LFM2 architektúrán, adaptálva azt kauzális dekóderből kétirányú encoderre. A kauzális beállításban minden token csak önmagát és az előző tokeneket használja, ami balról jobbra generálásra alkalmas, de kevésbé természetes lekérdezéshez. A csapat a kauzális figyelmi maszkot kétirányú maszkra cserélte, így minden token képes mind a bal, mind a jobb kontextusra figyelni. Emellett a rövid konvolúciókat nem-kauzálisakká tették, amelyek szimmetrikusan keverik a helyi információkat minden token körül, nem csak a múltból. Ez megőrzi a LFM2 alap hatékonyságát, miközben a lekérdezéshez szükséges teljes kontextus reprezentációkat hoz létre. Mindegyik modell 17 rétegből áll: 10 konvolúciós, 6 figyelmi és 1 pooling vagy dense réteg. A kontextushossz elérheti a 32 768 tokent, bár a dokumentumok 512 tokenre vannak optimalizálva.

Kapcsolódó: 8B-A1B kontextus

Betanítás és adatok

A modellek betanítása három szakaszban történik: nagyszabású kontrasztív előbetanítás angolul, majd többnyelvű és cross-lingual desztilláció egy erős tanártól mind a 11 nyelven, végül pedig finomhangolás nehezen talált negatívokkal. Az Embedding modell valamivel több cross-lingual adatot kapott, mint a ColBERT, mivel a cross-lingual lekérdezés természetesebben jelenik meg a late-interaction felépítésben. A betanítási adatok kurált belső adatokat és nyílt forráskódú angol lekérdezési adatkészleteket kombinálnak, LLM-alapú fordítással bővítve a többnyelvű és cross-lingual párokat.

Kapcsolódó: Granite R2 teljesítménye

teljesítményteszt eredmények

A Liquid AI két képességet értékelt: többnyelvű lekérdezést a NanoBEIR-rel és cross-lingual open-domain QA-t a MKQA-11-gyel. Az eredmények szerint mindkét modell átlagosan a saját kategóriájában vezető. A LFM2.5-ColBERT-350M 0.605 NDCG@10 pontot ért el a NanoBEIR-en és 0.694 Recall@20-at a MKQA-11-en. A LFM2.5-Embedding-350M 0.577 NDCG@10-et és 0.691 Recall@20-at ért el. Mindkét modell felülmúlja a nagyobb Qwen3-Embedding-0.6B modellt, és az új ColBERT javulást mutat az előző LFM2-ColBERT-350M-hez képest. A NanoBEIR angol eredményei szorosan korrelálnak a teljes BEIR-rel, így a NanoBEIR-t praktikus proxyként használják a betanítás során.

Kapcsolódó: AntAngelMed hatékonysága

Alacsony késleltetés és peremhálózati telepítés

A Liquid AI GGUF változatokat adott ki a llama.cpp-hez, lehetővé téve a modellek futtatását CPU-kon, laptopokon és peremhálózati eszközökön. Egy MacBook Pro M4 Max-on FP16-on, előre kiszámított dokumentum-embeddingekkel, a medián lekérdezési késleltetés 10 ms alatt marad. Dokumentumok lekérdezéskori kódolása esetén a ColBERT 34.3 ms-ra lassul. Vállalati szinten az NVIDIA H100-on FP16-on a késleltetés akár 1 ms is lehet.

Kapcsolódó: PAR²-RAG pontossága

A modellek alkalmasak termékkatalógusok, GYIK-adatbázisok, támogatási dokumentumok és belső jogi, pénzügyi vagy technikai dokumentumok keresésére. A GGUF verzió lehetővé teszi helyi, privát keresést is fájlokban, e-mailekben vagy jegyzetekben. Az Embedding modell a sentence-transformers könyvtáron keresztül futtatható, míg a ColBERT a PyLate könyvtárral használható.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom