Két új többnyelvű keresőmodellt dob piacra a Liquid AI, 350 millió paraméterrel
A Liquid AI két új, 350M paraméteres keresőmodellt dobott piacra, amelyek 11 nyelven képesek gyors, többnyelvű és cross-lingual keresésre, miközben kis lábnyomukkal szinte bárhol futtathatók.

A Liquid AI bemutatta a LFM2.5-Embedding-350M és a LFM2.5-ColBERT-350M modelleket, amelyek a cég LFM családjának első kétirányú tagjai. A márciusban megjelent LFM2.5-350M-Base alapjaira épülő páros célja a gyors, többnyelvű és cross-lingual keresés 11 nyelven, és mindkettő azonnal elérhető a Hugging Face-en a LFM Open License v1.0 alatt.
A LFM2.5-Embedding-350M egy sűrű bi-encoder, amely minden dokumentumot egyetlen vektorrá alakít, így a leggyorsabb keresést és a legkisebb, legolcsóbb indexet kínálja. Ezzel szemben a LFM2.5-ColBERT-350M egy late-interaction modell, amely minden tokent vektorrá alakít, nem pedig dokumentumonként egyet. Ez lehetővé teszi a szókulcsszavas illesztést a magasabb pontosság és jobb általánosítás érdekében, cserébe nagyobb indexméretet igényel. A ColBERT modell lekérdezési hossza 32 tokenre korlátozódik, és képes az első körös retriever eredményeit átvizsgálni indexépítés nélkül.
Kapcsolódó: LFM2.5-350M tanulása
Architektúraváltás: kauzálisból kétirányúvá
Mindkét modell a LFM2.5-350M-Base köztes, általános célú checkpointjából indul ki. A Liquid AI apró, kétirányú javításokat alkalmaz a LFM2 architektúrán, adaptálva azt kauzális dekóderből kétirányú encoderre. A kauzális beállításban minden token csak önmagát és az előző tokeneket használja, ami balról jobbra generálásra alkalmas, de kevésbé természetes lekérdezéshez. A csapat a kauzális figyelmi maszkot kétirányú maszkra cserélte, így minden token képes mind a bal, mind a jobb kontextusra figyelni. Emellett a rövid konvolúciókat nem-kauzálisakká tették, amelyek szimmetrikusan keverik a helyi információkat minden token körül, nem csak a múltból. Ez megőrzi a LFM2 alap hatékonyságát, miközben a lekérdezéshez szükséges teljes kontextus reprezentációkat hoz létre. Mindegyik modell 17 rétegből áll: 10 konvolúciós, 6 figyelmi és 1 pooling vagy dense réteg. A kontextushossz elérheti a 32 768 tokent, bár a dokumentumok 512 tokenre vannak optimalizálva.
Kapcsolódó: 8B-A1B kontextus
Betanítás és adatok
A modellek betanítása három szakaszban történik: nagyszabású kontrasztív előbetanítás angolul, majd többnyelvű és cross-lingual desztilláció egy erős tanártól mind a 11 nyelven, végül pedig finomhangolás nehezen talált negatívokkal. Az Embedding modell valamivel több cross-lingual adatot kapott, mint a ColBERT, mivel a cross-lingual lekérdezés természetesebben jelenik meg a late-interaction felépítésben. A betanítási adatok kurált belső adatokat és nyílt forráskódú angol lekérdezési adatkészleteket kombinálnak, LLM-alapú fordítással bővítve a többnyelvű és cross-lingual párokat.
Kapcsolódó: Granite R2 teljesítménye
teljesítményteszt eredmények
A Liquid AI két képességet értékelt: többnyelvű lekérdezést a NanoBEIR-rel és cross-lingual open-domain QA-t a MKQA-11-gyel. Az eredmények szerint mindkét modell átlagosan a saját kategóriájában vezető. A LFM2.5-ColBERT-350M 0.605 NDCG@10 pontot ért el a NanoBEIR-en és 0.694 Recall@20-at a MKQA-11-en. A LFM2.5-Embedding-350M 0.577 NDCG@10-et és 0.691 Recall@20-at ért el. Mindkét modell felülmúlja a nagyobb Qwen3-Embedding-0.6B modellt, és az új ColBERT javulást mutat az előző LFM2-ColBERT-350M-hez képest. A NanoBEIR angol eredményei szorosan korrelálnak a teljes BEIR-rel, így a NanoBEIR-t praktikus proxyként használják a betanítás során.
Kapcsolódó: AntAngelMed hatékonysága
Alacsony késleltetés és peremhálózati telepítés
A Liquid AI GGUF változatokat adott ki a llama.cpp-hez, lehetővé téve a modellek futtatását CPU-kon, laptopokon és peremhálózati eszközökön. Egy MacBook Pro M4 Max-on FP16-on, előre kiszámított dokumentum-embeddingekkel, a medián lekérdezési késleltetés 10 ms alatt marad. Dokumentumok lekérdezéskori kódolása esetén a ColBERT 34.3 ms-ra lassul. Vállalati szinten az NVIDIA H100-on FP16-on a késleltetés akár 1 ms is lehet.
Kapcsolódó: PAR²-RAG pontossága
A modellek alkalmasak termékkatalógusok, GYIK-adatbázisok, támogatási dokumentumok és belső jogi, pénzügyi vagy technikai dokumentumok keresésére. A GGUF verzió lehetővé teszi helyi, privát keresést is fájlokban, e-mailekben vagy jegyzetekben. Az Embedding modell a sentence-transformers könyvtáron keresztül futtatható, míg a ColBERT a PyLate könyvtárral használható.