PDF-ekből és képekből nyer ki adatokat a Datalab új, 9 milliárd paraméteres lift modellje
A modell elsősorban olyan ipari feladatokra készült, ahol a dokumentumalapú adatfeldolgozás hatékonyságának növelése kulcsfontosságú, például a banki, egészségügyi vagy logisztikai szektorokban.

A Datalab bemutatta a lift nevű, 9 milliárd paraméteres nyílt forráskódú látásmodellt, amely képes strukturált adatokat kinyerni PDF-ekből és képekből. A modell a megadott JSON-sémák alapján dolgozik, és azokat követve állít elő JSON objektumokat. Ez a Datalab első, kifejezetten adatkinyerésre tervezett modellje, amely korábbi OCR eszközeik, a chandra, marker és surya munkáját egészíti ki.
A lift működése és előnyei
A 9 milliárd paraméteres lift modell standard JSON-sémát fogad bemenetként, és a séma alakjának megfelelő, érvényes JSON-t ad vissza. A modell képes többoldalas dokumentumokat egyetlen feldolgozási lépésben kezelni, és olyan értékeket is kiolvasni, amelyek több oldalon ívelnek át. Kétféle futtatási mód áll rendelkezésre: helyi, HuggingFace-on keresztül, és távoli, vLLM szerveren futtatva, amelyet a Datalab ajánl gyártási környezetben. A kód Apache 2.0 licenc alatt érhető el, míg a súlyok egy módosított OpenRAIL-M licencet használnak.
Kapcsolódó: IBM Granite 4.0 3B Vision
Schema-Constrained Decoding: a magyarázó mechanizmus
A modell fő tervezési elve a séma-korlátozott dekódolás. A lift közvetlenül a megadott sémára dekódolja a kimenetet, így garantálva az érvényes JSON-formátumot. A folyamat során a JSON-séma Pydantic modellekké alakul, majd ezeket a vLLM szerver válaszformátum-korlátozásaként használja. A modell minden lépésben csak a séma által engedélyezett tokeneket választhatja ki, így biztosítva a szerkezeti integritást. Ez a garancia azonban csak a szerkezetre és a típusokra vonatkozik, nem a tartalom helyességére. Ha egy mező értéke helytelen, a modell akkor is érvényes típust ad vissza.
Kapcsolódó: Microsoft OpenMementos
Az absztinencia fontossága
A valós adatkinyerés egyik nagy kihívása nem csupán a létező mezők kiolvasása, hanem az olyan mezők kihagyása, amelyek nincsenek jelen a dokumentumban. A liftet úgy tanították, hogy az ilyen hiányzó mezőket null-értékkel adja vissza. Ez lehetővé teszi, hogy a modell jelezze, ha egy adat hiányzik, elkerülve a téves adatok generálását. A mezőket csak akkor érdemes kötelezőként megjelölni, ha azoknak mindenképpen szerepelniük kell a dokumentumban.
Kapcsolódó: GLM-5.2 SWE-bench Pro
A teljesítményteszt eredményei
A Datalab egy 225 dokumentumos teljesítményteszten értékelte a lift modellt, amely 6-64 oldalas dokumentumokat tartalmazott, mintegy 11 000 mezővel. A tesztelés során figyelembe vették a több oldalon átívelő értékeket, a kötelezően kihagyandó mezőket és a közeli elterelőket is. A lift 90,2%-os mezőpontossággal végzett a nyílt forráskódú modellek között, megelőzve a NuExtract3 és a Qwen3.5-9B modelleket. A modell 9,5 másodperces átlagos feldolgozási sebessége nagyjából háromszorosa a Gemini Flash 3.5-nek, miközben mezőpontossága közel azonos.
Kapcsolódó: NVIDIA NVFP4
Korlátok és jövőbeli kilátások
A lift modell kiválóan alkalmas mező-szintű adatkinyerésre, amely emberi felülvizsgálatot vagy analitikai összefoglalókat igényel. A teljes automatizáláshoz, ahol minden mezőnek hibátlannak kell lennie, a Datalab saját felhőalapú API-ját ajánlja, amely per-mező ellenőrzést, hivatkozásokat és konfidenciaszinteket is kínál. A modell nem támogatja az enum, anyOf/oneOf, $ref és additionalProperties típusú sémakonstrukciókat, és ezek használata esetén a strukturális garancia megszűnik.
Kapcsolódó: DeepSeek V3.2 teljesítménye