ÉlőUtoljára: 3 órájaMa: 13
Modellek & LLMfrissítve: 01:50

PDF-ekből és képekből nyer ki adatokat a Datalab új, 9 milliárd paraméteres lift modellje

A modell elsősorban olyan ipari feladatokra készült, ahol a dokumentumalapú adatfeldolgozás hatékonyságának növelése kulcsfontosságú, például a banki, egészségügyi vagy logisztikai szektorokban.

PDF-ekből és képekből nyer ki adatokat a Datalab új, 9 milliárd paraméteres lift modellje
Fotó: AI Forradalom
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Datalab bemutatta a lift nevű, 9 milliárd paraméteres nyílt forráskódú látásmodellt, amely képes strukturált adatokat kinyerni PDF-ekből és képekből. A modell a megadott JSON-sémák alapján dolgozik, és azokat követve állít elő JSON objektumokat. Ez a Datalab első, kifejezetten adatkinyerésre tervezett modellje, amely korábbi OCR eszközeik, a chandra, marker és surya munkáját egészíti ki.

A lift működése és előnyei

A 9 milliárd paraméteres lift modell standard JSON-sémát fogad bemenetként, és a séma alakjának megfelelő, érvényes JSON-t ad vissza. A modell képes többoldalas dokumentumokat egyetlen feldolgozási lépésben kezelni, és olyan értékeket is kiolvasni, amelyek több oldalon ívelnek át. Kétféle futtatási mód áll rendelkezésre: helyi, HuggingFace-on keresztül, és távoli, vLLM szerveren futtatva, amelyet a Datalab ajánl gyártási környezetben. A kód Apache 2.0 licenc alatt érhető el, míg a súlyok egy módosított OpenRAIL-M licencet használnak.

Kapcsolódó: IBM Granite 4.0 3B Vision

Schema-Constrained Decoding: a magyarázó mechanizmus

A modell fő tervezési elve a séma-korlátozott dekódolás. A lift közvetlenül a megadott sémára dekódolja a kimenetet, így garantálva az érvényes JSON-formátumot. A folyamat során a JSON-séma Pydantic modellekké alakul, majd ezeket a vLLM szerver válaszformátum-korlátozásaként használja. A modell minden lépésben csak a séma által engedélyezett tokeneket választhatja ki, így biztosítva a szerkezeti integritást. Ez a garancia azonban csak a szerkezetre és a típusokra vonatkozik, nem a tartalom helyességére. Ha egy mező értéke helytelen, a modell akkor is érvényes típust ad vissza.

Kapcsolódó: Microsoft OpenMementos

Az absztinencia fontossága

A valós adatkinyerés egyik nagy kihívása nem csupán a létező mezők kiolvasása, hanem az olyan mezők kihagyása, amelyek nincsenek jelen a dokumentumban. A liftet úgy tanították, hogy az ilyen hiányzó mezőket null-értékkel adja vissza. Ez lehetővé teszi, hogy a modell jelezze, ha egy adat hiányzik, elkerülve a téves adatok generálását. A mezőket csak akkor érdemes kötelezőként megjelölni, ha azoknak mindenképpen szerepelniük kell a dokumentumban.

Kapcsolódó: GLM-5.2 SWE-bench Pro

A teljesítményteszt eredményei

A Datalab egy 225 dokumentumos teljesítményteszten értékelte a lift modellt, amely 6-64 oldalas dokumentumokat tartalmazott, mintegy 11 000 mezővel. A tesztelés során figyelembe vették a több oldalon átívelő értékeket, a kötelezően kihagyandó mezőket és a közeli elterelőket is. A lift 90,2%-os mezőpontossággal végzett a nyílt forráskódú modellek között, megelőzve a NuExtract3 és a Qwen3.5-9B modelleket. A modell 9,5 másodperces átlagos feldolgozási sebessége nagyjából háromszorosa a Gemini Flash 3.5-nek, miközben mezőpontossága közel azonos.

Kapcsolódó: NVIDIA NVFP4

Korlátok és jövőbeli kilátások

A lift modell kiválóan alkalmas mező-szintű adatkinyerésre, amely emberi felülvizsgálatot vagy analitikai összefoglalókat igényel. A teljes automatizáláshoz, ahol minden mezőnek hibátlannak kell lennie, a Datalab saját felhőalapú API-ját ajánlja, amely per-mező ellenőrzést, hivatkozásokat és konfidenciaszinteket is kínál. A modell nem támogatja az enum, anyOf/oneOf, $ref és additionalProperties típusú sémakonstrukciókat, és ezek használata esetén a strukturális garancia megszűnik.

Kapcsolódó: DeepSeek V3.2 teljesítménye

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom