Látó LLM-ekkel törhetők fel a PDF-ek képei — a szövegen túl is olvasnak
A látó LLM-ek a szövegen túl az ábrákat is megértik, így a PDF-ek képei is kereshetővé válnak a RAG-rendszerek számára.

A hagyományos PDF-elemzők csak a szöveget látják, az ábrákat és diagramokat üres dobozként értelmezik. A látó nagy nyelvi modellek (LLM) azonban képesek a képeket is értelmezni, így a PDF-ek vizuális tartalma is kereshetővé válik a dokumentumintelligencia-rendszerekben.
Kezhan Shi, a Towards Data Science szerzője szerint a látó LLM-ek, mint a GPT-4.1, képesek egy diagram tartalmát egyetlen mondatban összefoglalni. Ez lehetővé teszi, hogy a felhasználók olyan információk alapján is keressenek, amelyek korábban rejtve maradtak a szöveges elemzők elől. Példaként említette a Transformer-diagramokat és a Világbanki árfolyam-grafikonokat, amelyeket a GPT-4.1 sikeresen írt le.
Kapcsolódó: PDF-szövegkivonás
Az ábrák kereshetőségének új dimenziója
A látó LLM-ek egyedi képessége, hogy a képeket is feldolgozzák. Míg a hagyományos OCR és elrendezés-elemzők csak a szöveges karaktereket tudják felismerni, a látó modellek képesek leírni egy műholdfelvétel tartalmát, például egy parkolóhelyet és az ott található autókat. Ezáltal a képek is relevánssá válnak a dokumentumkeresés szempontjából.
Kapcsolódó: képmodell fejlesztés
Szöveg és táblázat elemzés is
A látó LLM-ek nem csak a képeket, hanem a szöveget és a táblázatokat is képesek elemezni, hasonlóan a hagyományos módszerekhez. A NIST Cybersecurity Framework táblázatának elemzése során a GPT-4.1 sikeresen visszaadta a táblázat oszlopait és a cellák tartalmát, beleértve az egyesített cellákat is. A modell HTML-formátumban is képes kimenetet adni, ami rugalmasságot biztosít a további feldolgozáshoz.
Kapcsolódó: nyelvi modellek pénzügyben
A modellválasztás fontossága
A látó LLM-ek teljesítménye nagyban függ a választott modelltől. A GPT-4.1 hatékonyan olvassa a diagramokat, míg az olcsóbb GPT-4o-mini modell esetében a diagramok fele kimaradt, vagy táblázatként azonosította. Ez azt jelenti, hogy a modellválasztás nem csak a sebességet és a költségeket befolyásolja, hanem a képességek minőségét is, különösen a vizuális tartalom elemzésekor.
Kapcsolódó: dokumentumfeldolgozás
Költségek és pontosság
A látó LLM-ek használata lassabb és drágább lehet, mint a hagyományos elemzőké. A kiolvasott számok pontossága is megkérdőjelezhető, ezért azokat inkább iránymutatásként, semmint tényként kell kezelni. A modellek néha kihagyhatnak elemeket, ami a determinisztikus elemzőkkel szemben hiányosságot jelent.
Kapcsolódó: weboldalak AI-kompatibilitása
A parse_page_vision funkció az oldalt képként jeleníti meg, majd elküldi a látó LLM-nek, amely markdown formátumban adja vissza az elemzést, beleértve a képek leírását és transzkripcióját, a Towards Data Science szerint a GPT-4.1 modell segítségével.