ÉlőUtoljára: 1 órájaMa: 2
Eszközökfrissítve: 18:50

Dokumentumok szűrése helyett táblázatokként való feldolgozása az új RAG-modellnél

Angela Shi szerint az üzleti dokumentumok feldolgozása során a kulcsszavas keresés helyett a szűrési módszerek hatékonyabbak, ahol a szöveg táblázatokként kerül feldolgozásra, mint a line_df és toc_df.

Dokumentumok szűrése helyett táblázatokként való feldolgozása az új RAG-modellnél
Fotó: EqualStock / Unsplash
forrás: Towards Data Science·AI Forradalom szerk.·
Megosztás

Angela Shi, a Towards Data Science munkatársa szerint az üzleti dokumentumok intelligens feldolgozásához (RAG) az eddigi kulcsszavas keresés helyett a szűrési módszereket kell előnyben részesíteni. Ez az új megközelítés a dokumentumokat strukturált táblázatokként kezeli, és a kulcsszavak együttes előfordulását figyeli, nem csak az egyes szavakét.

A dokumentumok táblázatokká válnak

A hagyományos megközelítés, miszerint a dokumentumok keresése során a leginkább hasonló részeket keressük, félrevezető lehet. Shi szerint a feldolgozás után a dokumentumok már nem szabad szövegként, hanem strukturált táblázatokként kezelhetők. Ez a megközelítés lehetővé teszi olyan módszerek alkalmazását, amelyek a klasszikus keresés során nem jelennek meg. A dokumentumok két fő táblázatként jelennek meg: a line_df, amely a szöveges tartalmat soronként tartalmazza, és a toc_df, amely a dokumentum tartalomjegyzékét képezi.

Kapcsolódó: LLM „Lost-in-the-Middle” hibája

Szűrés a strukturált adatokon

A line_df táblázat több tízezer sort tartalmazhat, míg a toc_df tipikusan csak 20-100 sort. A line_df tartalmazza a tényleges szöveget, amelyből az LLM válaszolni fog, míg a toc_df a dokumentum térképét jelenti, segítve a releváns részek megtalálását. A két táblázat méretbeli különbsége meghatározza, hogy milyen szűrési módszerek alkalmazhatók hatékonyan. A szűrési folyamat közelebb áll egy SQL-lekérdezéshez, mint egy Google-kereséshez.

Kapcsolódó: AI-módszer dokumentumértés javítása

Három kulcsfontosságú fejlesztés

Az új módszer három konkrét fejlesztést emel ki a hagyományos eljárásokhoz képest. Először is, a rendszer képes felismerni több kulcsszó együttes előfordulását egy oldalon vagy szakaszon belül, egyetlen feldolgozási lépésben. Másodszor, az optikai karakterfelismerés lehetővé teszi a beolvasott képek szövegének kereshetőségét, kiküszöbölve a kulcsszavas keresés egyik gyakori hibáját. Harmadszor, a tartalomjegyzék és a dokumentum tartalmának programatikus összekapcsolása lehetővé teszi a keresési terület szűkítését releváns szakaszokra, mielőtt a kulcsszószűrést alkalmaznánk.

Kapcsolódó: Pinecone Nexus tokenfelhasználás csökkentése

A kutatás a „Attention Is All You Need” (Vaswani et al.) című dokumentumon keresztül mutatja be a módszert, amely 15 oldalas és tiszta PDF tartalomjegyzékkel rendelkezik.

Kapcsolódó: AI-ügynökök konverzióereje

Forrás

Feldolgozott sajtóforrás·Towards Data Science

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom