Dokumentumok szűrése helyett táblázatokként való feldolgozása az új RAG-modellnél
Angela Shi szerint az üzleti dokumentumok feldolgozása során a kulcsszavas keresés helyett a szűrési módszerek hatékonyabbak, ahol a szöveg táblázatokként kerül feldolgozásra, mint a line_df és toc_df.

Angela Shi, a Towards Data Science munkatársa szerint az üzleti dokumentumok intelligens feldolgozásához (RAG) az eddigi kulcsszavas keresés helyett a szűrési módszereket kell előnyben részesíteni. Ez az új megközelítés a dokumentumokat strukturált táblázatokként kezeli, és a kulcsszavak együttes előfordulását figyeli, nem csak az egyes szavakét.
A dokumentumok táblázatokká válnak
A hagyományos megközelítés, miszerint a dokumentumok keresése során a leginkább hasonló részeket keressük, félrevezető lehet. Shi szerint a feldolgozás után a dokumentumok már nem szabad szövegként, hanem strukturált táblázatokként kezelhetők. Ez a megközelítés lehetővé teszi olyan módszerek alkalmazását, amelyek a klasszikus keresés során nem jelennek meg. A dokumentumok két fő táblázatként jelennek meg: a line_df, amely a szöveges tartalmat soronként tartalmazza, és a toc_df, amely a dokumentum tartalomjegyzékét képezi.
Kapcsolódó: LLM „Lost-in-the-Middle” hibája
Szűrés a strukturált adatokon
A line_df táblázat több tízezer sort tartalmazhat, míg a toc_df tipikusan csak 20-100 sort. A line_df tartalmazza a tényleges szöveget, amelyből az LLM válaszolni fog, míg a toc_df a dokumentum térképét jelenti, segítve a releváns részek megtalálását. A két táblázat méretbeli különbsége meghatározza, hogy milyen szűrési módszerek alkalmazhatók hatékonyan. A szűrési folyamat közelebb áll egy SQL-lekérdezéshez, mint egy Google-kereséshez.
Kapcsolódó: AI-módszer dokumentumértés javítása
Három kulcsfontosságú fejlesztés
Az új módszer három konkrét fejlesztést emel ki a hagyományos eljárásokhoz képest. Először is, a rendszer képes felismerni több kulcsszó együttes előfordulását egy oldalon vagy szakaszon belül, egyetlen feldolgozási lépésben. Másodszor, az optikai karakterfelismerés lehetővé teszi a beolvasott képek szövegének kereshetőségét, kiküszöbölve a kulcsszavas keresés egyik gyakori hibáját. Harmadszor, a tartalomjegyzék és a dokumentum tartalmának programatikus összekapcsolása lehetővé teszi a keresési terület szűkítését releváns szakaszokra, mielőtt a kulcsszószűrést alkalmaznánk.
Kapcsolódó: Pinecone Nexus tokenfelhasználás csökkentése
A kutatás a „Attention Is All You Need” (Vaswani et al.) című dokumentumon keresztül mutatja be a módszert, amely 15 oldalas és tiszta PDF tartalomjegyzékkel rendelkezik.
Kapcsolódó: AI-ügynökök konverzióereje