ÉlőUtoljára: 3 órájaMa: 13
Kutatásfrissítve: 15:50

Google LLM-ek 0,74-es pontossággal szűrik a biomedicinai cikkeket

A Google három LLM-modelljének ensemble-ja 0,74-es F1-pontszámmal és pontossággal azonosítja az EQ-5D adatokat tartalmazó biomedicinai cikkeket, ami meghaladja az egyedi modellek teljesítményét.

Google LLM-ek 0,74-es pontossággal szűrik a biomedicinai cikkeket
Fotó: Viraj Karandikar / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

A Google kutatói új, ensemble-alapú módszert fejlesztettek ki a biomedicinai cikkek automatikus szűrésére, különös tekintettel az egészségügyi minőség-életadatokat, például EQ-5D-t tartalmazó tanulmányokra. A gyorsan növekvő tudományos publikációk mennyisége miatt a manuális áttekintés egyre több erőforrást igényel, és kevésbé hatékony, ezért az AI-alapú automatizálás kulcsfontosságúvá válik.

A kutatásban a Google Gemini és Gemma nagy nyelvi modelljeit (LLM) használták fel, egy többlépcsős keretrendszerben. Ez a módszer few-shot promptingot, súlyozott aggregációt és egy soft stacking meta-osztályozót integrál. Kilenc különböző LLM-et értékeltek egy olyan adathalmazon, amelyet két szakértő manuálisan címkézett az EQ-5D riportálás szempontjából.

Kapcsolódó: SHIELD klinikai adatkészlet

Az ensemble eredményei

A Gemini-2.5-Pro, Gemma-3-12B és Gemma-3-27B modellek súlyozott ensemble-ja 0,74-es weighted F1-score-t és 0,74-es pontosságot ért el. Ez az eredmény meghaladja az egyes modellek által önállóan elért eredményeket, ami azt mutatja, hogy az ensemble-megközelítés javítja a pontosság és a visszahívás (recall) közötti egyensúlyt. A soft stacking módszer emellett nagyobb megbízhatóságot és értelmezhetőséget biztosított az előrejelzésekhez.

Kapcsolódó: BioTool lekérdezések

A módszer és a korlátok

A modell valószínűségi kimenetei fontos jellemzőnek bizonyultak a végső döntések meghozatalában. A szerzők szerint az ensemble-alapú LLM-beállítás megbízható és skálázható megoldás a biomedicinai kutatások szűrésének automatizálására. A tanulmány azonban korlátozott minta-méretet és csak két annotátor által címkézett adatot használt, ezért további validáció szükséges más biomedicinai szűrési feladatokon és nagyobb corpusokon.

Kapcsolódó: LLM klinikai szöveggenerálás

A kutatást az arXiv preprint szerveren tették közzé, további validációra várva.

Kapcsolódó: LLM-bizonytalanság vakfolt

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom