Új diabétesz-LLM teljesítményteszt ellenőrzi a klinikai ajánlások megbízhatóságát
Az új T2D-Bench teljesítményteszt szerint a GPT-4o 33%-ban, a GPT-4o-mini 35%-ban hibázik a diabétesz-kezelési ajánlások ellenőrzésekor, nem felelnek meg az ADA irányelveknek.

Az LLM-ek képesek folyékonyan ajánlásokat adni a 2-es típusú diabétesz kezelésére, de gyakran figyelmen kívül hagyják a klinikai irányelveket vagy nem indokolják meg életmódbeli javaslataikat. Ezt a problémát hivatott orvosolni a T2D-Bench, egy új, megismételhető teljesítményteszt és értékelési keretrendszer, amely a modellkimenetek megfelelőségét ellenőrzi a bizonyítékokon alapuló követelményekkel szemben — közölte az arXiv kutatócsoportja.
A T2D-Bench egy többrétegű tudásgráfra épül, amely egyesíti az orvosi alapot (UMLS, DrugBank, SIDER), a számítható ADA Standards of Care szabályokat és az életmódbeli tudást. Ez a mechanizmus összekapcsolja a glikémiás laboreredményeket a kezelési javaslatokkal, lehetővé téve a modellkimenetek pontosabb ellenőrzését.
Kapcsolódó: AI-alapú orvosi diagnózisok
Klinikai és életmódbeli konfliktusok tesztelése
A teljesítményteszt 100 strukturált esettanulmányt tartalmaz, amelyek diagnózisra, gyógyszerbiztonságra és ellentmondásos életmódbeli konfliktusokra terjednek ki. Az alap LLM-ek, mint a GPT-4o-mini és a GPT-4o, a teljesítményteszt által meghatározott bizonyíték-ellenőrzéseknél 35%, illetve 33% hibaszázalékot mutattak. Ez azt jelenti, hogy a modellek gyakran nem támasztották alá megfelelően javaslataikat.
Kapcsolódó: GISTBench felmérés
Az evidence gate szerepe
Az úgynevezett „evidence gate” képes kimutatni az alátámasztatlan hiányosságokat a modell kimeneteiben. Korlátozott revízióval képes a kimeneteket a teljesítményteszt által meghatározott bizonyíték-szintű megfelelőségre hozni, így javítva azok megbízhatóságát. Ez a megközelítés teszi lehetővé a klinikai ajánlások pontosságának mérését és javítását.
Kapcsolódó: LLM-ek hibaszázaléka
Az eredmények azt mutatják, hogy a számítható bizonyíték-korlátok segíthetnek feltárni, mérni és korrigálni a diabétesz-specifikus LLM-kimenetekben található, nem alátámasztott klinikai hiányosságokat. A kutatás célja az AI-biztonság és megbízhatóság növelése az egészségügyi alkalmazásokban, különösen a diabétesz kezelésében.
Kapcsolódó: BioTool adathalmaz