ÉlőUtoljára: 25 perceMa: 44
Kutatásfrissítve: 08:30

Új diabétesz-LLM teljesítményteszt ellenőrzi a klinikai ajánlások megbízhatóságát

Az új T2D-Bench teljesítményteszt szerint a GPT-4o 33%-ban, a GPT-4o-mini 35%-ban hibázik a diabétesz-kezelési ajánlások ellenőrzésekor, nem felelnek meg az ADA irányelveknek.

Új diabétesz-LLM teljesítményteszt ellenőrzi a klinikai ajánlások megbízhatóságát
Fotó: diabetesmagazijn.nl / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az LLM-ek képesek folyékonyan ajánlásokat adni a 2-es típusú diabétesz kezelésére, de gyakran figyelmen kívül hagyják a klinikai irányelveket vagy nem indokolják meg életmódbeli javaslataikat. Ezt a problémát hivatott orvosolni a T2D-Bench, egy új, megismételhető teljesítményteszt és értékelési keretrendszer, amely a modellkimenetek megfelelőségét ellenőrzi a bizonyítékokon alapuló követelményekkel szemben — közölte az arXiv kutatócsoportja.

A T2D-Bench egy többrétegű tudásgráfra épül, amely egyesíti az orvosi alapot (UMLS, DrugBank, SIDER), a számítható ADA Standards of Care szabályokat és az életmódbeli tudást. Ez a mechanizmus összekapcsolja a glikémiás laboreredményeket a kezelési javaslatokkal, lehetővé téve a modellkimenetek pontosabb ellenőrzését.

Kapcsolódó: AI-alapú orvosi diagnózisok

Klinikai és életmódbeli konfliktusok tesztelése

A teljesítményteszt 100 strukturált esettanulmányt tartalmaz, amelyek diagnózisra, gyógyszerbiztonságra és ellentmondásos életmódbeli konfliktusokra terjednek ki. Az alap LLM-ek, mint a GPT-4o-mini és a GPT-4o, a teljesítményteszt által meghatározott bizonyíték-ellenőrzéseknél 35%, illetve 33% hibaszázalékot mutattak. Ez azt jelenti, hogy a modellek gyakran nem támasztották alá megfelelően javaslataikat.

Kapcsolódó: GISTBench felmérés

Az evidence gate szerepe

Az úgynevezett „evidence gate” képes kimutatni az alátámasztatlan hiányosságokat a modell kimeneteiben. Korlátozott revízióval képes a kimeneteket a teljesítményteszt által meghatározott bizonyíték-szintű megfelelőségre hozni, így javítva azok megbízhatóságát. Ez a megközelítés teszi lehetővé a klinikai ajánlások pontosságának mérését és javítását.

Kapcsolódó: LLM-ek hibaszázaléka

Az eredmények azt mutatják, hogy a számítható bizonyíték-korlátok segíthetnek feltárni, mérni és korrigálni a diabétesz-specifikus LLM-kimenetekben található, nem alátámasztott klinikai hiányosságokat. A kutatás célja az AI-biztonság és megbízhatóság növelése az egészségügyi alkalmazásokban, különösen a diabétesz kezelésében.

Kapcsolódó: BioTool adathalmaz

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom