Új módszer csökkenti az orvosi AI-modellek hibáit
A kutatók egy új, kétirányú KL-regularizátort és vizuális-kontrasztív grounding célkitűzést alkalmaznak, amely tiszta és lézióval korrumpált képeket párosít, hogy csökkentsék az orvosi LVLM-ek hibáit.

A nagyméretű látás-nyelv modellek (LVLM) jelentős teljesítményt értek el az orvosi képalkotási feladatokban, de továbbra is hajlamosak ténybeli következetlenségekre, gyenge vizuális groundingra és klinikailag nem értelmes visszajelzésekre.
A kutatók új módszert dolgoztak ki a finom szemcsés preferencia-optimalizálás javítására az orvosi LVLM-ekben. A jelenlegi, képzés utáni igazítási megközelítések, mint a Direct Preference Optimization (DPO), három kritikus korlátba ütköznek az orvosi területen: a szekvencia-szintű jutalmazás azonosnak kezeli a klinikailag kritikus tokeneket és az általános kitöltőszöveget; a statikus felügyelt finomhangolási referenciákra való támaszkodás off-policy eloszláseltolódást okoz; és az igazítási célkitűzésekből hiányoznak az explicit vizuális grounding kényszerek.
Kapcsolódó: személyre szabott borítóképek
Az új módszer részletei
A javasolt módszer egy kétirányú, token-szintű KL-regularizátort, valamint egy vizuális-kontrasztív grounding célkitűzést használ. Ez utóbbi tiszta és lézióval korrumpált képeket párosít, hogy büntesse azokat a válaszokat, amelyeket nem megfelelő vizuális bizonyítékok alapján generáltak.
Kapcsolódó: LLM optimalizáció
Ezek az összetevők egy finom szemcsés, on-policy igazítási keretrendszert alkotnak. Ez a keretrendszer preferenciapárokat hoz létre a modell által generált kimenetek minimális szerkesztésével, csak a klinikailag hibás részeket javítva, miközben megőrzi az eredeti nyelvi stílust.
Kapcsolódó: személyre szabott LLM rangsorok
Eredmények és validálás
Kiterjedt kísérleteket végeztek orvosi képalkotási feladatokon és klinikai szöveggenerálási benchmarkokon. Az eredmények megerősítették az új megközelítés hatékonyságát a modell pontosságának és vizuális groundingjának javításában.
Kapcsolódó: AI-alapú orvosi diagnózisok
A kutatás az ArXiv-on érhető el, arXiv:2606.12590v1 azonosítóval.
Kapcsolódó: nyílt világú feladatmegoldás