Mentálhigiénés AI-válaszok biztonságát nem lehet megbízhatóan mérni szakértők véleményével
Három okleveles pszichiáter 360 AI-választ értékelt, de véleményük gyakran ellentmondott egymásnak, rámutatva a biztonsági ellenőrzések megbízhatóságának hiányára. Kiana Jafari szerint az átlagolt pontszámok nem vezetnek az ideális válaszokhoz.

A mentálhigiénés chatbotok elterjedésével az AI-fejlesztők emberi szakértőkre bízzák a válaszok biztonságosságának értékelését. A Stanford kutatói azonban rámutattak, hogy ez a módszer nem megbízható, különösen a magas kockázatú területeken, mint az öngyilkossági gondolatok kezelése.
A Stanford Center for AI Safety kutatói, Kiana Jafari és Nina Vasan vezetésével három okleveles pszichiátert kértek fel 360 mesterséges intelligencia által generált mentálhigiénés válasz értékelésére. Az eredmények szerint a szakértők értékelései gyakran eltértek egymástól, ami megnehezíti az AI modellek biztonságosabbá tételét. „Nem számít, hány szakértő van – 3, 10 vagy 1000 –, ha nem értenek egyet, nem jutunk el az igazsághoz az átlagolással” – nyilatkozta Jafari. Az átlagolt pontszámok nem tükrözik az ideális válaszokat, hanem egy olyan modellt eredményezhetnek, amely senkinek sem felel meg.
Kapcsolódó: meleg AI-modellek hibái
Strukturális eltérések a szakértői véleményekben
Nina Vasan, a Stanfordi Orvosi Egyetem pszichiátere szerint a szakértők közötti eltérés nem csupán zaj vagy torzítás, hanem strukturális probléma. Az eltérések hátterében a klinikai képzés és a diagnózishoz, kezeléshez használt keretrendszerek különbözősége áll. Még egy 100 pszichiátert felvonultató, az Amerikai Pszichiátriai Társaság éves találkozóján végzett felmérés is azt mutatta, hogy a válaszok biztonságosságát, empátiáját és helyességét illetően szinte egyenlően oszlottak meg a vélemények.
Kapcsolódó: USA-Kína AI-szakadék
Új megközelítésekre van szükség
A kutatók szerint a jelenlegi AI biztonsági tesztelési módszerek nem elegendőek a mentálhigiénés területeken. Javaslataik között szerepel az AI-fejlesztőkkel szembeni nagyobb átláthatóság követelése a megbízhatósági metrikák terén, valamint a használt keretrendszerek megjelölése. Emellett azt javasolják, hogy a különböző klinikai keretrendszereket (biztonságközpontú, elköteleződés-központú, kulturálisan informált) külön-külön modellezzék és kontextuálisan alkalmazzák. A szakértői nézeteltéréseket pedig ne próbálják meg átlagolni, hanem használják fel figyelmeztetésként a további emberi beavatkozásra.
Kapcsolódó: Stanford AI Index 2026
A kutatást az ACM FAccT konferencián mutatták be, és az Amerikai Pszichiátriai Társaság éves találkozóján is ismertették.
Kapcsolódó: AI tanulásban segít