Több mint ezer válasz alapján az igazságosságot kéri az emberek több mint fele az AI-modellektől
Az emberiség 75 országából származó 1500 válasz alapján az AI-modellek nem képesek megbízhatóan követni az emberi értékeket. Az igazságosságot 49% kéri, de eltérő módon értelmezik.

A nagy nyelvi modellek (LLM) betanításánál gyakran alkalmazott emberi visszajelzésen alapuló megerősítő tanulás (RLHF) korlátai nyilvánvalóvá váltak. A módszer összegzi az ellentmondásos preferenciákat, gyakran nem reprezentatív mintákra támaszkodik, és csak bináris összehasonlításokat használ.
1500 nyílt végű válasz elemzésével tárja fel az emberek valós igényeit az AI-rendszerekkel szemben. Az eredmények szerint a legtöbb érték iránt kevesebb mint a válaszadók negyede érdeklődik, az igazságosság kivételével, amelyet 49% említett. Azonban még az igazságosság fogalma is eltérő jelentéseket takar: egyesek forrásokkal alátámasztott állításokat, mások szakértői véleményeket, megint mások pedig népszerűtlen nézeteket várnak el.
Kapcsolódó: LLM rangsorok
Ellentmondásos elvárások és kontextus
Különböző képességek, mint például a modell emberi viselkedése, illetve olyan funkciók, mint az AI-őrszemek, ellentmondásosak. Ezeket egyesek igénylik, míg mások elutasítják. Az emberek gyakran használnak kontextuális megkülönböztetéseket is, például hogy mi az AI alapértelmezett viselkedése, és mi az, amit kérésre tesz.
Kapcsolódó: LLM inkonzisztencia
Az AI-modellek kudarca
Ezek a megállapítások alapvető problémákra világítanak rá a jelenlegi AI-illesztési gyakorlatokban. Ha 49% kéri az igazságosságot, de eltérően értelmezik, azt egyetlen jutalmazási modell nehezen tudja leképezni. A jól finanszírozott modellek magas hallucinációs rátái arra utalnak, hogy a jelenlegi módszerek nem azonosítják a valós preferenciákat, annak ellenére, hogy a felhasználók egyértelműen pontosságot követelnek.
Kapcsolódó: LLM optimalizálás
A tanulmány az arXiv-en érhető el, és rávilágít azokra a helyspecifikus, vitatott és tökéletlen jelzésekre, amelyeket jelenleg univerzális preferenciamodellekké lapítanak, 2026-ban publikálva.
Kapcsolódó: LLM kulturális értékek