ÉlőUtoljára: 2 órájaMa: 8
Kutatásfrissítve: 07:50

Több mint ezer válasz alapján az igazságosságot kéri az emberek több mint fele az AI-modellektől

Az emberiség 75 országából származó 1500 válasz alapján az AI-modellek nem képesek megbízhatóan követni az emberi értékeket. Az igazságosságot 49% kéri, de eltérő módon értelmezik.

Több mint ezer válasz alapján az igazságosságot kéri az emberek több mint fele az AI-modellektől
Fotó: Sebastian Herrmann / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

A nagy nyelvi modellek (LLM) betanításánál gyakran alkalmazott emberi visszajelzésen alapuló megerősítő tanulás (RLHF) korlátai nyilvánvalóvá váltak. A módszer összegzi az ellentmondásos preferenciákat, gyakran nem reprezentatív mintákra támaszkodik, és csak bináris összehasonlításokat használ.

1500 nyílt végű válasz elemzésével tárja fel az emberek valós igényeit az AI-rendszerekkel szemben. Az eredmények szerint a legtöbb érték iránt kevesebb mint a válaszadók negyede érdeklődik, az igazságosság kivételével, amelyet 49% említett. Azonban még az igazságosság fogalma is eltérő jelentéseket takar: egyesek forrásokkal alátámasztott állításokat, mások szakértői véleményeket, megint mások pedig népszerűtlen nézeteket várnak el.

Kapcsolódó: LLM rangsorok

Ellentmondásos elvárások és kontextus

Különböző képességek, mint például a modell emberi viselkedése, illetve olyan funkciók, mint az AI-őrszemek, ellentmondásosak. Ezeket egyesek igénylik, míg mások elutasítják. Az emberek gyakran használnak kontextuális megkülönböztetéseket is, például hogy mi az AI alapértelmezett viselkedése, és mi az, amit kérésre tesz.

Kapcsolódó: LLM inkonzisztencia

Az AI-modellek kudarca

Ezek a megállapítások alapvető problémákra világítanak rá a jelenlegi AI-illesztési gyakorlatokban. Ha 49% kéri az igazságosságot, de eltérően értelmezik, azt egyetlen jutalmazási modell nehezen tudja leképezni. A jól finanszírozott modellek magas hallucinációs rátái arra utalnak, hogy a jelenlegi módszerek nem azonosítják a valós preferenciákat, annak ellenére, hogy a felhasználók egyértelműen pontosságot követelnek.

Kapcsolódó: LLM optimalizálás

A tanulmány az arXiv-en érhető el, és rávilágít azokra a helyspecifikus, vitatott és tökéletlen jelzésekre, amelyeket jelenleg univerzális preferenciamodellekké lapítanak, 2026-ban publikálva.

Kapcsolódó: LLM kulturális értékek

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom