ÉlőUtoljára: 3 órájaMa: 15
Kutatás

Új RL-módszer javítja a nyelvi modellek biztonságát

Az Oyster-II nevű új keretrendszer a reinforcement learning segítségével javítja a nyelvi modellek biztonságát és hasznosságát, miközben elkerüli a korábbi megoldások túlzott elutasításait.

Új RL-módszer javítja a nyelvi modellek biztonságát
Fotó: Brecht Corbeel / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az Oyster-II egy új, reinforcement learning (RL) alapú keretrendszer, amely a nyelvi modellek (LLM) biztonságosabbá és hasznosabbá tételét célozza. A kutatók szerint ez a megközelítés felülmúlja a hagyományos, elutasítás-orientált stratégiákat, amelyek gyakran a hasznos információkat is visszatartják.

A kutatás rávilágít arra, hogy a biztonsági beállítások nem feltétlenül oszlanak el egyenletesen a modell súlyain. Egyetlen neuron is elegendő lehet a biztonsági beállítások megkerülésére, ami arra utal, hogy a jelenlegi módszerek sérülékenyek lehetnek. Az Apple kutatói kimutatták, hogy a biztonsági mechanizmusok megkerülhetők anélkül, hogy magát a modellt át képeznék.

Kapcsolódó: AI etikai javítás

Biztonság és hasznosság egyensúlya

Az Oyster-I által úttörőként bevezetett konstruktív biztonsági paradigma továbbfejlesztéseként az Oyster-II két fő problémát orvosol: az úgynevezett 'biztonsági lánc-gondolat' (CoT) túl-általánosítását, ahol a biztonsági logika a nem érzékeny lekérdezésekre is túlzottan rávetül, valamint az elosztásból kilépő (out-of-distribution) forgatókönyvekkel szembeni elégtelen általánosítást.

Kapcsolódó: szimbolikus finomítás

Az új, RL-alapú keretrendszer a Zero-RL paradigmát és egy többlépcsős RL-stratégiát alkalmazza. Ezzel szemben a korábbi, felügyelt finomhangoláson (SFT) alapuló módszerek nem tudták kellőképpen általánosítani a biztonsági szabályokat, ami a hasznosság rovására ment.

Kapcsolódó: LCO toxicitás-csökkentés

Összehasonlítás és teljesítmény

Kiterjedt benchmarkokon tesztelve az Oyster-II a Qwen3-14B és elődje, az Oyster-I modelleket is felülmúlja a biztonsági dimenziókban. Teljesítménye a nagyobb Qwen3-Max és Qwen3.5-397B modellekkel vetekszik.

Kapcsolódó: OPSA biztonság

Az Oyster-II megközelítése eltér a diagnosztikai feladatoknál alkalmazott RL-módszerektől is. Míg az utóbbiak az információhiányos helyzetekben stratégiai adatgyűjtést céloznak meg, addig az Oyster-II a válaszközpontú biztonsági igazításra fókuszál, elkerülve a szükségtelen elutasításokat.

Kapcsolódó: GPT-2 toxikus kimenet megszüntetése

A fejlesztők számára az Oyster-II egy új irányt mutat a nyelvi modellek felelősségteljesebb és hatékonyabb használatában, ahol a biztonság és a felhasználói élmény egyaránt prioritást élvez. A modell március végére várhatóan nyilvánosságra kerül.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom