ÉlőUtoljára: 2 órájaMa: 3
Kutatásfrissítve: 06:30

Új módszerrel irányítható a generatív AI biztonsága — egy modell adataival másokat is lehet védeni

Egy új keretrendszer lehetővé teszi a generatív AI modellek biztonsági irányelveinek átvitelét, így egy modell betanításával más rendszerek is védhetővé válnak.

Új módszerrel irányítható a generatív AI biztonsága — egy modell adataival másokat is lehet védeni
Fotó: Taylor Vick / Unsplash
forrás: ArXiv CV·AI Forradalom szerk.·
Megosztás

Úgy tűnik, a generatív AI modellek biztonsági irányelvei nem kizárólag az adott modellre jellemzők, hanem más rendszerekre is átültethetők. Egy új kutatás keretében egy olyan keretrendszert mutattak be, amely lehetővé teszi a biztonsági irányelvek megosztását a különböző generátorok között. Ez azt jelenti, hogy egy modell betanításával más, akár eltérő architektúrájú rendszerek is védhetővé válnak, anélkül, hogy azokat külön kellene finomhangolni vagy új adatokkal betanítani.

A kutatók által javasolt módszer lényege, hogy a biztonsági irányelveket hordozó rejtett irányokat (latent directions) egy forrásmodellben becsülik meg, majd ezeket egy célgenerátorhoz illesztik. A folyamat során a céloldalon soha nem használják a nem biztonságos adatokat, kizárólag a megosztott reprezentációk geometriájára támaszkodnak.

Kapcsolódó: MidSteer technológia

A modell architektúrája és a biztonsági irányelvek átvitele

A keretrendszer nem csupán egyetlen globális irányt képes kezelni, hanem egy többvektoros kiterjesztést is tartalmaz. Ez lehetővé teszi a kategória-specifikus biztonsági viselkedések rögzítését, ami szelektívebb vezérlést tesz lehetővé. A kutatók szöveg-kép és szöveg-videó generáló modellek széles körén tesztelték a módszert, különféle forrás-cél modellpárokat használva.

Kapcsolódó: OPSA módszer

Az átvitt biztonsági irányelvek hatékonysága

Az eredmények azt mutatják, hogy az átvitt biztonsági irányelvek hasonló eredményeket érnek el a nem biztonságos adatokkal natívan betanított irányokhoz képest. Ez magában foglalja a nem kívánt tartalom generálásának csökkentését (ASR reduction), miközben a képminőségi mutatók, mint a CLIP-Score és a FID trade-offok is elfogadhatóak maradnak. A kutatás eredményeit az arXiv:2606.05290v1 jelzésű előnyomtatott formában tették közzé, 2024. január 15-én.

Kapcsolódó: AnnE rendszer

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom