Új módszerrel irányítható a generatív AI biztonsága — egy modell adataival másokat is lehet védeni
Egy új keretrendszer lehetővé teszi a generatív AI modellek biztonsági irányelveinek átvitelét, így egy modell betanításával más rendszerek is védhetővé válnak.

Úgy tűnik, a generatív AI modellek biztonsági irányelvei nem kizárólag az adott modellre jellemzők, hanem más rendszerekre is átültethetők. Egy új kutatás keretében egy olyan keretrendszert mutattak be, amely lehetővé teszi a biztonsági irányelvek megosztását a különböző generátorok között. Ez azt jelenti, hogy egy modell betanításával más, akár eltérő architektúrájú rendszerek is védhetővé válnak, anélkül, hogy azokat külön kellene finomhangolni vagy új adatokkal betanítani.
A kutatók által javasolt módszer lényege, hogy a biztonsági irányelveket hordozó rejtett irányokat (latent directions) egy forrásmodellben becsülik meg, majd ezeket egy célgenerátorhoz illesztik. A folyamat során a céloldalon soha nem használják a nem biztonságos adatokat, kizárólag a megosztott reprezentációk geometriájára támaszkodnak.
Kapcsolódó: MidSteer technológia
A modell architektúrája és a biztonsági irányelvek átvitele
A keretrendszer nem csupán egyetlen globális irányt képes kezelni, hanem egy többvektoros kiterjesztést is tartalmaz. Ez lehetővé teszi a kategória-specifikus biztonsági viselkedések rögzítését, ami szelektívebb vezérlést tesz lehetővé. A kutatók szöveg-kép és szöveg-videó generáló modellek széles körén tesztelték a módszert, különféle forrás-cél modellpárokat használva.
Kapcsolódó: OPSA módszer
Az átvitt biztonsági irányelvek hatékonysága
Az eredmények azt mutatják, hogy az átvitt biztonsági irányelvek hasonló eredményeket érnek el a nem biztonságos adatokkal natívan betanított irányokhoz képest. Ez magában foglalja a nem kívánt tartalom generálásának csökkentését (ASR reduction), miközben a képminőségi mutatók, mint a CLIP-Score és a FID trade-offok is elfogadhatóak maradnak. A kutatás eredményeit az arXiv:2606.05290v1 jelzésű előnyomtatott formában tették közzé, 2024. január 15-én.
Kapcsolódó: AnnE rendszer