Új keretrendszerrel biztonságosabbak lehetnek az AI-ügynökök — csökkennek a félrehallucinációk
A RUBAS keretrendszer négy dimenzióban vizsgálja az AI-ügynökök viselkedését, csökkentve a hibás eszközhasználatot és a félrehallucinációkat.

Új keretrendszert fejlesztettek ki az AI-ügynökök biztonságosabbá tételéhez. A RUBAS (Rubric-Based Reinforcement Learning for Agent Safety) nevű módszer a korábbiaknál finomabb visszajelzéseket ad a modellnek, így jobban egyensúlyozható a biztonság és a hasznos működés.
A probléma az, hogy az AI-ügynökök egyre több valós eszközhöz férnek hozzá, ami új biztonsági kihívásokat teremt. A hagyományos módszerek gyakran csak durva jelzéseket használnak, vagy statikus felügyeletre támaszkodnak, ami megnehezíti a sokféle kockázat kezelését, miközben a feladatok elvégzését is biztosítani kell.
Kapcsolódó: AI-ügynökök fejlesztése
Négy dimenzióban a biztonság
A RUBAS négy fő területre bontja az ügynök viselkedését: az eszközhasználat biztonságára, az érvelés helyességére, a válaszok biztonságára és a hasznosságra. Ezek a strukturált értékelőlapok (rubrics) részletes és értelmezhető visszajelzéseket adnak a teljes folyamatra, lehetővé téve a reinforcement learning számára a biztonságos eszközhasználat optimalizálását.
Kapcsolódó: Öngyógyító AI-ügynök
A kutatók kiterjedt kísérleteket végeztek több ügynökbiztonsági teljesítményteszten és különféle LLM-modelleken. Az eredmények azt mutatják, hogy a RUBAS javítja a biztonságot a standard módszerekhez képest, csökkenti az eszközhasználathoz kapcsolódó félrehallucinációkat, és versenyképes szinten tartja a hasznosságot. Az előnyomtatott 2606.04051v1 számú tanulmány szerint a többdimenziós értékelőlapok hatékony tréningjelet biztosítanak az AI-ügynökök biztonságkritikus beállításokban történő igazításához.
Kapcsolódó: LLM-alapú AI-ügynökök