ÉlőUtoljára: 3 órájaMa: 2
Eszközökfrissítve: 08:10

Egyedi szondákkal és detektorokkal tesztelhetőek a chatbotok az NVIDIA garak rendszerével

Az NVIDIA garak keretrendszerét a cég fejlesztői hozták létre, hogy segítsék a nagy nyelvi modellek biztonsági réseinek feltárását. A rendszerrel egyedi szondák és detektorok hozhatók létre a chatbotok tesztelésére.

Egyedi szondákkal és detektorokkal tesztelhetőek a chatbotok az NVIDIA garak rendszerével
Fotó: Mohammad Rahmani / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Az NVIDIA bemutatta a garak nevű új keretrendszerét, amely a védelmi célú LLM-tesztelés (red-teaming) gyakorlati megvalósítására szolgál. A rendszer célja, hogy segítse a fejlesztőket a nagy nyelvi modellek (LLM) biztonsági réseinek feltárásában, különös tekintettel azokra a potenciális támadási vektorokra, amelyekkel a modellek káros vagy nem kívánt válaszokat adhatnak.

A garak telepítése és alapvető funkciói

A tutorial részletesen bemutatja a garak telepítését és használatát. A folyamat magában foglalja a szükséges könyvtárak importálását, a környezeti változók beállítását és egy segédfüggvény létrehozását a parancssori parancsok futtatásához. A rendszer telepítése egyszerűen a `pip install garak` paranccsal végezhető el. A modulok importálása után a felhasználók programatikusan is futtathatják a Garakot, és rögzíthetik a generált jelentés elérési útvonalát.

Kapcsolódó: NVIDIA NCCL Inspector

Pluginok és modellvizsgálatok

A garak gazdag plugin-ökoszisztémával rendelkezik, beleértve a szondákat (probes), detektorokat (detectors), generátorokat (generators) és buffokat (buffs). A felhasználók listázhatják ezeket a komponenseket, hogy megismerjék a rendelkezésre álló tesztelési lehetőségeket. A rendszer lehetővé teszi gyors száraz futtatásokat (dry runs) a `test.Repeat` generátorral, hogy megerősítsék a működést külső modell vagy API-kulcs nélkül. Ezt követően valós Hugging Face modelleket, például a `gpt2`-t lehet vizsgálni, a `dan.Dan_11_0` szonda segítségével, párhuzamosan több próbálkozással (`parallel_attempts`).

Kapcsolódó: GPU-flottafelügyelet

Jelentésanalízis és biztonsági pontszámok

A futtatott tesztek eredményeit a garak JSONL formátumú jelentésekben rögzíti. Ezeket a jelentéseket a rendszer beépített elemző eszközeivel, vagy manuálisan, például pandas és NumPy segítségével lehet feldolgozni. Az elemzés során kiszámolják a biztonsági pontszámokat (safety scores) és a támadási sikerrátát (Attack Success Rate, ASR). A magasabb ASR magasabb sérülékenységre utal. A vizualizáció segít azonosítani a leginkább veszélyeztetett szonda-detektor kombinációkat.

Kapcsolódó: NVIDIA FLARE

Egyedi szondák és detektorok létrehozása

A garak egyik kulcsfontosságú képessége az egyedi szondák és detektorok létrehozásának lehetősége. A tutorial bemutatja, hogyan lehet egy minimális `HelloProbe` nevű egyedi szondát definiálni, amely két előre definiált utasítást használ. Ez a szonda egy `mycustomdet.ContainsHello` nevű egyedi detektorral párosítható. Ezek a funkciók lehetővé teszik a felhasználók számára, hogy specifikus támadási mintázatokat modellezzenek, és mélyrehatóbb biztonsági teszteket végezzenek.

Kapcsolódó: Kubernetes-fürtfelügyelet

A rendszer a `mycustom.py` fájlba írja az egyedi szondát, amely a `garak.probes` könyvtárban kerül elhelyezésre. A továbbiakban a felhasználók mintavételeket (hits) is vizsgálhatnak, ahol a detektorok magas pontszámot értek el, jelezve potenciálisan problémás kimeneteket. A garak az NVIDIA által 2026. június 6-án vált elérhetővé a fejlesztők számára.

Kapcsolódó: CUDA fordítás

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom