Egyedi szondákkal és detektorokkal tesztelhetőek a chatbotok az NVIDIA garak rendszerével
Az NVIDIA garak keretrendszerét a cég fejlesztői hozták létre, hogy segítsék a nagy nyelvi modellek biztonsági réseinek feltárását. A rendszerrel egyedi szondák és detektorok hozhatók létre a chatbotok tesztelésére.

Az NVIDIA bemutatta a garak nevű új keretrendszerét, amely a védelmi célú LLM-tesztelés (red-teaming) gyakorlati megvalósítására szolgál. A rendszer célja, hogy segítse a fejlesztőket a nagy nyelvi modellek (LLM) biztonsági réseinek feltárásában, különös tekintettel azokra a potenciális támadási vektorokra, amelyekkel a modellek káros vagy nem kívánt válaszokat adhatnak.
A garak telepítése és alapvető funkciói
A tutorial részletesen bemutatja a garak telepítését és használatát. A folyamat magában foglalja a szükséges könyvtárak importálását, a környezeti változók beállítását és egy segédfüggvény létrehozását a parancssori parancsok futtatásához. A rendszer telepítése egyszerűen a `pip install garak` paranccsal végezhető el. A modulok importálása után a felhasználók programatikusan is futtathatják a Garakot, és rögzíthetik a generált jelentés elérési útvonalát.
Kapcsolódó: NVIDIA NCCL Inspector
Pluginok és modellvizsgálatok
A garak gazdag plugin-ökoszisztémával rendelkezik, beleértve a szondákat (probes), detektorokat (detectors), generátorokat (generators) és buffokat (buffs). A felhasználók listázhatják ezeket a komponenseket, hogy megismerjék a rendelkezésre álló tesztelési lehetőségeket. A rendszer lehetővé teszi gyors száraz futtatásokat (dry runs) a `test.Repeat` generátorral, hogy megerősítsék a működést külső modell vagy API-kulcs nélkül. Ezt követően valós Hugging Face modelleket, például a `gpt2`-t lehet vizsgálni, a `dan.Dan_11_0` szonda segítségével, párhuzamosan több próbálkozással (`parallel_attempts`).
Kapcsolódó: GPU-flottafelügyelet
Jelentésanalízis és biztonsági pontszámok
A futtatott tesztek eredményeit a garak JSONL formátumú jelentésekben rögzíti. Ezeket a jelentéseket a rendszer beépített elemző eszközeivel, vagy manuálisan, például pandas és NumPy segítségével lehet feldolgozni. Az elemzés során kiszámolják a biztonsági pontszámokat (safety scores) és a támadási sikerrátát (Attack Success Rate, ASR). A magasabb ASR magasabb sérülékenységre utal. A vizualizáció segít azonosítani a leginkább veszélyeztetett szonda-detektor kombinációkat.
Kapcsolódó: NVIDIA FLARE
Egyedi szondák és detektorok létrehozása
A garak egyik kulcsfontosságú képessége az egyedi szondák és detektorok létrehozásának lehetősége. A tutorial bemutatja, hogyan lehet egy minimális `HelloProbe` nevű egyedi szondát definiálni, amely két előre definiált utasítást használ. Ez a szonda egy `mycustomdet.ContainsHello` nevű egyedi detektorral párosítható. Ezek a funkciók lehetővé teszik a felhasználók számára, hogy specifikus támadási mintázatokat modellezzenek, és mélyrehatóbb biztonsági teszteket végezzenek.
Kapcsolódó: Kubernetes-fürtfelügyelet
A rendszer a `mycustom.py` fájlba írja az egyedi szondát, amely a `garak.probes` könyvtárban kerül elhelyezésre. A továbbiakban a felhasználók mintavételeket (hits) is vizsgálhatnak, ahol a detektorok magas pontszámot értek el, jelezve potenciálisan problémás kimeneteket. A garak az NVIDIA által 2026. június 6-án vált elérhetővé a fejlesztők számára.
Kapcsolódó: CUDA fordítás