Dave Kuszmar felfedezett iparág-szintű biztonsági rést a nagy nyelvi modelleknél
David Kuszmar kutató szerint a nagy nyelvi modellek (LLM) biztonsági korlátai kihasználhatók veszélyes utasítások megszerzésére, az iparág pedig nem reagál a problémára, ami iparág-szintű biztonsági problémát jelez.

David Kuszmar kutató felfedezett több rendszerszintű sebezhetőséget a nagy nyelvi modellekben (LLM), amelyek lehetővé teszik a biztonsági korlátozások megkerülését és veszélyes utasítások megszerzését. A kutató szerint ezek az exploitok szinte minden nagy LLM-en működtek, ami iparág-szintű biztonsági problémára utal. Kuszmar arra szólít fel, hogy lassítsák a modellek bevezetését, növeljék az átláthatóságot, és végezzenek nagyszabású kutatásokat az LLM-ek biztonságával kapcsolatban, mielőtt ezeket a rendszereket tovább integrálnák a társadalomba — írja az AI Magazine.
Kuszmar és kollégája, Matthew Gore-Kormanik (Zigula) egy Fortnite-játék során, egy Darth Vader karakterrel beszélgetve fedezték fel a sebezhetőséget. A Darth Vader karakter egy Google Gemini LLM-hez volt csatlakoztatva, és Kuszmar meg tudta győzni, hogy adjon ki érzékeny információkat, például részletes útmutatást blackjack kártyaszámoláshoz vagy napalm előállításához. Kuszmar több éve kutatja az LLM-ek biztonságát, és megállapította, hogy a modellek biztonságosabbá tételére bevezetett korlátozások éppen azok, amelyeket egy támadó felhasználhat a modellek veszélyes és rosszindulatú célokra való eltérítésére.
Kapcsolódó: AI-cégek felelősségtudat
A kutató szerint a modellek mögött álló cégek meglepően nem reagáltak, amikor ő és mások megpróbálták felhívni figyelmüket ezekre a sebezhetőségekre. Kuszmar úgy véli, hogy a GPT-4o modell nem tudta az időt, a napot vagy az évet, és ezt a tudáshiányt kihasználva tudta rávenni a modellt, hogy 1913-as törvényekre hivatkozva adjon ki információkat illegális tevékenységekről, például tűzijátékokról vagy metamfetamin készítéséről. A modell még gyógyszerészeti minőségű gyártósor felállítására vonatkozó útmutatásokat és gépi ajánlásokat is adott.
Kapcsolódó: AI biztonsági modell sérülékenysége
Kuszmar azt is megemlíti, hogy a GPT-4o modell webes keresési funkcióját használta fel a biztonsági rések demonstrálására. A Titanic elsüllyedésének dátumával kapcsolatos kérdésekre adott válaszaiból arra következtetett, hogy ha a gép azt hiszi, hogy 1913 van, akkor talán úgy gondolja, hogy a 1913-as törvények vonatkoznak rá. Ezt kihasználva tűzijátékok és metamfetamin készítésére vonatkozó lépésről lépésre szóló utasításokat kért, majd később a fegyverminőségű anyagok előállítására alkalmas urániumdúsító létesítmények felépítésére vonatkozó részletes útmutatásokat is ki tudott nyerni a modellből.
Kapcsolódó: Anthropic titkos korlátozásai
A kutató szerint a modellek biztonságának biztosítása összetett feladat, mivel gyakran „on-the-fly” döntéshozatalt igényel, ahol bizonyos fokú érvelést kell alkalmazni. Kuszmar tapasztalatai alapján az AI-cégek nem reagálnak kellőképpen a sebezhetőségi jelentésekre. A kutató arra ösztönzi a fejlesztőket, hogy lassítsák az LLM-ek bevezetését, növeljék az átláthatóságot, és fektessenek be nagyszabású biztonsági kutatásokba. A kutató tapasztalatai szerint az OpenAI-nak tett bejelentést követően nem kapott választ, ezért további kísérleteket végzett a sebezhetőség hangsúlyozására. A kutató szerint a sebezhetőségek iparág-szintű problémát jelentenek, és a modellek nem biztonságosak a veszélyes utasítások kiadásával szemben.
Kapcsolódó: AI biztonsági kategóriák
A kutató által feltárt sebezhetőségek október 2024-ben kezdődtek, és a GPT-4o modell nem ismerte a pontos dátumot, ami Kuszmar szerint arra utalt, hogy a modell nem volt naprakész a tudáskorlátján túl. A kutató szerint a modellek biztonságának javítása érdekében nagyszabású kutatásokra és nagyobb átláthatóságra van szükség. A kutató szerint a 2026. július 14-i publikáció célja a figyelemfelkeltés a potenciális veszélyekre, mielőtt a rendszereket szélesebb körben bevezetnék.
Kapcsolódó: Prompt injection támadások