Húszezer promptot elemezték, és kiderült, hogy a felhasználók személyes adatai kiszűrhetők
1034 felhasználó 20 680 promptját elemezték, amelyből kiderül, hogy az utasítások azonosítható jeleket hordoznak a felhasználóról.

A nagy nyelvi modellekhez (LLM) írt utasítások stabil, azonosítható és megkülönböztethető jeleket hordoznak a felhasználóról — derül ki egy új, 1034 felhasználó 20 680 promptját elemző kutatásból. Az eredmények fontos következményekkel járhatnak a biztonság és az adatvédelem szempontjából.
A kutatók a PromptPrint rendszerrel vizsgálták, hogy a felhasználók szokásos szókincse, mondatszerkezete és beszédmintái hogyan képezhetnek tanulható viselkedési biometriai azonosítót. A rövid, feladatvezérelt utasítások is tartalmazhatnak ilyen információt.
Kapcsolódó: automatizált promptmérnökség
A szavak számítanak, nem az üzenet
Az elemzés három kulcsfontosságú megállapítást tett. Először is, a szavak szintű (lexikai) reprezentációk jelentősen jobban teljesítenek, mint az absztrakt szándékot rögzítő szemantikai kódolók. Ez alátámasztja a „lexikai stabilitás hipotézisét”, miszerint az egyedi azonosítójel elsősorban a felszíni szóválasztásban kódolódik, nem pedig a mögöttes szándékban.
Kapcsolódó: LLM-ek korlátai
Egyedi, de következetlen stílus
Másodszor, a stilisztikai jellemzők egy „egyediség-következetlenség paradoxont” mutatnak. A felhasználók rendkívül megkülönböztethetők a populáción belül, ugyanakkor kontextusoktól függően viselkedésük következetlen lehet. Harmadszor, az ellenőrző elemzés egyértelmű sérülékenységi spektrumot tárt fel: az azonosító jelek ellenállnak a kisebb lexikai változtatásoknak, de jelentősen degradálódnak szemantikai átfogalmazások hatására.
Kapcsolódó: markdown hatásai
Az eredmények a PromptPrint rendszerben való alkalmazhatóságát mutatják be, ahol a nagy léptékű azonosítási teljesítmény megalapozza a prompt-alapú azonosítást, mint életképes viselkedési biometriai módszert az LLM interakciókban, 1034 felhasználó adatainak elemzésével.
Kapcsolódó: torzítás csökkentése