Nagy nyelvi modellekkel szűrik a szintetikus táblázatokat — új módszer az adatvédelemre
A LLaMA és Gemini modelleket használó kutatók 451 érvényes próbát futtattak, hogy teszteljék a nagy nyelvi modellek (LLM) hatékonyságát a szintetikus táblázatok valósághűségének megállapításában.

Az adatvédelem és az adatmegosztás gyakran ellentmondásos. Sok szervezet szintetikus adatokat használ a privátszférát érintő kockázatok csökkentésére, miközben továbbra is megoszthatóvá teszi az értékes információkat. Táblázatos adatok esetében az adatvédelem auditálása továbbra is kihívást jelent.
A kutatók a LLaMA és a Gemini modelleket használva 451 érvényes próbát futtattak, hogy teszteljék a nagy nyelvi modellek hatékonyságát a szintetikus táblázatok valósághűségének megállapításában.
Kapcsolódó: klinikai szöveggenerálás
LLM-alapú megkülönböztetés
Egy új módszer nagy nyelvi modellekre támaszkodik. A kutatók arra kérik az LLM-eket, hogy osztályozzák az egyes táblázatmintákat VALÓS vagy SZINTETIKUS kategóriába. Két beállítást vizsgáltak: C1-et, amely csak a táblázatot használja, és C2-t, amely a táblázat mellett eloszlási metadatokat is tartalmaz.
Kapcsolódó: csalásfelderítés és pénzmosás
Eredmények és összehasonlítás
Kísérleteik során három szintézismodellt — CTGAN, TVAE és Gaussian Copula — futtattak két nyilvános adatkészleten, az UCI Adulton és az ACS Censuson. Összesen 451 érvényes próba futtatását gyűjtötték össze. Az eredmények egyértelmű különbségeket mutatnak a modellek között.
Kapcsolódó: táblázatos adatok javítása
A kutatás az arXiv ML platformon jelent meg, a kód és a kísérleti szkriptek elérhetők a GitHubon, a Gemini modell 100%-os DRS-t mutatott a CTGAN és a TVAE esetében az Adult adatkészleten.
Kapcsolódó: LLM-ek megtévesztése