ÉlőUtoljára: 1 órájaMa: 3
Kutatásfrissítve: 23:30

Nagy nyelvi modellekkel szűrik a szintetikus táblázatokat — új módszer az adatvédelemre

A LLaMA és Gemini modelleket használó kutatók 451 érvényes próbát futtattak, hogy teszteljék a nagy nyelvi modellek (LLM) hatékonyságát a szintetikus táblázatok valósághűségének megállapításában.

Nagy nyelvi modellekkel szűrik a szintetikus táblázatokat — új módszer az adatvédelemre
Fotó: Alfonso Rodríguez / Unsplash
forrás: ArXiv ML·AI Forradalom szerk.·
Megosztás

Az adatvédelem és az adatmegosztás gyakran ellentmondásos. Sok szervezet szintetikus adatokat használ a privátszférát érintő kockázatok csökkentésére, miközben továbbra is megoszthatóvá teszi az értékes információkat. Táblázatos adatok esetében az adatvédelem auditálása továbbra is kihívást jelent.

A kutatók a LLaMA és a Gemini modelleket használva 451 érvényes próbát futtattak, hogy teszteljék a nagy nyelvi modellek hatékonyságát a szintetikus táblázatok valósághűségének megállapításában.

Kapcsolódó: klinikai szöveggenerálás

LLM-alapú megkülönböztetés

Egy új módszer nagy nyelvi modellekre támaszkodik. A kutatók arra kérik az LLM-eket, hogy osztályozzák az egyes táblázatmintákat VALÓS vagy SZINTETIKUS kategóriába. Két beállítást vizsgáltak: C1-et, amely csak a táblázatot használja, és C2-t, amely a táblázat mellett eloszlási metadatokat is tartalmaz.

Kapcsolódó: csalásfelderítés és pénzmosás

Eredmények és összehasonlítás

Kísérleteik során három szintézismodellt — CTGAN, TVAE és Gaussian Copula — futtattak két nyilvános adatkészleten, az UCI Adulton és az ACS Censuson. Összesen 451 érvényes próba futtatását gyűjtötték össze. Az eredmények egyértelmű különbségeket mutatnak a modellek között.

Kapcsolódó: táblázatos adatok javítása

A kutatás az arXiv ML platformon jelent meg, a kód és a kísérleti szkriptek elérhetők a GitHubon, a Gemini modell 100%-os DRS-t mutatott a CTGAN és a TVAE esetében az Adult adatkészleten.

Kapcsolódó: LLM-ek megtévesztése

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom