Modellomlást okozhat a szintetikus adat – kutatók fejlesztenek új módszert a szennyeződés modellezésére
A szintetikus adatok használata miatt kialakuló modellomlás jelenségét epidemiológiai szempontból vizsgálják, és ennek keretében azonosítják a szennyeződési folyamatokat.

Az AI-modellek betanítása során használt szintetikus adatok komoly problémát, úgynevezett modellomlást okozhatnak. A jelenség során a modellek teljesítménye drasztikusan csökken, ami eddig egy láncszerű leépülésként volt ismert. Azonban a valóságban az AI ökoszisztéma ennél sokkal komplexebb: a modellek más modellek által generált szintetikus adatokat fogyasztanak, új adatokat hoznak létre, és ezzel megosztott adathalmazokat szennyeznek.
Keresztszennyeződés és immunitás a modellomlásban
Egy új, előnyomtatott formában megjelent kutatás egy bilayer SIR/SIRS keretrendszert javasol a jelenség modellezésére. Ez a megközelítés az adathalmazokat és az AI-modelleket két egymással kölcsönható populációként kezeli. Mindkét populációban vannak fogékony, fertőzött és gyógyult állapotok, amelyeket a rétegek közötti átvitel köt össze. A SIRS változat, amely az immunitás csökkenését is figyelembe veszi, azt tükrözi, hogy a szűrt adathalmazok és az újratanított modellek ismét fogékonyak lehetnek a szennyeződésre.
Kapcsolódó: GPT-2 toxikus kimenet
Az epidemiológiai modell eredményei
A kutatók a Next Generation Matrix segítségével deriválták a modell alapvető reprodukciós számát ($R_0$), és standard járványküszöb-eredményeket alkalmaztak a bilayer rendszerre. Nyilvános AI-szövegadatok alapján végzett szcenárió-alapú kalibrációk szuperkritikus dinamikát ($R_0 > 1$) mutattak három forgatókönyvben is. A Sobol-érzékenységi elemzés kimutatta, hogy a szintetikus szövegdetektálás a legfontosabb paraméter a probléma kezelésében. Egy bipartite-hálózati, ügynök-alapú modell megerősítette a középmező-következtetések konzisztenciáját, különösen sűrű hálózatok esetén.
Kapcsolódó: Képgenerálók tisztítása
GPT-2 kísérletek és a diverzitás csökkenése
A GPT-2 modellel végzett szennyeződési lánc-kísérletek, amelyek 192 futást foglaltak magukban a WikiText és a Shakespeare adathalmazokon, adag-válasz alapú degradációt és diverzitáscsökkenést mutattak. Ezek az eredmények kvalitatívan összhangban vannak a küszöbérték-kép modellel. A forrás-diverzitás kísérletek, amelyek 1088 futást öleltek fel, azt sugallják, hogy a több forrásból származó adatok keverése mérsékelheti az összeomlást, de ez a hatás alacsony szennyezettségi arányok mellett eltűnik. Az elemzés a detektáláson alapuló szűrést és a nyájimmunitást azonosította a legfontosabb stratégiákként a modellomlás megelőzésére.
Kapcsolódó: Diffúziós modellek biztonsága
A kutatás eredményeit az arXiv-on tették közzé 2026. június 5-én, a GPT-2 modell és a WikiText adathalmaz használatával.
Kapcsolódó: LLM támadási kockázat