Új diffúziós modell 27%-kal csökkenti a táblázatos adatok hibáit
A GATD modell 27%-kal csökkenti a táblázatos adatok hibáit, miközben akár 25-szer kevesebb paramétert használ a klasszikus feladatoknál.

A táblázatos adatok szintetikus előállítása kulcsfontosságú a privát adatok megosztásához és bővítéséhez. A kutatók bemutatták a Geometry-Aware Tabular Diffusion (GATD) nevű új módszert, amely a diffúziós modellek denoiser-eit párban számolt szögekkel és hosszakkal egészíti ki, ezeket az oszlopértékek különbségeiből számolja.
A GATD egy MLP-implementációja a kutatók szerint state-of-the-art teljesítményteszt teljesítményt ér el, miközben átlagosan 3,5-szer kevesebb paramétert használ. Osztályozási feladatoknál ez a szám akár 25-szeres csökkenést is jelenthet. Tíz adatkészleten a modell 10-ből 8 esetben nyert a „Shape” (forma), 7 esetben a „Trend” (trend) és 9 esetben a „downstream utility” (további felhasználási célú hasznosság) kategóriában. A Shape-hiba 27%-kal, a Trend-hiba pedig 20%-kal csökkent.
Kapcsolódó: Denoiser technológia
Hordozható előnyök más architektúrákon
Az alapértelmezett veszteségsúlyok átadhatóak GNN és Transformer denoisereknek is. Ez az architektúra-adatkészlet párok 30/27%-ánál javította a Shape-mutatót, és 30/25%-ánál a Trend-mutatót. Egy kontrollált kísérlet kimutatta, hogy a nyereséget nem a többlet bemenetek vagy kapacitás, hanem az explicit relációs felügyelet hajtja.
Kapcsolódó: Maszkolt diffúziós modellek
Ez azt jelzi, hogy az explicit relációs felügyelet egy hordozható induktív elhajlás a táblázatos diffúzióhoz. A kutatást az arXiv közölte előnyomtatott formában.
Kapcsolódó: Collapse-and-refine