Új módszerrel 60%-kal jobb tömörítést ér el az AI a tudományos adatoknál
A tudományos szimulációk hatalmas adathalmazait tömöríti hatékonyabban egy új AI-megközelítés. A LBRC és NGLR módszerek 30-60%-kal jobb eredményt hoznak a korábbi GAE-eljárásokhoz képest.

A tudományos szimulációk által generált hatalmas spatiotemporális adatok hatékony tárolása kulcsfontosságú. A gépi tanuláson alapuló tömörítési eljárások magas tömörítési arányt érhetnek el, de nem garantálják az egyes adatblokkok pontosságát. A korábbi Guaranteed Autoencoder (GAE) módszerek ezt per-blokk maradék korrekcióval próbálták megoldani, ami a magas felbontású adatoknál növeli az adatfolyamot.
Új megközelítést javasolnak az arXiv-on publikáló kutatók: a gépi tanulással létrehozott maradék adatokat speciális reprezentációval kódolják. A LBRC egy determinisztikus, betanítás nélküli eljárás, amely adaptívan kvantálja a maradékot, majd 3D Lorenzo differenciálással, zigzag-leképezéssel és bit-plane kódolással tömöríti. A NGLR egy kauzális neurális prediktort ad hozzá, amely tovább csökkenti a maradék entrópiáját, miközben megőrzi a determinisztikus dekódolást.
Kapcsolódó: Videógenerálás
Hatékonyabb tömörítés tudományos adatokon
Az E3SM, JHTDB és ERA5 adathalmazokon végzett tesztek során, 10^-6 és 10^-4 közötti blokkszintű NRMSE célokkal, a LBRC 30-60%-kal javította a tömörítési arányt a GAE-módszerekhez képest. Ez az eredmény széles körben versenyképes a SZ-algoritmuséval.
Kapcsolódó: LLM-ek optimalizálása
NGLR: Továbbfejlesztett eredmények
A NGLR további 10-40%-os javulást hozott a LBRC-hez képest, és felülmúlta a SZ-t a vizsgált magas felbontású tartományban. A Stanford és a Google Robotics munkatársai végzik a kutatást, a tanulmány az arXiv-on érhető el, a kutatók a LBRC és NGLR módszerek további fejlesztésén dolgoznak.
Kapcsolódó: Kvantálás hatásai