Új módszer csökkenti a videó tokenizálás memóriaigényét
A Latent Inpainting Transformer (LIT) architektúra és a dinamikus tokenizálás kombinációja akár 2606.06158 azonosító alatt elérhető tanulmány szerint csökkenti a videófeldolgozás memóriaigényét.

A videók feldolgozása során a vizuális komplexitás alapján dinamikusan allokálható a tokenek mennyisége. Az új adaptív tokenizálási módszer a korábbi iteratív keresések vagy neurális regresszorok helyett a fagyasztott videó tokenizáló latent terét használja ki.
A kutatás rámutat, hogy a térbeli pozíciók latent reprezentációi közötti minimális változások szinte semmilyen plusz információt nem hordoznak. Ezt a temporal-L1 különbségek fix küszöbértékével azonosítják és hagyják el, így a tömörítési arány a tartalomtól függően alakul.
Kapcsolódó: gyorsabb képfeldolgozás
A Latent Inpainting Transformer (LIT) architektúra
A redundáns pozíciók rekonstrukciójára a kutatók bemutatták a Latent Inpainting Transformert (LIT). Ez egy könnyűsúlyú, faktorizált tér-idő figyelem (spatial-temporal attention) architektúra.
Kapcsolódó: videógenerálás gyorsítása
Hatékony inference folyamat és eredmények
Az új eljárás rendkívül hatékony inference folyamatot eredményez. Mindössze egyetlen encoder pass és egy LIT forward pass szükséges a feldolgozáshoz, ami jelentősen csökkenti a számítási overheadot.
Kapcsolódó: Token-Selective Attention
A tanulmány az ArXivon 2606.06158 azonosítóval érhető el.
Kapcsolódó: videógenerálás javítása