ÉlőUtoljára: 18 perceMa: 9
Kutatásfrissítve: 22:50

Új módszer gyorsítja a diffúziós nyelvi modelleket — 98%-os javulás érhető el

A bicache nevű új eljárás 36,3-98,3%-kal növeli a diffúziós nyelvi modellek kiszolgálási sebességét, miközben a pontosság mindössze 0-1,8%-kal csökken.

Új módszer gyorsítja a diffúziós nyelvi modelleket — 98%-os javulás érhető el
Fotó: Patrik Kernstock / Unsplash
forrás: ArXiv ML·AI Forradalom szerk.·
Megosztás

A diffúziós nyelvi modellek (DLM) kiszolgálása eddig komoly kihívást jelentett a hagyományos kulcs-érték (KV) gyorsítótárazási technikák számára. A DLM-ekben használt kétirányú figyelem miatt ugyanis bármely token módosítása befolyásolja az egész kontextust, így a korábbi, csak egyirányú figyelemre optimalizált LLM-es gyorsítótárak hibás eredményeket adtak, szinte nullára csökkentve a modell pontosságát.

Ezt a problémát orvosolja a bicache, az első olyan KV gyorsítótárazási technika, amelyet kifejezetten a DLM-ek megosztott előtagjainak hatékony kezelésére terveztek. A kutatók megfigyelték, hogy a megosztott előtagok KV-jai a modell sekélyebb rétegeiben stabilak és újrafelhasználhatók maradnak, méghozzá arányosan a kérésben lévő megosztott tokenek számával.

Kapcsolódó: memóriaigény csökkentés

A bicache működése

A bicache dinamikusan azonosítja a biztonságos rétegmelyiséget a megosztott KV-k újrafelhasználásához, ezzel kiküszöböli az ismétlődő számításokat. A fejlesztők által végzett értékelések kimutatták, hogy a bicache 36,3-98,3%-kal javítja a kiszolgálási átviteli sebességet a korábbi technikákhoz képest, miközben a pontosság mindössze 0-1,8%-kal csökken — írja az arXiv.

Kapcsolódó: autoregresszív rést zárás

Gyakorlati eredmények

A bicache technika az arXiv-n elérhető, a fejlesztők által végzett értékelések szerint a bicache a korábbi technikáknál jobb teljesítményt nyújt, az arXiv-n közzétett adatok alapján.

Kapcsolódó: diffúziós modellek gyorsítása

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom