Új módszer gyorsítja a diffúziós nyelvi modelleket — 98%-os javulás érhető el
A bicache nevű új eljárás 36,3-98,3%-kal növeli a diffúziós nyelvi modellek kiszolgálási sebességét, miközben a pontosság mindössze 0-1,8%-kal csökken.

A diffúziós nyelvi modellek (DLM) kiszolgálása eddig komoly kihívást jelentett a hagyományos kulcs-érték (KV) gyorsítótárazási technikák számára. A DLM-ekben használt kétirányú figyelem miatt ugyanis bármely token módosítása befolyásolja az egész kontextust, így a korábbi, csak egyirányú figyelemre optimalizált LLM-es gyorsítótárak hibás eredményeket adtak, szinte nullára csökkentve a modell pontosságát.
Ezt a problémát orvosolja a bicache, az első olyan KV gyorsítótárazási technika, amelyet kifejezetten a DLM-ek megosztott előtagjainak hatékony kezelésére terveztek. A kutatók megfigyelték, hogy a megosztott előtagok KV-jai a modell sekélyebb rétegeiben stabilak és újrafelhasználhatók maradnak, méghozzá arányosan a kérésben lévő megosztott tokenek számával.
Kapcsolódó: memóriaigény csökkentés
A bicache működése
A bicache dinamikusan azonosítja a biztonságos rétegmelyiséget a megosztott KV-k újrafelhasználásához, ezzel kiküszöböli az ismétlődő számításokat. A fejlesztők által végzett értékelések kimutatták, hogy a bicache 36,3-98,3%-kal javítja a kiszolgálási átviteli sebességet a korábbi technikákhoz képest, miközben a pontosság mindössze 0-1,8%-kal csökken — írja az arXiv.
Kapcsolódó: autoregresszív rést zárás
Gyakorlati eredmények
A bicache technika az arXiv-n elérhető, a fejlesztők által végzett értékelések szerint a bicache a korábbi technikáknál jobb teljesítményt nyújt, az arXiv-n közzétett adatok alapján.
Kapcsolódó: diffúziós modellek gyorsítása