A matematikai okoskodásban zárkózik fel a Sliding-Window Attention az új SWARR-ral
A kutatók által kidolgozott SWARR (Sliding-Window Attention with Reinforced Adaptation for Math Reasoning) recept jelentősen csökkenti a Sliding-Window Attention és a hagyományos self-attention közötti különbséget a matematikai feladatok megoldásában.

Az egyre komplexebb feladatokat végző AI-modellek iránti igény megnövelte a hosszú szövegek feldolgozásának szükségességét. A hagyományos self-attention (SA) mechanizmus azonban négyzetesen skálázódik a kontextus hosszával, ami lassítja a rendszereket. Ezt a problémát igyekszik orvosolni a SWARR nevű új recept – közölte az arXiv.
Kétfázisú adaptáció
A SWARR két fő lépésből áll: először egy előre betanított SA-modellből alakítanak át SWA-modellt felügyelt finomhangolással (SFT). Ezután reinforcement learning (RL) segítségével tovább adaptálják a modell politikáját. A kutatók szerint a SFT után a SWA még mindig alulmarad a SA-hoz képest, ami adat-architektúra eltérésre utalhat: a SFT-adatok gyakran hosszú távú függőségeket tartalmaznak, amelyeket a SWA nehezebben modellez. A RL-alapú adaptáció azonban lehetővé teszi, hogy a modell jobban illeszkedjen a SWA korlátaihoz.
Kapcsolódó: APMPO rendszer
Javuló eredmények
A matematikai érvelési benchmarkokon végzett kísérletek azt mutatják, hogy a SWARR recept jelentősen csökkenti a SWA és a SA közötti különbséget. A módszer nagyrészt helyreállítja a SWA konverzió során elveszett pontosságot, miközben megőrzi a lineáris komplexitású attention hatékonysági előnyeit. Az eredmények alapján a RL alapvetően megváltoztatja a SWA matematikai feladatokban való életképességéről alkotott képet.
Kapcsolódó: LLM szívverés
A kutatás eredményei az arXiv-en, a SWARR cikkben érhetők el.
Kapcsolódó: LLM mint bíró