ÉlőUtoljára: 18 órájaMa: 0
Kutatásfrissítve: 09:50

A matematikai okoskodásban zárkózik fel a Sliding-Window Attention az új SWARR-ral

A kutatók által kidolgozott SWARR (Sliding-Window Attention with Reinforced Adaptation for Math Reasoning) recept jelentősen csökkenti a Sliding-Window Attention és a hagyományos self-attention közötti különbséget a matematikai feladatok megoldásában.

A matematikai okoskodásban zárkózik fel a Sliding-Window Attention az új SWARR-ral
Fotó: Indra Projects / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az egyre komplexebb feladatokat végző AI-modellek iránti igény megnövelte a hosszú szövegek feldolgozásának szükségességét. A hagyományos self-attention (SA) mechanizmus azonban négyzetesen skálázódik a kontextus hosszával, ami lassítja a rendszereket. Ezt a problémát igyekszik orvosolni a SWARR nevű új recept – közölte az arXiv.

Kétfázisú adaptáció

A SWARR két fő lépésből áll: először egy előre betanított SA-modellből alakítanak át SWA-modellt felügyelt finomhangolással (SFT). Ezután reinforcement learning (RL) segítségével tovább adaptálják a modell politikáját. A kutatók szerint a SFT után a SWA még mindig alulmarad a SA-hoz képest, ami adat-architektúra eltérésre utalhat: a SFT-adatok gyakran hosszú távú függőségeket tartalmaznak, amelyeket a SWA nehezebben modellez. A RL-alapú adaptáció azonban lehetővé teszi, hogy a modell jobban illeszkedjen a SWA korlátaihoz.

Kapcsolódó: APMPO rendszer

Javuló eredmények

A matematikai érvelési benchmarkokon végzett kísérletek azt mutatják, hogy a SWARR recept jelentősen csökkenti a SWA és a SA közötti különbséget. A módszer nagyrészt helyreállítja a SWA konverzió során elveszett pontosságot, miközben megőrzi a lineáris komplexitású attention hatékonysági előnyeit. Az eredmények alapján a RL alapvetően megváltoztatja a SWA matematikai feladatokban való életképességéről alkotott képet.

Kapcsolódó: LLM szívverés

A kutatás eredményei az arXiv-en, a SWARR cikkben érhetők el.

Kapcsolódó: LLM mint bíró

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom