ÉlőUtoljára: 1 perceMa: 28
Kutatás

A nyelvi modellek tanulhatnak a hibáikból: új eljárás rögzíti a procedurális tudást

A Procedural Memory Distillation (PMD) eljárás a nyelvi modellek önfejlesztését célozza, a hibákból és sikerekből szerzett tudást beépítve a modell súlyaiba.

A nyelvi modellek tanulhatnak a hibáikból: új eljárás rögzíti a procedurális tudást
Fotó: Brecht Corbeel / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

A nyelvi modellek képességeinek javítására új módszert dolgoztak ki a kutatók, amely a korábbi hibákból és sikerekből szerzett tapasztalatokat építi be a modell működésébe. A Procedural Memory Distillation (PMD) eljárás a modellek által generált, több epizódon átívelő információkat hasznosítja, amelyeket az eddigi módszerek ritkán tartottak meg vagy használtak fel újra.

A procedurális tudás rögzítése

A PMD három absztrakciós szinten szervezi a memóriát: a nyers végigfutásokat (trajectories), az önreflektív stratégiákat és leckéket, valamint a magasabb szintű viselkedési mintázatokat. Ezeket online gyűjti a modell saját működése során. Egy memória-kondicionált öntanár (self-teacher) a felhalmozott tapasztalatok alapján felügyeli a diákmsetInt, és segíti a procedurális tudás paraméterekbe való internalizálását. A kutatás szerint a ko-evolúciós tervezés kulcsfontosságú: a modell által generált végigfutások frissítik a memóriát, a memória pedig alakítja a felügyeletet, amely frissíti a modellt.

Kapcsolódó: Bíró modellek tanítása

Jelentős teljesítményjavulás

Empirikus eredmények alapján a Qwen3-8B és az OLMo3-Instruct-7B modelleken tesztelve a PMD 3.8–5.5%-kal múlta felül a korábbi SDPO módszert a SCIKNOWEVAL teljesítményteszten, és 7.9–13.6%-kal a LIVECODEBENCH teszten. A ko-evolúció erejét mutatja, hogy a memória vagy a policy lefagyasztása több mint 10%-os teljesítménycsökkenést eredményezett a SCIKNOWEVAL tartományokban a PMD-hez képest.

Kapcsolódó: APMPO érvelési javítás

A kutatást Ye Liu és nyolc társszerző végezte, eredményeiket előnyomtatott formában tették közzé az arXiv AI repozitóriumban.

Kapcsolódó: Memória-rendszer fejlesztés

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom