Nyelvi modellek rejtett dinamikája előrejelzi az emberi feldolgozási költségeket
A nyelvi modellek rejtett állapotainak dinamikája jobban megjósolja az emberi szövegértés sebességét, mint a korábbi, kizárólag a szavak valószínűségére építő módszerek. Ez a megközelítés pontosabb mércéje a feldolgozási költségeknek.

A hagyományos megközelítések, mint a meglepetés (surprisal), csak egyetlen számot használnak minden szó feldolgozásához. Az új kutatás azonban rámutat, hogy a szövegértés során az értelmezés fejlődésének iránya, vagyis a modell rejtett állapotainak dinamikája is kulcsfontosságú.
A meglepetés korlátai és az új dinamikai mérce
A meglepetés, mint a feldolgozási költség fő előrejelzője, korlátozott információt hordoz. Az új trajektória-extrapolációs hiba mérőszám a modell rejtett állapotainak lineáris trajektóriájához illeszkedik, és méri az eltérést ettől az extrapolált útvonaltól.
Kapcsolódó: MI feladatok
Különösen hatékony kétértelmű mondatokban
Az eredmények különösen kiugróak voltak a kétértelmű, úgynevezett „garden-path” mondatok esetében. A kutatás azt is kimutatta, hogy az effektus erősödik a modell méretével, a GPT-2 Small verziótól a Large verzióig. Az eltérő pozíciós kódolási sémákkal rendelkező architektúrákban, mint a GPT-2 és a Pythia/RoPE, is megismételhetőnek bizonyult.
Kapcsolódó: Diffúziós modellek
A trajektória-extrapolációs hiba előrejelző ereje az arXiv-on került publikálásra, a GPT-2 Large modellben mutatott eredmények alátámasztják az új megközelítés hatékonyságát.
Kapcsolódó: Neuronok szerepe