ÉlőUtoljára: 1 órájaMa: 15
Kutatásfrissítve: 07:30

Kutatók a SHAP és LLM modelleket értékelik a tanítási minőségértékelésben

Az automatizált értékelő modellek kevés betekintést nyújtanak abba, miért kap egy tanár bizonyos minősítést. Kutatók új keretrendszert javasolnak, amely a SHAP-értékeket és LLM-indoklásokat kombinálja.

Kutatók a SHAP és LLM modelleket értékelik a tanítási minőségértékelésben
Fotó: Andri Aeschlimann / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

Az automatizált pontozási modellek egyre elterjedtebbek a komplex nyelvi teljesítmények, például tantermi átiratok értékelésében. Ezek a rendszerek azonban ritkán magyarázzák meg, miért született egy adott pontszám. Kutatók most egy új keretrendszert dolgoztak ki, amely a modell-agnosztikus Shapley-érték (SHAP) attribúciókat és a nagy nyelvi modellek (LLM) által generált indoklásokat ötvözi a tanítási minőség értékelésére.

A keretrendszert a CLASS (Classroom Observation Protocol for Algebraic Study) értékelési dimenziója mentén, a NCTE (National Council of Teachers of English) korpuszán tesztelték. Az új megközelítés lehetővé teszi a finomhangolt előképzett nyelvi modellek (PLM) és a promptolt LLM-ek szisztematikus összehasonlítását mind a pontozási teljesítmény, mind az indoklás hűségessége szempontjából. Több mint 6000 annotált átiratszegmensen végeztek vizsgálatokat.

Kapcsolódó: LLM-tesztelés

PLM-ek pontossága, SHAP hűségessége

Az eredmények szerint a finomhangolt PLM-ek pontosabbak a predikcióban, mint az LLM-ek, bár hajlamosak a közepes pontszámok felé tömöríteni az eredményeket. A törlésen alapuló tesztek kimutatták, hogy a SHAP megbízhatóan azonosítja azokat a mondatokat, amelyek leginkább befolyásolják a modell predikcióit.

Kapcsolódó: Kvalitatív kutatások

Átviteli képesség és következtetések

A modellarchitektúrákon átívelő elemzések azt is kimutatták, hogy a SHAP attribúciók robusztusan átvihetők, míg az LLM-indoklások csak korlátozott és következetlen befolyást gyakoroltak. A kutatás eredményeit az arXiv-on tették közzé, a CLASS értékelési dimenziója mentén, több mint 6000 annotált átiratszegmensen végzett vizsgálatok alapján.

Kapcsolódó: Hibaszázalék-becslés

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom