Kutatók a SHAP és LLM modelleket értékelik a tanítási minőségértékelésben
Az automatizált értékelő modellek kevés betekintést nyújtanak abba, miért kap egy tanár bizonyos minősítést. Kutatók új keretrendszert javasolnak, amely a SHAP-értékeket és LLM-indoklásokat kombinálja.

Az automatizált pontozási modellek egyre elterjedtebbek a komplex nyelvi teljesítmények, például tantermi átiratok értékelésében. Ezek a rendszerek azonban ritkán magyarázzák meg, miért született egy adott pontszám. Kutatók most egy új keretrendszert dolgoztak ki, amely a modell-agnosztikus Shapley-érték (SHAP) attribúciókat és a nagy nyelvi modellek (LLM) által generált indoklásokat ötvözi a tanítási minőség értékelésére.
A keretrendszert a CLASS (Classroom Observation Protocol for Algebraic Study) értékelési dimenziója mentén, a NCTE (National Council of Teachers of English) korpuszán tesztelték. Az új megközelítés lehetővé teszi a finomhangolt előképzett nyelvi modellek (PLM) és a promptolt LLM-ek szisztematikus összehasonlítását mind a pontozási teljesítmény, mind az indoklás hűségessége szempontjából. Több mint 6000 annotált átiratszegmensen végeztek vizsgálatokat.
Kapcsolódó: LLM-tesztelés
PLM-ek pontossága, SHAP hűségessége
Az eredmények szerint a finomhangolt PLM-ek pontosabbak a predikcióban, mint az LLM-ek, bár hajlamosak a közepes pontszámok felé tömöríteni az eredményeket. A törlésen alapuló tesztek kimutatták, hogy a SHAP megbízhatóan azonosítja azokat a mondatokat, amelyek leginkább befolyásolják a modell predikcióit.
Kapcsolódó: Kvalitatív kutatások
Átviteli képesség és következtetések
A modellarchitektúrákon átívelő elemzések azt is kimutatták, hogy a SHAP attribúciók robusztusan átvihetők, míg az LLM-indoklások csak korlátozott és következetlen befolyást gyakoroltak. A kutatás eredményeit az arXiv-on tették közzé, a CLASS értékelési dimenziója mentén, több mint 6000 annotált átiratszegmensen végzett vizsgálatok alapján.
Kapcsolódó: Hibaszázalék-becslés