Tizenegy tantárgyban és három évfolyamon alkalmazható az Elmes* rendszer
Az Elmes* keretrendszer automatikusan képes finomhangolt értékelési kritériumokat és tesztadatokat generálni szakértői dimenziókból. Ezzel 330 oktatási forgatókönyvet fednek le 11 tantárgyban, 3 évfolyamon.

A nagy nyelvi modellek (LLM) oktatási célú értékelése eddig főként a tudásukra összpontosított, nem pedig arra, hogy mennyire képesek tanítani. A meglévő teljesítménytesztek vagy általános helyességre törekednek, vagy manuálisan tervezett értékelési útmutatókat használnak, amelyek nehezen skálázhatók a speciális oktatási helyzetekre. Az Elmes nevű új keretrendszer ezt a problémát orvosolja.
Az Elmes egy végponttól végpontig tartó rendszert kínál forgatókönyv-specifikus értékelési útmutatók felépítésére és finomítására. Ez egy deklaratív multi-agent motort kombinál egy SceneGen nevű, magát fejlesztő modullal. A SceneGen képes optimalizálni az értékelési kritériumokat és a tesztadatokat szakértői definíciók alapján, így az oktatási képességek széles spektrumát képes lefedni.
Kapcsolódó: LLM-tesztelés
Az Elmes segítségével hozták létre az Edu-330 nevű adathalmazt, amely 330 különböző forgatókönyvet foglal magában. Ezek 11 tantárgyra, 3 évfolyamra és 10 feladattípusra terjednek ki, több mint 1000 másodlagos indikátorral. Az adathalmazt és négy szakértők által összeállított arany standard forgatókönyvet is felhasználva végeztek kísérleteket.
Kapcsolódó: oktatási LLM-ek
Az eredmények azt mutatják, hogy a top-tier LLM-ek közötti különbségek leginkább a kreativitásban és az értékrend integrálásában mutatkoznak meg. A tudásközpontú modellek nehézségekbe ütközhetnek a szókratészi módszer alkalmazásában, míg az oktatásra specializálódott InnoSpark érte el a legjobb emberi értékelésű átlagpontszámot. Az LLM-alapú bírák az emberi értékelésekkel összehasonlítható rangsorokat tartanak fenn, de saját elfogultságokat mutathatnak, például önpreferenciát.
Kapcsolódó: oktatási AI-rendszer
A további elemzések kimutatták, hogy a szakértői pontszámokhoz való igazodást a kevés példával történő anchorálás javítja, míg a következtetési kényszerítés és a mohó dekódolás modellfüggő. Az Elmes így skálázható diagnosztikai infrastruktúrát biztosít a pedagógiailag megalapozott LLM-értékeléshez. Az eredményeket előnyomtatott formában tették közzé az arXivon.
Kapcsolódó: LLM-hibaszázalék