Kutatók: LLM tévedések
A nagy nyelvi modellek tévedései kimutathatók a belső rétegekben. A Stanford és a Google Robotics kutatói fedezték fel ezt.

A nagy nyelvi modellek (LLM) tévedései, azaz hazugságai egyértelműen kimutathatók a belső számítási rétegekben, különösen a 4-bites kvantálású modellek esetében — állítja egy új kutatás. A Stanford és a Google Robotics kutatói által végzett vizsgálat szerint a modellen belüli, úgynevezett hidden state-ekben egy lineárisan dekódolható jel rejlik, amely a modell igazságtartalmára utal.
A kutatásban három, 7-8 milliárd paraméteres, instruktor-hangolt modellt (Llama-3.1-8B, Mistral-7B, Qwen2.5-7B) vizsgáltak 4-bites NF4 kvantálás mellett. Négy különböző tesztkészleten (TruthfulQA, HaluEval-QA, FEVER és egy kontrollált szintetikus adathalmaz) elemezték a modellek kimeneteit.
Kapcsolódó: LLM hallucináció
A hazugságok nyomában
Eredményeik alapján egy egyszerű lineáris szűrő (probe) képes volt 0.904 és 1.000 közötti AUROC (Area Under the Receiver Operating Characteristic curve) értékkel felismerni a hazugságokat, míg a bonyolultabb, mintavételezésen alapuló detektorok nem érték el a 0.541 AUROC-ot.
Kapcsolódó: VLM dekódolás
A vizsgálat rávilágított, hogy az igazságtartalom jelzése nagyjából lineáris. A MLP (Multi-Layer Perceptron) szűrők ritkán teljesítettek jobban a lineáris szűrőknél, mindössze 0.01 AUROC különbséggel.
Kapcsolódó: PentaNet projekt
A modell belső működése
A leginformatívabb rétegek következetesen a modell közepén helyezkedtek el: a Llama és Mistral modellek esetében a 32 réteg közül a 13-18. blokkok, míg a Qwen modelleknél a 28 réteg közül a 19-25. blokkok bizonyultak a legígéretesebbnek. A kutatáshoz szükséges kód és adatok a Google Robotics által publikált, 2024. március 10-én.
Kapcsolódó: Szorzásmentes LLM