ÉlőUtoljára: 2 órájaMa: 2
Kutatásfrissítve: 06:30

Kutatók: LLM tévedések

A nagy nyelvi modellek tévedései kimutathatók a belső rétegekben. A Stanford és a Google Robotics kutatói fedezték fel ezt.

Kutatók: LLM tévedések
Fotó: Zosia Szopka / Unsplash
forrás: ArXiv ML·AI Forradalom szerk.·
Megosztás

A nagy nyelvi modellek (LLM) tévedései, azaz hazugságai egyértelműen kimutathatók a belső számítási rétegekben, különösen a 4-bites kvantálású modellek esetében — állítja egy új kutatás. A Stanford és a Google Robotics kutatói által végzett vizsgálat szerint a modellen belüli, úgynevezett hidden state-ekben egy lineárisan dekódolható jel rejlik, amely a modell igazságtartalmára utal.

A kutatásban három, 7-8 milliárd paraméteres, instruktor-hangolt modellt (Llama-3.1-8B, Mistral-7B, Qwen2.5-7B) vizsgáltak 4-bites NF4 kvantálás mellett. Négy különböző tesztkészleten (TruthfulQA, HaluEval-QA, FEVER és egy kontrollált szintetikus adathalmaz) elemezték a modellek kimeneteit.

Kapcsolódó: LLM hallucináció

A hazugságok nyomában

Eredményeik alapján egy egyszerű lineáris szűrő (probe) képes volt 0.904 és 1.000 közötti AUROC (Area Under the Receiver Operating Characteristic curve) értékkel felismerni a hazugságokat, míg a bonyolultabb, mintavételezésen alapuló detektorok nem érték el a 0.541 AUROC-ot.

Kapcsolódó: VLM dekódolás

A vizsgálat rávilágított, hogy az igazságtartalom jelzése nagyjából lineáris. A MLP (Multi-Layer Perceptron) szűrők ritkán teljesítettek jobban a lineáris szűrőknél, mindössze 0.01 AUROC különbséggel.

Kapcsolódó: PentaNet projekt

A modell belső működése

A leginformatívabb rétegek következetesen a modell közepén helyezkedtek el: a Llama és Mistral modellek esetében a 32 réteg közül a 13-18. blokkok, míg a Qwen modelleknél a 28 réteg közül a 19-25. blokkok bizonyultak a legígéretesebbnek. A kutatáshoz szükséges kód és adatok a Google Robotics által publikált, 2024. március 10-én.

Kapcsolódó: Szorzásmentes LLM

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom