ÉlőUtoljára: 2 órájaMa: 2
Kutatásfrissítve: 10:50

AI-modellek 21 százalékponttal jobban válaszolnak a komplex kérdésekre

Az AI-modellek 21 százalékponttal jobban teljesítenek a többtáblás adatbázis-kérdések megválaszolásában egy új, szintetikus adatkészletet használó tréningmódszerrel. Az új eljárás a Qwen3-14B, Mistral-8B és Llama-3.1-8B modelleken is kimutatható fejlődést hozott.

AI-modellek 21 százalékponttal jobban válaszolnak a komplex kérdésekre
Fotó: Mariia Shalabaieva / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

A több táblát tartalmazó adatbázisok megértése komoly kihívást jelent az AI-modellek számára. A feladat során nem csupán releváns információkat kell gyűjteniük, hanem össze kell kapcsolniuk a különböző táblák sémáit, majd összetett logikai műveleteket kell végrehajtaniuk az adatokon. A meglévő adatbázis-kérdés-válasz (Q&A) rendszerek gyakran csak a végső választ adják meg, de nem magyarázzák el, hogyan jutottak oda — ez a hiányosság akadályozza a modellek fejlődését.

Ezt a problémát orvosolja egy új, szintetikus kontrasztív okoskodási nyomkövető adatkészlet, amelyet a kutatók hoztak létre MMQA-hoz. Az eljárás során különféle nagyméretű nyelvi modellek (LLM) segítségével validált pozitív és valósághű negatív válaszokat generáltak.

Kapcsolódó: Táblázatkezelés fejlesztése

Jelentős teljesítménynövekedés

A Qwen3-14B, Mistral-8B és Llama-3.1-8B modelleken végzett kísérletek kimutatták, hogy a CPO módszer átlagosan 9,7–16,3 százalékos abszolút javulást ért el a hagyományos, kérdés-válasz alapú finomhangoláshoz képest. Különösen a MMQA teljesítményteszten volt látványos a fejlődés, ahol akár 21 százalékponttal is jobban teljesítettek a modellek.

Kapcsolódó: Pénzügyi dokumentumelemzés

A módszer részletei

Az eredmények azt mutatják, hogy a különböző pozitív és negatív válaszokat generáló modellek használata erősíti a kontrasztív jelet. Az automatizált és emberi értékelések is megerősítették, hogy a generált válaszok nagyrészt hűek, koherensek és érdemben különböznek egymástól, ami elengedhetetlen a hatékony tanuláshoz.

Kapcsolódó: Qwen3-8B fejlesztése

A kutatás előnyomtatott formában érhető el az arXivon, a kutatók tovább vizsgálják a Llama 3 alapú Meditron variánsokat is, hogy elkülönítsék a domain-specifikus tudás és az architektúrális fejlesztések hozzájárulását a teljesítményhez, a Qwen3-14B modell 16,3 százalékos abszolút javulást ért el.

Kapcsolódó: DeepSeek-R1 torzítása

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom