AI-modellek 21 százalékponttal jobban válaszolnak a komplex kérdésekre
Az AI-modellek 21 százalékponttal jobban teljesítenek a többtáblás adatbázis-kérdések megválaszolásában egy új, szintetikus adatkészletet használó tréningmódszerrel. Az új eljárás a Qwen3-14B, Mistral-8B és Llama-3.1-8B modelleken is kimutatható fejlődést hozott.

A több táblát tartalmazó adatbázisok megértése komoly kihívást jelent az AI-modellek számára. A feladat során nem csupán releváns információkat kell gyűjteniük, hanem össze kell kapcsolniuk a különböző táblák sémáit, majd összetett logikai műveleteket kell végrehajtaniuk az adatokon. A meglévő adatbázis-kérdés-válasz (Q&A) rendszerek gyakran csak a végső választ adják meg, de nem magyarázzák el, hogyan jutottak oda — ez a hiányosság akadályozza a modellek fejlődését.
Ezt a problémát orvosolja egy új, szintetikus kontrasztív okoskodási nyomkövető adatkészlet, amelyet a kutatók hoztak létre MMQA-hoz. Az eljárás során különféle nagyméretű nyelvi modellek (LLM) segítségével validált pozitív és valósághű negatív válaszokat generáltak.
Kapcsolódó: Táblázatkezelés fejlesztése
Jelentős teljesítménynövekedés
A Qwen3-14B, Mistral-8B és Llama-3.1-8B modelleken végzett kísérletek kimutatták, hogy a CPO módszer átlagosan 9,7–16,3 százalékos abszolút javulást ért el a hagyományos, kérdés-válasz alapú finomhangoláshoz képest. Különösen a MMQA teljesítményteszten volt látványos a fejlődés, ahol akár 21 százalékponttal is jobban teljesítettek a modellek.
Kapcsolódó: Pénzügyi dokumentumelemzés
A módszer részletei
Az eredmények azt mutatják, hogy a különböző pozitív és negatív válaszokat generáló modellek használata erősíti a kontrasztív jelet. Az automatizált és emberi értékelések is megerősítették, hogy a generált válaszok nagyrészt hűek, koherensek és érdemben különböznek egymástól, ami elengedhetetlen a hatékony tanuláshoz.
Kapcsolódó: Qwen3-8B fejlesztése
A kutatás előnyomtatott formában érhető el az arXivon, a kutatók tovább vizsgálják a Llama 3 alapú Meditron variánsokat is, hogy elkülönítsék a domain-specifikus tudás és az architektúrális fejlesztések hozzájárulását a teljesítményhez, a Qwen3-14B modell 16,3 százalékos abszolút javulást ért el.
Kapcsolódó: DeepSeek-R1 torzítása