ÉlőUtoljára: 1 órájaMa: 11
Kutatásfrissítve: 10:10

Új, hatékony tételbizonyító család a Pythagoras-Prover — 167-szer kisebb modellel veri a DeepSeek-et

A 4 milliárdos Pythagoras-Prover-4B modell 167-szer kevesebb paraméterrel előzi meg a 671 milliárdos DeepSeek-Prover-V2-671B-t a MiniF2F-Testen, 86,1%-os pontossággal.

Új, hatékony tételbizonyító család a Pythagoras-Prover — 167-szer kisebb modellel veri a DeepSeek-et
Fotó: Tra Nguyen / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az arXiv-on publikált kutatás bemutatja a Pythagoras-Provert, egy új, számítási kapacitás szempontjából hatékony nyílt forráskódú Lean tételbizonyító családot. A modellek két generációs paradigmát követnek: autoregresszív modellek 4 és 32 milliárd paraméterrel, valamint egy diffúzió-alapú bizonyító (4B), amely iteratívan finomítja a Lean bizonyításokat futásidőben.

A kutatók curriculum SFT (supervised finomhangolás) módszert alkalmaztak, amely könnyű, közepes és nehéz problémákra rétegzett Lean-ellenőrzött korpuszt épít. Ez lehetővé teszi a modellek számára, hogy fokozatosan sajátítsák el a bizonyítási készségeket, rövidebb, egyszerűbb bizonyításoktól a hosszabbak felé haladva.

Kapcsolódó: matematikai bizonyítások

Mire képes a Pythagoras-Prover modell

A dinamikus bizonyítás-érvelés szűrési séma 8k-tokenes kontextuskeretet tart be, miközben megőrzi az információgazdag bizonyítási nyomokat. Az Augmented Lean Formalisation (ALF) módszer bővíti a szűkös, ellenőrzött korpuszokat a formális állítások változataival.

Kapcsolódó: tanulási modell visszajelzések

A Pythagoras-Prover teljesítménye a MiniF2F-Testen

Empirikus tesztek alapján a Pythagoras-Prover-4B 86,1%-os pass@32 eredményt ér el a MiniF2F-Testen, ami meghaladja a DeepSeek-Prover-V2-671B 82,4%-os teljesítményét, miközben 167-szer kevesebb paramétert használ. A Pythagoras-Prover-32B 93,0%-os pontossággal állítja be a nyílt forráskódú állapota a művészetnek a MiniF2F-Testen, és 672 PutnamBench probléma közül 93-at old meg. A kutatás az arXiv-on érhető el, a Pythagoras-Prover-4B modell 2026-ban publikált eredményei alapján.

Kapcsolódó: jogi AI megbízhatóság

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom