Új, hatékony tételbizonyító család a Pythagoras-Prover — 167-szer kisebb modellel veri a DeepSeek-et
A 4 milliárdos Pythagoras-Prover-4B modell 167-szer kevesebb paraméterrel előzi meg a 671 milliárdos DeepSeek-Prover-V2-671B-t a MiniF2F-Testen, 86,1%-os pontossággal.

Az arXiv-on publikált kutatás bemutatja a Pythagoras-Provert, egy új, számítási kapacitás szempontjából hatékony nyílt forráskódú Lean tételbizonyító családot. A modellek két generációs paradigmát követnek: autoregresszív modellek 4 és 32 milliárd paraméterrel, valamint egy diffúzió-alapú bizonyító (4B), amely iteratívan finomítja a Lean bizonyításokat futásidőben.
A kutatók curriculum SFT (supervised finomhangolás) módszert alkalmaztak, amely könnyű, közepes és nehéz problémákra rétegzett Lean-ellenőrzött korpuszt épít. Ez lehetővé teszi a modellek számára, hogy fokozatosan sajátítsák el a bizonyítási készségeket, rövidebb, egyszerűbb bizonyításoktól a hosszabbak felé haladva.
Kapcsolódó: matematikai bizonyítások
Mire képes a Pythagoras-Prover modell
A dinamikus bizonyítás-érvelés szűrési séma 8k-tokenes kontextuskeretet tart be, miközben megőrzi az információgazdag bizonyítási nyomokat. Az Augmented Lean Formalisation (ALF) módszer bővíti a szűkös, ellenőrzött korpuszokat a formális állítások változataival.
Kapcsolódó: tanulási modell visszajelzések
A Pythagoras-Prover teljesítménye a MiniF2F-Testen
Empirikus tesztek alapján a Pythagoras-Prover-4B 86,1%-os pass@32 eredményt ér el a MiniF2F-Testen, ami meghaladja a DeepSeek-Prover-V2-671B 82,4%-os teljesítményét, miközben 167-szer kevesebb paramétert használ. A Pythagoras-Prover-32B 93,0%-os pontossággal állítja be a nyílt forráskódú állapota a művészetnek a MiniF2F-Testen, és 672 PutnamBench probléma közül 93-at old meg. A kutatás az arXiv-on érhető el, a Pythagoras-Prover-4B modell 2026-ban publikált eredményei alapján.
Kapcsolódó: jogi AI megbízhatóság