Kilencven százalékos pontosságot érhetnek el aritmetikai feladatokban a GEPA-val fejlesztett modellek
A GEPA keretrendszerrel fejlesztett nyelvi modellek 90%-os pontosságot érhetnek el aritmetikai feladatokban. A módszer a számítások megbízhatóságát növeli.

A GEPA, egy reflexív prompt-evolúciós keretrendszer, új lehetőségeket nyit a nyelvi modellek matematikai szavak problémáinak megoldásában. A módszer célja a pontosság növelése és a megbízható válaszadás biztosítása.
A folyamat egy gyenge kiinduló prompttal kezdődik. Ezt követően létrehoznak egy kis, determinisztikus teljesítménytesztet, amely aritmetikai feladatokat tartalmaz. Ezután definiálnak egy strukturált értékelőt, amely visszajelzést ad a GEPA-nak, segítve azt a jelölt utasítások hibáinak megértésében.
Kapcsolódó: automatizált promptmérnökség
A többkomponensű utasítások szerepe
Az új megközelítés egy többkomponensű prompt-beállítást használ. Ebben az utasításmező és a kimeneti formátumszabályok együtt fejlődnek. Ez lehetővé teszi a modell számára, hogy ne csak a feladat megoldására koncentráljon, hanem a válasz formátumának helyességére is.
Kapcsolódó: emberi felügyelet nélküli promptok
A GEPA és a LiteLLM konfigurálása
A folyamat során telepítik a GEPA és a LiteLLM könyvtárakat, majd importálják a szükséges modulokat a prompt-optimalizáláshoz és a modellhívásokhoz. Biztonságosan beállítják az OpenAI API kulcsot, és definiálnak két modellt: egy feladatmodellt a problémák megoldására és egy reflexiós modellt az utasítások javítására. A maximális metrikahívási költségvetést is beállítják, hogy az optimalizálási folyamat kontrollált maradjon.
Kapcsolódó: kódellenőrzési pontosság
Determinisztikus aritmetikai teljesítményteszt létrehozása
Létrehoznak egy kis, determinisztikus adatkészletet aritmetikai szófeladatokkal, amelyek lefedik a kedvezményeket, utazási távolságokat, pénztárca-kalkulációkat és láncolt műveleteket. A helyes válaszokat programatikusan generálják, ami megbízhatóvá és könnyen értékelhetővé teszi a teljesítménytesztet. Az adatokat ezután összekeverik és felosztják egy optimalizálási célú tréninghalmazra és egy tesztelési validációs halmazra.
Kapcsolódó: helyi LLM adatvédelem
Értékelő és strukturált visszajelzés definiálása
Az értékelő meghatározza, hogyan alakul a jelölt prompt rendszer-prompttá, és hogyan kapja meg a feladatmodell az egyes kérdéseket. Létrehoznak egy értékelőt, amely elemzi a modell kimenetét, ellenőrzi, hogy a végső válasz megfelel-e a szükséges formátumnak, és pontszámot ad. A strukturált visszajelzés akcióképes mellékes információként szolgál, így a GEPA meg tudja határozni, hogy a probléma helytelen következtetésből, rossz formázásból vagy mindkettőből adódik-e.
Kapcsolódó: LLM optimalizáció
A folyamat végén a GPT-4o-mini és a GPT-4.1 modellek használatával a nyelvi modellek megbízhatóbban oldanak meg matematikai feladatokat, a GEPA keretrendszerrel fejlesztett modellek 90%-os pontosságot érhetnek el aritmetikai feladatokban.