ÉlőUtoljára: 3 órájaMa: 2
Kutatásfrissítve: 20:10

Kilencven százalékos pontosságot érhetnek el aritmetikai feladatokban a GEPA-val fejlesztett modellek

A GEPA keretrendszerrel fejlesztett nyelvi modellek 90%-os pontosságot érhetnek el aritmetikai feladatokban. A módszer a számítások megbízhatóságát növeli.

Kilencven százalékos pontosságot érhetnek el aritmetikai feladatokban a GEPA-val fejlesztett modellek
Fotó: National Cancer Institute / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A GEPA, egy reflexív prompt-evolúciós keretrendszer, új lehetőségeket nyit a nyelvi modellek matematikai szavak problémáinak megoldásában. A módszer célja a pontosság növelése és a megbízható válaszadás biztosítása.

A folyamat egy gyenge kiinduló prompttal kezdődik. Ezt követően létrehoznak egy kis, determinisztikus teljesítménytesztet, amely aritmetikai feladatokat tartalmaz. Ezután definiálnak egy strukturált értékelőt, amely visszajelzést ad a GEPA-nak, segítve azt a jelölt utasítások hibáinak megértésében.

Kapcsolódó: automatizált promptmérnökség

A többkomponensű utasítások szerepe

Az új megközelítés egy többkomponensű prompt-beállítást használ. Ebben az utasításmező és a kimeneti formátumszabályok együtt fejlődnek. Ez lehetővé teszi a modell számára, hogy ne csak a feladat megoldására koncentráljon, hanem a válasz formátumának helyességére is.

Kapcsolódó: emberi felügyelet nélküli promptok

A GEPA és a LiteLLM konfigurálása

A folyamat során telepítik a GEPA és a LiteLLM könyvtárakat, majd importálják a szükséges modulokat a prompt-optimalizáláshoz és a modellhívásokhoz. Biztonságosan beállítják az OpenAI API kulcsot, és definiálnak két modellt: egy feladatmodellt a problémák megoldására és egy reflexiós modellt az utasítások javítására. A maximális metrikahívási költségvetést is beállítják, hogy az optimalizálási folyamat kontrollált maradjon.

Kapcsolódó: kódellenőrzési pontosság

Determinisztikus aritmetikai teljesítményteszt létrehozása

Létrehoznak egy kis, determinisztikus adatkészletet aritmetikai szófeladatokkal, amelyek lefedik a kedvezményeket, utazási távolságokat, pénztárca-kalkulációkat és láncolt műveleteket. A helyes válaszokat programatikusan generálják, ami megbízhatóvá és könnyen értékelhetővé teszi a teljesítménytesztet. Az adatokat ezután összekeverik és felosztják egy optimalizálási célú tréninghalmazra és egy tesztelési validációs halmazra.

Kapcsolódó: helyi LLM adatvédelem

Értékelő és strukturált visszajelzés definiálása

Az értékelő meghatározza, hogyan alakul a jelölt prompt rendszer-prompttá, és hogyan kapja meg a feladatmodell az egyes kérdéseket. Létrehoznak egy értékelőt, amely elemzi a modell kimenetét, ellenőrzi, hogy a végső válasz megfelel-e a szükséges formátumnak, és pontszámot ad. A strukturált visszajelzés akcióképes mellékes információként szolgál, így a GEPA meg tudja határozni, hogy a probléma helytelen következtetésből, rossz formázásból vagy mindkettőből adódik-e.

Kapcsolódó: LLM optimalizáció

A folyamat végén a GPT-4o-mini és a GPT-4.1 modellek használatával a nyelvi modellek megbízhatóbban oldanak meg matematikai feladatokat, a GEPA keretrendszerrel fejlesztett modellek 90%-os pontosságot érhetnek el aritmetikai feladatokban.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom