ÉlőUtoljára: 32 perceMa: 10
Eszközökfrissítve: 10:50

Rejtett hibákat fedez fel a promptoknál az új tesztelőrendszer

Az utasítások nem statikus konfigurációs fájlok; minden módosítás csendben ronthatja a modell válaszait. Az új tesztelőrendszer 40 lekérdezést futtat, és képes felismerni a „hamis javulás” mintázatot.

Rejtett hibákat fedez fel a promptoknál az új tesztelőrendszer
Fotó: GuerrillaBuzz / Unsplash
forrás: Towards Data Science·AI Forradalom szerk.·
Megosztás

Az utasítások nem statikus konfigurációs fájlok, hanem dinamikus API-k. Minden új utasítás megváltoztathatja a modell viselkedését, nem csak az adott funkcióra vonatkozóan. A legtöbb csapat csak felhasználói jelentésekből értesül az utasítások hibáiról, nem tesztekből – állítja Emmimal P Alexander, a Towards Data Science cikkszerzője.

A szoftverfejlesztésben bevett gyakorlat a regressziótesztelés: mielőtt egy változtatást bevezetnének, futtatják a teszteket. Ha valami, ami korábban működött, most hibát jelez, a módosítást nem vezetik be. Az AI-rendszerek esetében ez a gyakorlat gyakran hiányzik, ami a Sculley et al. által dokumentált technikai adóssághoz hasonló problémákat okozhat.

Kapcsolódó: iNaturalist csoportosítása

A szerző egy Python 3.12-es verzióval, Windows 11 alatt, CPU-n futtatható tesztkészletet épített. A GitHubon elérhető Prompt Regression Suite 40 „arany” lekérdezést futtat négy különböző promptverzióval szemben, hat kategóriában. A tesztelés kevesebb mint két másodpercet vesz igénybe, és nincsenek külső függőségei.

Kapcsolódó: YOLO biztonsági hiányosságai

A tesztelés felépítése

A tesztkészlet négy promptverziót vizsgál, amelyek egy valós iterációs folyamatot tükröznek. Az első verzió (v1) egy minimális utasítással rendelkező alapverzió. A v2 verzió chain-of-thought (CoT) érvelést ad hozzá, ami javította a komplex lekérdezések kezelését, de ellentmondásba került a „légy tömör” szabállyal.

Kapcsolódó: GitHub keresés LLM-mel

A v3 verzió dokumentum-útválasztást implementál, ami egy új utasítás miatt teljesen tönkretette a tagadást kezelő logikát. Az új utasítás, „Prioritize document routing before intent classification”, arra kényszerítette a modellt, hogy a szándékosztályozás előtt dokumentumtípusokat keressen, így a tagadást vizsgáló ellenőrzés sosem futott le. A v4 verzió mindkét változtatást ötvözi, megnövelve az utasítások számát és a lehetséges konfliktusokat.

A „hamis javulás” mintázat

A 40 tesztlekérdezés hat kategóriába van osztva, beleértve az egyszerű szándékot, az összehasonlítást, az aggregációt, a numerikus hatókört, a tagadást és a többlépcsős lekérdezéseket. A tesztelés nem hardveres válaszokra, hanem determinisztikus ellenőrzésekre épül, például sémaellenőrzésre, mintázatellenőrzésre, szándékellenőrzésre és tiltott szavak jelenlétének figyelésére.

Kapcsolódó: NVIDIA AI SMR

A v4 prompt, amely 67,5%-os általános pontosságot ért el, a „hamis javulás” mintázatot mutatta: miközben az általános pontosság nőtt, a tagadási osztályozás 66,7%-ra esett vissza. Ez azt jelenti, hogy bár a modell összességében jobbnak tűnt, egy kritikus funkciója jelentősen romlott, anélkül, hogy ezt a fejlesztők észlelték volna.

Kapcsolódó: H2O táblázatos jósolása

A tesztkészlet a `QueryValidator` osztály segítségével négy ellenőrzést végez: sémaellenőrzés, mintázatellenőrzés, szándékellenőrzés és tiltott szavak keresése. Ezek az ellenőrzések megakadályozzák a szubjektív értékelést és biztosítják a következetességet. A v4 prompt tagadási osztályozása 66,7%-ra esett vissza.

Forrás

Feldolgozott sajtóforrás·Towards Data Science

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom