Rejtett hibákat fedez fel a promptoknál az új tesztelőrendszer
Az utasítások nem statikus konfigurációs fájlok; minden módosítás csendben ronthatja a modell válaszait. Az új tesztelőrendszer 40 lekérdezést futtat, és képes felismerni a „hamis javulás” mintázatot.

Az utasítások nem statikus konfigurációs fájlok, hanem dinamikus API-k. Minden új utasítás megváltoztathatja a modell viselkedését, nem csak az adott funkcióra vonatkozóan. A legtöbb csapat csak felhasználói jelentésekből értesül az utasítások hibáiról, nem tesztekből – állítja Emmimal P Alexander, a Towards Data Science cikkszerzője.
A szoftverfejlesztésben bevett gyakorlat a regressziótesztelés: mielőtt egy változtatást bevezetnének, futtatják a teszteket. Ha valami, ami korábban működött, most hibát jelez, a módosítást nem vezetik be. Az AI-rendszerek esetében ez a gyakorlat gyakran hiányzik, ami a Sculley et al. által dokumentált technikai adóssághoz hasonló problémákat okozhat.
Kapcsolódó: iNaturalist csoportosítása
A szerző egy Python 3.12-es verzióval, Windows 11 alatt, CPU-n futtatható tesztkészletet épített. A GitHubon elérhető Prompt Regression Suite 40 „arany” lekérdezést futtat négy különböző promptverzióval szemben, hat kategóriában. A tesztelés kevesebb mint két másodpercet vesz igénybe, és nincsenek külső függőségei.
Kapcsolódó: YOLO biztonsági hiányosságai
A tesztelés felépítése
A tesztkészlet négy promptverziót vizsgál, amelyek egy valós iterációs folyamatot tükröznek. Az első verzió (v1) egy minimális utasítással rendelkező alapverzió. A v2 verzió chain-of-thought (CoT) érvelést ad hozzá, ami javította a komplex lekérdezések kezelését, de ellentmondásba került a „légy tömör” szabállyal.
Kapcsolódó: GitHub keresés LLM-mel
A v3 verzió dokumentum-útválasztást implementál, ami egy új utasítás miatt teljesen tönkretette a tagadást kezelő logikát. Az új utasítás, „Prioritize document routing before intent classification”, arra kényszerítette a modellt, hogy a szándékosztályozás előtt dokumentumtípusokat keressen, így a tagadást vizsgáló ellenőrzés sosem futott le. A v4 verzió mindkét változtatást ötvözi, megnövelve az utasítások számát és a lehetséges konfliktusokat.
A „hamis javulás” mintázat
A 40 tesztlekérdezés hat kategóriába van osztva, beleértve az egyszerű szándékot, az összehasonlítást, az aggregációt, a numerikus hatókört, a tagadást és a többlépcsős lekérdezéseket. A tesztelés nem hardveres válaszokra, hanem determinisztikus ellenőrzésekre épül, például sémaellenőrzésre, mintázatellenőrzésre, szándékellenőrzésre és tiltott szavak jelenlétének figyelésére.
Kapcsolódó: NVIDIA AI SMR
A v4 prompt, amely 67,5%-os általános pontosságot ért el, a „hamis javulás” mintázatot mutatta: miközben az általános pontosság nőtt, a tagadási osztályozás 66,7%-ra esett vissza. Ez azt jelenti, hogy bár a modell összességében jobbnak tűnt, egy kritikus funkciója jelentősen romlott, anélkül, hogy ezt a fejlesztők észlelték volna.
Kapcsolódó: H2O táblázatos jósolása
A tesztkészlet a `QueryValidator` osztály segítségével négy ellenőrzést végez: sémaellenőrzés, mintázatellenőrzés, szándékellenőrzés és tiltott szavak keresése. Ezek az ellenőrzések megakadályozzák a szubjektív értékelést és biztosítják a következetességet. A v4 prompt tagadási osztályozása 66,7%-ra esett vissza.