Futtatja a kódot és generál képernyőképeket a Greptile új TREX rendszere
A Greptile új TREX (Test, Run, Execute) rendszere a statikus kódellenőrzés korlátait feszegeti: futtatja a kódot, és vizuális artefaktumokkal támasztja alá a hibákat.

A Greptile bemutatta a TREX-et, egy AI-kódellenőrző rendszert, amely nemcsak átnézi a kódot, hanem futtatja is azt, így olyan hibákat fedez fel, amelyek csak futás közben válnak láthatóvá. Ez a megközelítés túlmutat a hagyományos statikus kódellenőrzésen, amelynek korlátai vannak abban, hogy megértse, mit csinál valójában a program.
A TREX egy többügynökös architektúrát használ, ahol a fő Greptile reviewer agent irányítja a dedikált TREX alügynököket. Ez a megosztott kontextus megakadályozza az ismétlődő munkát és a számítási kapacitás pazarlását. A rendszer képes párhuzamosan több TREX ügynököt indítani, teszteket futtatni, hitelesítést kezelni, és vizuális eredményeket, például képernyőképeket vagy videókat generálni.
Kapcsolódó: AI-ellenállás a Hacker News-n
Az első verzióban a TREX csak listázta a talált hibákat, ami nem volt elég informatív. Az új, több-modális artefaktumok — képernyőképek, naplók, API-nyomvonalak és végrehajtási szkriptek — részletesebb betekintést nyújtanak a tesztelési folyamatba, lehetővé téve a hibák pontos helyének azonosítását és ellenőrzését. Ez a megközelítés hasonló ahhoz, ahogy az iskolában is meg kell mutatni a feladat megoldásának lépéseit.
Kapcsolódó: AI-kód karbantartási kihívásai
A Greptile a TREX-et egy modell-agnosztikus keretrendszerre építette, amely lehetővé teszi a különböző AI-modell-szolgáltatók közötti gyors váltást anélkül, hogy az egész rendszert újra kellene építeni. Ez rugalmasságot biztosít, mivel a fő és az alügynökök akár különböző szolgáltatókat is használhatnak, így mindig a legoptimálisabb modell választható ki belső értékelések alapján.
Kapcsolódó: Helyi AI megbízhatósági megoldások
A rendszer értékelése a hibafeltárási arány (recall) és a konzisztencia (precision) mérésére összpontosít, nem pedig a sebességre. A cél, hogy pontos és megbízható eredményeket adjon, még akkor is, ha ez hosszabb várakozási időt jelent. A nyílt forráskódú értékelő keretrendszerük hasonló minőséget biztosít, mint a natív szolgáltatói megoldások.
Kapcsolódó: AI a sebezhetőségek felfedezésében
A TREX a hibákat közvetlenül a pull requestekre kommentként jelzi. Ha a funkciók tesztelése sikeres, azt a rendszer összefoglalóba teszi, igazolva, hogy a változtatásokat tesztelték. A Greptile szerint a futtatás-alapú kódellenőrzés jelentősen javítja a hibafeltárást a statikus elemzésen túl, bár a rendszer hatékonyságát emberi felülvizsgálókhoz képest független tesztek még nem erősítették meg.
Kapcsolódó: Nyílt forrású jogi AI