Nyílt teljesítményteszten játszik a Balatroval az AI — a modell maga dönt a lépésekről
Az Evalatro nevű új, nyílt teljesítményteszt lehetővé teszi, hogy a nyelvi modellek önállóan, taktikai segítséget nem kérve játsszanak a népszerű Balatro videójátékkal.

Egy Reddit-felhasználó Evalatro néven nyílt teljesítménytesztet hozott létre, ahol a nyelvi modellek (LLM) valódi Balatro-meccseket játszhatnak. A fejlesztő eredetileg csak segítséget kért a játékhoz, de végül egy komplexebb megoldásba fogott.
A rendszer a balatrobot nevű modifikációt használja, amely lehetővé teszi, hogy a modell ne képek, hanem szöveges struktúrák alapján döntsön a játékban. Ez azt jelenti, hogy a modell minden körben önállóan választja ki a következő lépést, taktikai tippek nélkül.
Kapcsolódó: arab nyelvi LLM
A teljesítményteszt részletei
Az Evalatro fix magokat használ a reprodukálhatóság érdekében, így minden modell ugyanazokkal a leosztásokkal találkozik. A rendszer tartalmazza a valódi Balatro játékot, a Steamodded modot és a balatrobotot. Emellett élő nézőfelületet és nyilvános ranglistát is kínál.
Kapcsolódó: személyre szabott LLM
A modell teljesítménye
A futtatási eredmények a kör végén egy nyilvános dashboardra kerülnek, amely nem tartalmaz privát információkat, például kulcsokat vagy fájlelérési utakat. A pontszámot a szerver számítja ki, nem a játékos.
Kapcsolódó: LocalLLaMA modell
A modell képes csatlakozni a játékhoz és önállóan eldönteni, mit játsszon — közölte a Reddit-felhasználó, az Evalatro szerzője. Az Evalatro jelenleg a Steamen keresztül érhető el.
Kapcsolódó: kontrasztív visszajelzés