AI-ügynökök 16%-ban teljesítenek már profi minőségű megbízásokat
Az AI-ügynökök immár a kereskedelmileg értékes távmunkák 16,1%-át képesek professzionális minőségben elvégezni, ami nyolc hónap alatt több mint négyszeres növekedést jelent.

A RLI a fizetett, valós megbízások minőségét méri, amelyeket AI-ügynökök végeznek el. A tesztterület magában foglalja a 3D- és CAD-tervezést, építészetet, grafikai tervezést, videó- és animációkészítést, hangfeldolgozást, adatelemzést és webalkalmazás-fejlesztést. A minősítést emberi értékelők végzik, egy fizetett szakember által létrehozott arany standarddal összehasonlítva.
Fable 5 kiemelkedő eredményei és korlátai
A Fable 5 16,1%-os eredménye kiemelkedő, de figyelembe kell venni, hogy az amerikai kormány korlátozásai miatt csak 218 projektet tudtak értékelni a 240-ből. A legrosszabb esetben is, ha a hiányzó projektek mind sikertelenek lettek volna, a Fable 5 aránya 14,6% lenne, ami így is magasabb, mint bármely más modellé. A legkomplexebb feladatok közé tartozott egy alaprajz, bútorelrendezés és fotorealisztikus fürdőszobai render elkészítése.
Kapcsolódó: AI-ügynökök és keresők teljesítménye
Az AI-értékelők pontatlanok
A kutatás során tesztelték, hogy az emberi értékelőket helyettesíthetik-e AI-bírák. Az eredmények azt mutatták, hogy az AI-bírák túl nagyvonalúan értékelték az új modelleket, akár háromszorosan is túlbecsülve az eredményeket. Az emberi szakértelem továbbra is elengedhetetlen a pontos minőségértékeléshez, mivel az AI-ügynökök nehezen birkóznak meg a professzionális szoftverek használatával és a fizető ügyfél szempontjainak figyelembevételével.
Kapcsolódó: MIT előrejelzése az AI fejlődéséről
A modellek képességeinek teljes körű felméréséhez a kutatók olyan professzionális eszközöket használtak, mint a Claude Code és a Codex CLI, amelyeket grafikus programok közvetlen kezelésére is kiterjesztettek. A tesztkörnyezet egy virtuális Linux-gép volt, több mint 30 professzionális alkalmazással, köztük Blenderrel, GIMP-pel és Audacity-vel. Minden projekt futtatására 24 óra számítási időt biztosítottak.
Kapcsolódó: AI-projektek költségeloszlása
A Fable 5 eredményei lenyűgözőek, a bemutatott példák mutatják, hogy az AI még mindig nem éri el a legtöbb projekten a professzionális minőséget. A fejlődés üteme figyelemre méltó, ami a távmunka automatizálásának gyors előrehaladását tükrözi.
Kapcsolódó: Hosszú távú figyelem tesztelése AI-ügynököknél