Anthropic Fable 5 16,1%-os automatizálási rátával dönt rekordot a távmunkában
Az Anthropic Fable 5 modellje 16,1%-os automatizálási rátával új rekordot állított fel a távmunkában, ami több mint kétszerese az előző csúcstartónak, az Opus 4.8-nak.

A RLI (Remote Labor Index) teljesítményteszt azt méri, hogy az AI-ügynökök milyen gyakran tudnak gazdaságilag értékes, valós távmunkaprojekteket teljesíteni olyan minőségben, amit egy fizető ügyfél is elfogadna. Ezek közé tartozik grafikai tervezés, adat- és videóelemzés, valamint egyéb digitális feladatok. A modellek által létrehozott eredményeket emberi értékelők hasonlítják össze emberi szakemberek munkájával.
Gyors fejlődés, de emberi felügyelet kell
A CAIS szerint az AI-ügynökök képességei „kevesebb mint nyolc hónap alatt megnégyszereződtek”. A Fable 5 eredménye azért is kiemelkedő, mert a tesztelés közepén a kormány leállította a modell működését. A kutatók becslése szerint még a legrosszabb esetben is, ha a modell minden hiányzó projektet elhibázott volna, az automatizálási rátája 14,6% lett volna, ami így is magasabb minden más modellnél.
Kapcsolódó: Taste Labs 18,5 millió dolláros AI-finanszírozása
Annak ellenére, hogy az AI modellek képességei rohamosan fejlődnek, a 16%-os automatizálási ráta messze van attól, hogy teljes mértékben helyettesítse az emberi szabadúszókat. A legtöbb szervezet számára az AI-eszközök integrálása továbbra is lassú, több lépésből álló folyamat, amelyet biztonsági aggályok és egyéb akadályok nehezítenek. Egy emberi szabadúszó teljes kiváltásához valószínűleg több ügynökből álló hálózatra lenne szükség, amelyek ellenőrzik a munka minőségét, a költségvetést és az idővonalat.
Kapcsolódó: Anthropic Claude Opus 4.7 kódolási teljesítménye
Az emberi értékelés még mindig kulcsfontosságú
A CAIS megpróbálta helyettesíteni az emberi értékelőt egy „LLM-bíróval”, de a kísérlet kudarcot vallott. A RLI értékelése önmagában is igényes, ügynöki feladat, amelyhez a projektfájlok megfelelő szakmai alkalmazásokban való megnyitása, azok kompetens kezelése és az ügyfél szemszögéből történő ítélkezés szükséges – olyan számítógépes készségek, amelyekben a mai ügynökök még mindig a leggyengébbek.
Kapcsolódó: Anthropic Claude Opus 4.7 visszatérése a csúcsra
A fejlesztések ellenére az AI-képességek fejlődése csökkentheti bizonyos cégek szabadúszói lehetőségeit. Ha a számítógépes készségek jelenlegi korlátja hamarosan eltűnik a befektetéseknek köszönhetően, a még gyorsabb változást hozhat. A CAIS megjegyezte, hogy míg egyes feladatok, mint a zene átírása vagy egy valós idejű játék tesztelése, továbbra is kihívást jelentenek az AI számára, addig más, embernek órákat vevő feladatokat, mint a digitális művészet vagy a kódolás, a jelenlegi modellek percek alatt elvégeznek.
Kapcsolódó: Claude Opus 4.7 kódolási teljesítményugrása