ÉlőUtoljára: 28 perceMa: 18
Modellek & LLMfrissítve: 04:45

Anthropic Fable 5 16,1%-os automatizálási rátával dönt rekordot a távmunkában

Az Anthropic Fable 5 modellje 16,1%-os automatizálási rátával új rekordot állított fel a távmunkában, ami több mint kétszerese az előző csúcstartónak, az Opus 4.8-nak.

Anthropic Fable 5 16,1%-os automatizálási rátával dönt rekordot a távmunkában
Fotó: Growtika / Unsplash
forrás: ZDNet AI·AI Forradalom szerk.·
Megosztás

A RLI (Remote Labor Index) teljesítményteszt azt méri, hogy az AI-ügynökök milyen gyakran tudnak gazdaságilag értékes, valós távmunkaprojekteket teljesíteni olyan minőségben, amit egy fizető ügyfél is elfogadna. Ezek közé tartozik grafikai tervezés, adat- és videóelemzés, valamint egyéb digitális feladatok. A modellek által létrehozott eredményeket emberi értékelők hasonlítják össze emberi szakemberek munkájával.

Gyors fejlődés, de emberi felügyelet kell

A CAIS szerint az AI-ügynökök képességei „kevesebb mint nyolc hónap alatt megnégyszereződtek”. A Fable 5 eredménye azért is kiemelkedő, mert a tesztelés közepén a kormány leállította a modell működését. A kutatók becslése szerint még a legrosszabb esetben is, ha a modell minden hiányzó projektet elhibázott volna, az automatizálási rátája 14,6% lett volna, ami így is magasabb minden más modellnél.

Kapcsolódó: Taste Labs 18,5 millió dolláros AI-finanszírozása

Annak ellenére, hogy az AI modellek képességei rohamosan fejlődnek, a 16%-os automatizálási ráta messze van attól, hogy teljes mértékben helyettesítse az emberi szabadúszókat. A legtöbb szervezet számára az AI-eszközök integrálása továbbra is lassú, több lépésből álló folyamat, amelyet biztonsági aggályok és egyéb akadályok nehezítenek. Egy emberi szabadúszó teljes kiváltásához valószínűleg több ügynökből álló hálózatra lenne szükség, amelyek ellenőrzik a munka minőségét, a költségvetést és az idővonalat.

Kapcsolódó: Anthropic Claude Opus 4.7 kódolási teljesítménye

Az emberi értékelés még mindig kulcsfontosságú

A CAIS megpróbálta helyettesíteni az emberi értékelőt egy „LLM-bíróval”, de a kísérlet kudarcot vallott. A RLI értékelése önmagában is igényes, ügynöki feladat, amelyhez a projektfájlok megfelelő szakmai alkalmazásokban való megnyitása, azok kompetens kezelése és az ügyfél szemszögéből történő ítélkezés szükséges – olyan számítógépes készségek, amelyekben a mai ügynökök még mindig a leggyengébbek.

Kapcsolódó: Anthropic Claude Opus 4.7 visszatérése a csúcsra

A fejlesztések ellenére az AI-képességek fejlődése csökkentheti bizonyos cégek szabadúszói lehetőségeit. Ha a számítógépes készségek jelenlegi korlátja hamarosan eltűnik a befektetéseknek köszönhetően, a még gyorsabb változást hozhat. A CAIS megjegyezte, hogy míg egyes feladatok, mint a zene átírása vagy egy valós idejű játék tesztelése, továbbra is kihívást jelentenek az AI számára, addig más, embernek órákat vevő feladatokat, mint a digitális művészet vagy a kódolás, a jelenlegi modellek percek alatt elvégeznek.

Kapcsolódó: Claude Opus 4.7 kódolási teljesítményugrása

Forrás

Feldolgozott sajtóforrás·ZDNet AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom