ÉlőUtoljára: 2 órájaMa: 10
Kutatásfrissítve: 18:15

AI-ügynökök 16%-ban teljesítenek már profi minőségű megbízásokat

Az AI-ügynökök immár a kereskedelmileg értékes távmunkák 16,1%-át képesek professzionális minőségben elvégezni, ami nyolc hónap alatt több mint négyszeres növekedést jelent.

AI-ügynökök 16%-ban teljesítenek már profi minőségű megbízásokat
Fotó: Kvistholt Photography / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

A RLI a fizetett, valós megbízások minőségét méri, amelyeket AI-ügynökök végeznek el. A tesztterület magában foglalja a 3D- és CAD-tervezést, építészetet, grafikai tervezést, videó- és animációkészítést, hangfeldolgozást, adatelemzést és webalkalmazás-fejlesztést. A minősítést emberi értékelők végzik, egy fizetett szakember által létrehozott arany standarddal összehasonlítva.

Fable 5 kiemelkedő eredményei és korlátai

A Fable 5 16,1%-os eredménye kiemelkedő, de figyelembe kell venni, hogy az amerikai kormány korlátozásai miatt csak 218 projektet tudtak értékelni a 240-ből. A legrosszabb esetben is, ha a hiányzó projektek mind sikertelenek lettek volna, a Fable 5 aránya 14,6% lenne, ami így is magasabb, mint bármely más modellé. A legkomplexebb feladatok közé tartozott egy alaprajz, bútorelrendezés és fotorealisztikus fürdőszobai render elkészítése.

Kapcsolódó: AI-ügynökök és keresők teljesítménye

Az AI-értékelők pontatlanok

A kutatás során tesztelték, hogy az emberi értékelőket helyettesíthetik-e AI-bírák. Az eredmények azt mutatták, hogy az AI-bírák túl nagyvonalúan értékelték az új modelleket, akár háromszorosan is túlbecsülve az eredményeket. Az emberi szakértelem továbbra is elengedhetetlen a pontos minőségértékeléshez, mivel az AI-ügynökök nehezen birkóznak meg a professzionális szoftverek használatával és a fizető ügyfél szempontjainak figyelembevételével.

Kapcsolódó: MIT előrejelzése az AI fejlődéséről

A modellek képességeinek teljes körű felméréséhez a kutatók olyan professzionális eszközöket használtak, mint a Claude Code és a Codex CLI, amelyeket grafikus programok közvetlen kezelésére is kiterjesztettek. A tesztkörnyezet egy virtuális Linux-gép volt, több mint 30 professzionális alkalmazással, köztük Blenderrel, GIMP-pel és Audacity-vel. Minden projekt futtatására 24 óra számítási időt biztosítottak.

Kapcsolódó: AI-projektek költségeloszlása

A Fable 5 eredményei lenyűgözőek, a bemutatott példák mutatják, hogy az AI még mindig nem éri el a legtöbb projekten a professzionális minőséget. A fejlődés üteme figyelemre méltó, ami a távmunka automatizálásának gyors előrehaladását tükrözi.

Kapcsolódó: Hosszú távú figyelem tesztelése AI-ügynököknél

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom