
Új teljesítménytesztet mutattak be az AI-ügynökök biztonságának értékelésére
Az OSGuard teljesítményteszt a számítógépes feladatokat végző AI-ügynökök biztonságát értékeli, feltárva a helyi és végpontok közötti biztonsági réseket.
AI research papers, arXiv publikációk, benchmarkok, tudományos áttörések

Az OSGuard teljesítményteszt a számítógépes feladatokat végző AI-ügynökök biztonságát értékeli, feltárva a helyi és végpontok közötti biztonsági réseket.

Az AdaNAGED nevű új technika memóriatakarékosabbá teszi a nagy nyelvi modellek (LLM) finomhangolását, miközben a hagyományos módszereknél olcsóbb lehet a feladat-specifikus beállítás.

Az új GRASP módszer memóriatakarékosan, 93,5%-os pontossággal integrál tudást több forrásból, szemben az ensemble módszer 71,7%-ával.

A Stanford kutatói által kifejlesztett DeLM keretrendszer decentralizált koordinációval 50%-kal csökkenti az AI-ügynökök feladatköltségeit, közölte Yuzhen Mao és Azalia Mirhoseini.

Az új PsychAdapter modul képes szimulálni a beszélő személyiségjegyeit, életkorát és mentális állapotát, 87%-os pontossággal a személyiség, 97%-kal a mentális egészség tekintetében.

Kutatók kidolgoztak egy új keretrendszert, a FUSE-t, amely a látási és nyelvi modellek bizonytalanságát méri. A módszer kombinálja az aleatorikus és episztemikus forrásokat, és megbízhatóan jelzi előre a modell kimenetének helyességét.

A módszer a nehéz kérdések esetében 1,4%-kal pontosabb eredményeket hoz, és az ImplicitQA teljesítményteszten mutatta be hatékonyságát.

Ez az együttműködés évekkel megelőzheti az új adatközpontok árammal való ellátását, és lehetővé teheti a fejlett AI-modellek korábbi fejlesztését.

Az Evalatro nevű új, nyílt teljesítményteszt lehetővé teszi, hogy a nyelvi modellek önállóan, taktikai segítséget nem kérve játsszanak a népszerű Balatro videójátékkal.

A Cornell Egyetem kutatói által kifejlesztett Cross-Link Collective nevű rendszer tucatnyi kis robotból áll, amelyek együttesen koordinált mozgást mutatnak, miközben az intelligencia fizikai kölcsönhatásaikban rejlik.

A Claude Opus mögött végzett modellek között olyanok voltak, mint a PaLM, a LLaMA és a Chinchilla, amelyek jobb stratégiai gondolkodást mutattak a Poker Arena tesztjén. A platform által nyújtott részletes elemzés segíthet az AI-kutatóknak a modellek fejlesztésében.

A MIT kutatói által bemutatott neurális lazító változók nullára csökkentik a neurális hálózatok tanítása során fellépő hibákat, különösen a komplex formai korlátok, mint a monotonitás és konvexitás érvényesítésekor.
A Temporal Backtracking Search (TBS) új keresési stratégiával alakítja át a videógenerálást, lehetővé téve a hibás indulások újrakezdését és a számítási kapacitás hatékonyabb elosztását.

A TwinBI keretrendszer 43,3%-ról 63,3%-ra növeli a pontos találati arányt a BI-irányítópultokkal végzett elemzések során, miközben a hibás válaszok aránya 40%-ról 10%-ra csökken.

A nagy nyelvi modellek képességét vizsgálták keresztény jogi öröklési esetek megoldására. A kereskedelmi modellek, különösen a Gemini 2.5 Flash, megbízhatóbban teljesítenek, mint a nyílt forráskódú társaik.

A FedSPC nevű, moduláris korrekciós módszerrel a kutatók úgy vélik, javítható a személyre szabott federált tanulás (PFL) pontossága, különösen az adatheterogenitás esetén. A CIFAR-100 és Tiny-ImageNet adathalmazokon végzett kísérletek ezt alátámasztják.

Az AI képes radikálisan felgyorsítani az akkumulátorfejlesztést, ami a zöld átállás elsődleges feltétele — véli Andreas Hoepner, az EU Fenntartható Finanszírozási Platformának munkatársa.

A Microsoft új, gyengén felügyelt AI-keretrendszere, az OWL, akár hétszer gyorsabban és háromszor olcsóbban képes állatokat felismerni légi felvételeken, mint a hagyományos módszerek.

Egy új Transformer-alapú AI-modell 15-30%-kal csökkenti a robotok munkájának ütemezési idejét, miközben nagyméretű, 100x100-as feladatokra is képes általánosítani.

A hyperdimenziós számítás (HDC) új keretrendszert kínál a táblázatos adatok lekérdezésére, amely interpretálhatóbb eredményeket ad, mint a korábbi módszerek.

Több mint 160 vállalat adott be WARN-értesítést 2025 márciusa óta, Arvind Narayanan és Sayash Kapoor szerint az AI nem váltja fel a szoftverfejlesztőket, mivel a munka nagy része megbeszélésekben és hibakeresésben zajlik.
Tetszik az oldal? Támogasd a fejlesztést
Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.