
Új memória-rendszerrel javítanák a nagy nyelvi modellek feladatmegoldó képességét
Az AdMem keretrendszer a szemantikus, epizodikus és procedurális memóriát ötvözi, javítva a nagy nyelvi modellek teljesítményét hosszú távú feladatokban.
AI research papers, arXiv publikációk, benchmarkok, tudományos áttörések

Az AdMem keretrendszer a szemantikus, epizodikus és procedurális memóriát ötvözi, javítva a nagy nyelvi modellek teljesítményét hosszú távú feladatokban.

A Cognition FrontierCode-ja 13 százalékos eredményt hozott az Opus 4.8-nak. A teszt a kód beilleszthetőségét méri, és a legfejlettebb modellek is csak alacsony eredményt értek el.

Az emberi bírálók 64,8%-os pontossággal tudják kiszűrni a hamis jogi fotókat, a legfejlettebb AI-modellek pedig átlagosan csak 5,9%-ban azonosítják a legnehezebb szintetikus képeket.

A mllm-shap keretrendszer 10-szeresére, akár 50-szeresére csökkenti a multimodális AI-modellek magyarázatához szükséges számítási teret. A szoftver interaktív felületet kínál a szöveg és hang együtt dolgozó modellek döntéseinek megértéséhez.

A korrupcióellenes szervezet mesterséges intelligenciát használ a feltételezett korrupciós ügyek felderítésére. A vizsgálat célja a miniszterelnöki ciklusok alatt felmerült pénzügyi visszaélések feltárása.

A Kings College London, a Fudan University és a The Alan Turing Institute kutatói egy új teljesítménytesztet hoztak létre, amely 72 szimulált társadalmi környezetben vizsgálja az AI-rendszerek 'reward hacking' képességét.

Az Amazon kutatói kidolgoztak egy új AI-rendszert, amely csökkenti a modell szándéka és a végrehajtás közötti rést. Ez a technológia lehetővé teszi a fejlettebb kódszerkesztési feladatok hatékonyabb elvégzését.

A nyílt forráskódú AI-képgenerátorok minősége jelentősen megközelítette a zárt modellekét. A nyílt modellek képességei már olyan szinten vannak, amely ellentmond a jelenlegi általános vélekedésnek.

2028 márciusára az AI rendszerek végezhetik a kutatások jelentős részét, segítve a tudományos haladást. Az AI-k párhuzamosan dolgoznak az emberi kutatókkal.

Az OpenAI Economic Research Exchange nevű programjára július 5-ig lehet pályázni. A kiválasztott kutatók projektalapú együttműködésben vizsgálhatják az AI hatásait a munkavállalókra, cégekre és a gazdaságra.

A Claude AI hamarosan felülmúlhatja az Anthropic filozófusát, és átveheti a munkáját. A modell a filozófiai és igazítási munkában is jobb lesz.

2025 februárjában az ECMWF bevezette gépi tanuláson alapuló modelljét, amely felgyorsítja az időjárás-előrejelzést. A modell az időjárás-előrejelzési folyamatot jelentősen lerövidíti.

A 25. AAMAS 2026 konferencián május 25-29. között adták át a díjat. A kutatás az ember-LLM ügynökcsapatok irányelveit vizsgálta.

Az AI-cégek, köztük a Meta és az xAI, újságírókat alkalmaznak a mesterséges intelligencia modellek fejlesztésére. A cél a természetes és érthető szöveg generálása.

Az AEGIS nevű új módszer 10,1%-kal több feladatot végez el sikeresen a robotoknál, mint a korábbi eljárások. A rendszer a hibák láthatóvá válása előtt kapcsol át egy erősebb vezérlőre.

A nyelvi modellek érvelési hibái kétféle folyamaton keresztül keletkeznek, amelyeket token-szintű bizonytalanság jelez. Az új keretrendszer 23 tesztelt konfigurációból 20 esetben pontosan előre jelezte a hibákat.

A moduláris adaptáció javítja a nyelvi modellek teljesítményét ritka nyelveken, mint az ír, a skót gael és a kecsua. Az új módszer kevesebb számítási kapacitást igényel, mint a teljes átfinomítás.

Az új MacArena teljesítményteszt 421 feladattal teszteli az Apple Siliconon futó AI-ügynököket, feltárva a macOS-specifikus kihívásokat. A modellek teljesítménye jelentősen eltérhet a natív és a portolt feladatok között.

Az EEG-alapú mesterséges intelligenciák pontossága félrevezető lehet, mivel gyakran az alanyok egyedi jellemzőit azonosítják a valós biológiai markerek helyett. A FMScope protokoll képes diagnosztizálni ezt a 'identitáscsapdát' még a finomhangolás előtt.

Az IDPR keretrendszer a válaszok pontosságát 47,90%-ról 48,92%-ra növeli, miközben a lassú érvelést csak az esetek 8,20%-ában hívja elő. Ezzel jelentősen csökkenti a számítási költségeket.

A nyelvi modellek viselkedése 10%-os pontossággal irányítható. A fogalmak szögletes szerkezetben reprezentálódnak a modellekben.
Tetszik az oldal? Támogasd a fejlesztést
Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.