
Folyamatosan figyel az új, nyílt forráskódú AI-modell, 0,4 másodpercenként dönt a megszólalásról
A Gemini 3 Flash-t is legyőzte zajészlelési teszteken az Audio Interaction modell. A modell 302 000 órányi adathalmazon tanult.
GPT, Claude, Gemini és más generatív AI modellek, agents, multimodális rendszerek

A Gemini 3 Flash-t is legyőzte zajészlelési teszteken az Audio Interaction modell. A modell 302 000 órányi adathalmazon tanult.

Az NVIDIA új, 600 millió paraméteres ASR-modelljével egyetlen ellenőrzőpontból 40 nyelvet lehet valós időben átírni. A modell a Hugging Face-en érhető el, nyílt súlyokkal és OpenMDW-1.1 licenc alatt.

Az Anthropic AI-szolgáltatásai rendkívül drágák, ezért a fejlesztők olcsóbb alternatívákat keresnek. A Microsoft AI vezérigazgatója, Mustafa Suleyman hangsúlyozta, hogy a fejlesztők számára kiemelten fontos a költséghatékonyság.

A Ladybird böngésző nem fogad többé nyilvános kódbeküldéseket, mert az AI-fejlődés miatt a korábbi feltételezések már nem érvényesek a felelősségvállalásra.

Az NVIDIA Nemotron 3 Ultra 550B modell 550 milliárd paramétert és 1 millió token kontextushosszt kínál, LatentMoE architektúrával.

A Perplexity új hibrid inference rendszere automatikusan dönti el, mely feladatokat futtatja a felhasználó gépén, és melyeket küld erősebb felhőalapú modelleknek.

Az xAI új Grok Imagine Video 1.5 modellje képekből képes rövid videókat generálni akár 720p felbontásban, szöveges utasításokkal vezérelve a mozgást és a hangulatot.

A Microsoft hét saját fejlesztésű AI-modellt dobott piacra, hogy csökkentse függőségét az OpenAI-hoz és az Anthropic-hoz hasonló partnerektől.

A Microsoft Aion 1.0 Plan egy 14 milliárd paraméteres, 32K kontextusú modell, amely helyben fut a Windows 11-en, és csökkenti a cég függőségét az OpenAI-tól.

A Google új, 12 milliárd paraméteres Gemma 4 12B modellje 16GB RAM-mal futtatható, ami a legtöbb átlagos laptopon lehetővé teszi a futtatást.

A Direct Preference Optimization (DPO) módszerét alkalmazva a DharmaOCR modellje 59%-kal csökkentette a szöveggenerálás során fellépő ismétlődési hibákat, a korábbi SFT-modellekhez képest.

Az Anthropic május 28-án kiadott Claude Opus 4.8 modellje 4x kevesebb hibával ír kódot, 2.5x gyorsabb és 3x olcsóbb lett, miközben megbízhatósága is nőtt.

A Fast-dLLM++ Fréchet profil dekódolással gyorsítja a Diffusion LLM-ek válaszidejét, akár 37%-kal növelve a sebességet a LLaDA-8B modellen.

A Perplexity AI új hibrid rendszere valós időben osztja szét az AI-feladatokat a felhasználó gépe és a felhő között. A rendszer célja a mesterséges intelligenciával kapcsolatos feladatok számítási költségeinek csökkentése.

Az ART nevű új technika 20%-kal növeli a nagy nyelvi modellek generálási sebességét, miközben csökkenti a memóriaforgalmat.

A francia Mistral AI nem a tudás mennyiségét, hanem a hatékonyságot helyezi előtérbe, arra számítva, hogy a cégeknek nem lesz szükségük a legokosabb, legdrágább AI-modellekre.

Az új CSRP módszer 50.99 $F_{0.5}$-os eredménnyel új csúcsot állít fel a kínai nyelvtani hibajavításban, miközben 5.20 ponttal múlja felül a GPT-4-et a helyesírásban.

Az önvezető AI-mérnökök képesek végigvinni a teljes adatmérnöki folyamatot, így a GPT-5.2 által generált adatok 57,29%-kal javítják a célmodell teljesítményét.

Az Anthropic új Claude Opus 4.8 modellje képes beismerni, ha nem tud valamit, ami fontos lépés az AI átláthatósága felé.

Az amerikai piacok szárnyalása mögött álló AI-befektetések túlzott lelkesedését kérdőjelezi meg Gita Gopinath, a Harvard közgazdász professzora.

A SalsaAgent nevű új modell képes emberi táncosokkal interakcióba lépni és zenére koreografált salsa mozdulatokat generálni. Az új multimodális modell a szociálisan érett robotok és interaktív virtuális ügynökök fejlesztését célozza.
Tetszik az oldal? Támogasd a fejlesztést
Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.