ÉlőUtoljára: 26 perceMa: 26
Modellek & LLMfrissítve: 19:10

Bemutatta a Google a DiffusionGemma modellt, amely négyszer gyorsabban generál szöveget

A Google DiffusionGemma nevű új nyílt kísérleti modell akár 4-szer gyorsabban generál szöveget, mint a hagyományos autoregresszív LLM-ek, miközben csak 3,8 milliárd paramétert aktivál futtatáskor.

Bemutatta a Google a DiffusionGemma modellt, amely négyszer gyorsabban generál szöveget
Fotó: Mitchell Luo / Unsplash
forrás: Google DeepMind·AI Forradalom szerk.·
Megosztás

A Google bemutatta a DiffusionGemma nevű, nyílt forráskódú kísérleti modellt, amely a szövegdiffúzió új megközelítésével rendkívüli sebességet kínál a szöveggenerálásban. A 26 milliárd paraméteres Mixture of Experts (MoE) modell nem egymás utáni tokeneket dolgoz fel, hanem egész szövegrészeket képes párhuzamosan generálni, akár négyszer gyorsabban, mint a hagyományos autoregresszív LLM-ek — közölte a Google AI Blog.

A DiffusionGemma a Gemma 4 család intelligenciájára és a Gemini Diffusion kutatásaira épít, egy új diffúziós fejet integrálva a sebesség maximalizálása érdekében. A modell kifejezetten a sebességkritikus, interaktív helyi munkafolyamatokhoz készült, mint például a szövegszerkesztés vagy a gyors iterációk — írja a Google AI Blog.

Kapcsolódó: Nemotron-Labs modell

Gyorsabb futtatás és kisebb hardverigény

A modell a dekódolási szűk keresztmetszetet a memóriab sávszélességről a számítási kapacitásra helyezi át, így akár 1000+ tokent képes generálni másodpercenként egy NVIDIA H100-ason, illetve 700+ tokent egy NVIDIA GeForce RTX 5090-en. A 26 milliárd paraméteres MoE modell futtatáskor csak 3,8 milliárd paramétert aktivál, így alkalmas a csúcskategóriás, 18 GB VRAM-mal rendelkező fogyasztói GPU-kra is, ha kvantálva futtatják.

Kapcsolódó: Diffusion LLM-ek fejlesztése

Kétirányú figyelem és intelligens önkorrekció

A DiffusionGemma minden tokenre kiterjedő figyelmet tesz lehetővé, ami előnyös a nemlineáris területeken, mint a kódszerkesztés vagy a matematikai grafikonok generálása. A modell képes iteratív módon finomítani saját kimenetét, egész szövegtömböket értékelve ki valós időben, ami például a Sudoku megoldásában is segíthet, ahol az egyes tokenek a jövőbeli tokenektől függenek.

Kapcsolódó: Dynin-Omni multimodális teszt

A modell súlyai már elérhetők a Hugging Face-en Apache 2.0 licenc alatt. A Google egy fejlesztői útmutatót is kiadott a modell megértéséhez és integrálásához, és támogatást nyújt olyan eszközökkel, mint a MLX, a vLLM és a Hugging Face Transformers. A DiffusionGemma modell 2026-ban vált elérhetővé a fejlesztők számára.

Kapcsolódó: Photoroom képgenerálás

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom