Bemutatta a Google a DiffusionGemma modellt, amely négyszer gyorsabban generál szöveget
A Google DiffusionGemma nevű új nyílt kísérleti modell akár 4-szer gyorsabban generál szöveget, mint a hagyományos autoregresszív LLM-ek, miközben csak 3,8 milliárd paramétert aktivál futtatáskor.

A Google bemutatta a DiffusionGemma nevű, nyílt forráskódú kísérleti modellt, amely a szövegdiffúzió új megközelítésével rendkívüli sebességet kínál a szöveggenerálásban. A 26 milliárd paraméteres Mixture of Experts (MoE) modell nem egymás utáni tokeneket dolgoz fel, hanem egész szövegrészeket képes párhuzamosan generálni, akár négyszer gyorsabban, mint a hagyományos autoregresszív LLM-ek — közölte a Google AI Blog.
A DiffusionGemma a Gemma 4 család intelligenciájára és a Gemini Diffusion kutatásaira épít, egy új diffúziós fejet integrálva a sebesség maximalizálása érdekében. A modell kifejezetten a sebességkritikus, interaktív helyi munkafolyamatokhoz készült, mint például a szövegszerkesztés vagy a gyors iterációk — írja a Google AI Blog.
Kapcsolódó: Nemotron-Labs modell
Gyorsabb futtatás és kisebb hardverigény
A modell a dekódolási szűk keresztmetszetet a memóriab sávszélességről a számítási kapacitásra helyezi át, így akár 1000+ tokent képes generálni másodpercenként egy NVIDIA H100-ason, illetve 700+ tokent egy NVIDIA GeForce RTX 5090-en. A 26 milliárd paraméteres MoE modell futtatáskor csak 3,8 milliárd paramétert aktivál, így alkalmas a csúcskategóriás, 18 GB VRAM-mal rendelkező fogyasztói GPU-kra is, ha kvantálva futtatják.
Kapcsolódó: Diffusion LLM-ek fejlesztése
Kétirányú figyelem és intelligens önkorrekció
A DiffusionGemma minden tokenre kiterjedő figyelmet tesz lehetővé, ami előnyös a nemlineáris területeken, mint a kódszerkesztés vagy a matematikai grafikonok generálása. A modell képes iteratív módon finomítani saját kimenetét, egész szövegtömböket értékelve ki valós időben, ami például a Sudoku megoldásában is segíthet, ahol az egyes tokenek a jövőbeli tokenektől függenek.
Kapcsolódó: Dynin-Omni multimodális teszt
A modell súlyai már elérhetők a Hugging Face-en Apache 2.0 licenc alatt. A Google egy fejlesztői útmutatót is kiadott a modell megértéséhez és integrálásához, és támogatást nyújt olyan eszközökkel, mint a MLX, a vLLM és a Hugging Face Transformers. A DiffusionGemma modell 2026-ban vált elérhetővé a fejlesztők számára.
Kapcsolódó: Photoroom képgenerálás