ÉlőUtoljára: 1 órájaMa: 1
Kutatásfrissítve: 14:30

Új hibrid architektúra javítja a Nemotron 3 teljesítményét

A Nemotron 3 Super modell gyártásba került, és hibrid architektúrájának köszönhetően hatékonyabban dolgozza fel a hosszú szövegeket. Sebastian Raschka összegyűjtötte a 2026 első felében megjelent legérdekesebb nagy nyelvi modell kutatási eredményeit.

Új hibrid architektúra javítja a Nemotron 3 teljesítményét
Fotó: Brett Wharton / Unsplash
forrás: Ahead of AI·AI Forradalom szerk.·
Megosztás

Sebastian Raschka, a területen elismert kutató, válogatást készített a 2026. január és május között megjelent, általa legérdekesebbnek tartott nagy nyelvi modell (LLM) kutatási eredményekből. A lista nem teljes, hiszen naponta rengeteg publikáció jelenik meg, de a szerző saját munkájához releváns cikkeket gyűjtötte össze.

A lista a szerző személyes érdeklődése és munkája alapján készült, így kiemelten foglalkozik érvelő modellekkel, megerősítéses tanulással és hatékony következtetéssel. Ehhez képest a 2025-ös listákhoz viszonyítva több anyagot gyűjtött az ügynökrendszerek, eszköztárhasználat, hosszú kontextusok, diffúziós nyelvi modellek és a gyakorlati kiszolgáló infrastruktúra témakörében is.

Kapcsolódó: LLM-kutatás

Új architektúrák és modellek

A 2026-os év eddigi trendje, hogy az architektúrafejlesztés túlmutat a transzformerek egyszerű méretbővítésén. Jelentős munka folyik hibrid architektúrák (például Nemotron 3 és Arcee Trinity), állapot-tér alapú rétegek (Nemotron 3 és Mamba-3), MoE kapacitásallokáció, aktivációs viselkedés és reprezentációs geometria terén. A Nemotron 3 Super kiemelkedik részletességével és már gyártásban lévő technológiájával, méretosztályában az egyik legjobb modellnek számít.

Kapcsolódó: LLM-kutatás folytatása

A Nemotron 3 hibrid kialakítása, amely váltakozva használja a hagyományos figyelmi rétegeket és a Mamba-2 állapot-tér modell rétegeit, különösen hatékony a hosszú kontextusok kezelésében. Ez kulcsfontosságú az ügynökrendszerek (mint az OpenClaw) számára, amelyek egyre hosszabb szövegekkel dolgoznak. Bár a 120 milliárd paraméteres 120B-A12B verzió túl nagy lehet a hétköznapi hardverekhez, létezik egy kisebb, 4 milliárd paraméteres Nemotron 3 Nano változat is. A Nemotron 3 Ultra (550B-A55B) nemrégiben jelent meg, amely az alapvető építőelemeket megtartva skálázza az embedding és projekciós dimenziókat.

Kapcsolódó: LLM-kritikák hatása

Kutatási eredmények és publikációk

A lista több mint 20 kutatást sorol fel, köztük olyanokat, mint a Deep Delta Learning, MiMo-V2-Flash Technical Report, Ministral 3, skálázás Embeddings Outperforms skálázás Experts in Language Models, LatentLens, ERNIE 5.0 Technical Report, ViT-5, Step 3.5 Flash, Nanbeige4.1-3B, Symmetry in Language Statistics Shapes the Geometry of Model Representations, GLM-5, Arcee Trinity Large Technical Report, The Spike, the Sparse and the Sink, Tiny Aya, Attention Residuals, Mamba-3: Improved Sequence Modeling Using State Space Principles, Attention to Mamba, és a Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning. A lista május 6-án a ZAYA1-8B Techn publikációval zárul.

Kapcsolódó: OpenAI modellfejlesztés

A hibrid architektúrák trendje, amely figyelmi és alternatív rétegeket kombinál, népszerűnek bizonyul. A Qwen3.6 például Gated DeltaNet rétegeket használ a nem-figyelmi részekhez. Érdekes lesz látni az újabb Mamba-3 és Gated DeltaNet-2 verziókat a jövőbeli nyílt modellekben, mint a Nemotron-4 és Qwen4.

Kapcsolódó: LLM-katonai alkalmazás

Forrás

Feldolgozott sajtóforrás·Ahead of AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom