ÉlőUtoljára: 3 órájaMa: 2
Modellek & LLMfrissítve: 08:15

Olcsóbb és gyorsabb kódgeneráló motort adott ki a Together AI

A Together AI új motorja 31%-kal több kódot generál másodpercenként, kétszer jobb válaszidőt kínál és 76%-kal olcsóbb, mint a Claude Opus 4.6.

Olcsóbb és gyorsabb kódgeneráló motort adott ki a Together AI
Fotó: Pankaj Patel / Unsplash
forrás: Hetzner: Together AI·AI Forradalom szerk.·
Megosztás

A Together AI új, teljes stackben optimalizált motorja, az Inference Engine, 31%-kal több kódot generál másodpercenként, mint a leggyorsabb nyílt forráskódú alternatíva, miközben kétszer jobb válaszidőt (TTFT) tart telítettség mellett. A fejlesztők saját adataikkal képezhetnek modelleket, költségük körülbelül egyharmada a korábbi Enterprise-csomagnak.

A motor új ThunderMLA kernelt használ, amely egyetlen lépésben futtatja a számításokat, kiküszöbölve a korábbi dupla kernelindításból eredő többletterhelést. A cég szerint ez 20-35%-kal gyorsabbá teszi a feldolgozást, miközben a teljes stack optimalizálása, beleértve a meghajtó viselkedését és a memóriaelrendezést, minden korlátot eltávolított. A kódolási ügynökök munkafolyamatait szimuláló tesztben az utasítások hossza 45 000-től 200 000 tokenig terjedt, átlagosan 450 tokenes generálási hosszal.

Kapcsolódó: LLM-ek pontosságának javítása

A válaszidő (TTFT) fontossága

A fejlesztők számára a válaszidő (TTFT) kritikus, ez dönti el, hogy egy eszköz gyorsnak vagy lassúnak érződik. A Together Inference Engine 4 darab NVIDIA B200 GPU-n futtatva 0,71 másodperces TTFT-t produkált 2,5 millió token/perc terhelés mellett, míg a TensorRT-LLM 1,1 másodpercet, a SGLang pedig 5,1 másodpercet. A rendszer így olyan terhelés mellett is használható marad, ahol más motorok már nem.

Kapcsolódó: NVIDIA FP8 kvantálás

Költséghatékonyság és minőség

A Together AI közölte, hogy a Kimi K2.6 modelljük 76%-kal alacsonyabb költséggel, hasonló minőséget produkál, mint a Claude Opus 4.6, miközben a teljesítményteszt eredmények nem függetlenek.

Kapcsolódó: Automatizált LLM-stratégia

Forrás

Feldolgozott sajtóforrás·Hetzner: Together AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom