Olcsóbb és gyorsabb kódgeneráló motort adott ki a Together AI
A Together AI új motorja 31%-kal több kódot generál másodpercenként, kétszer jobb válaszidőt kínál és 76%-kal olcsóbb, mint a Claude Opus 4.6.

A Together AI új, teljes stackben optimalizált motorja, az Inference Engine, 31%-kal több kódot generál másodpercenként, mint a leggyorsabb nyílt forráskódú alternatíva, miközben kétszer jobb válaszidőt (TTFT) tart telítettség mellett. A fejlesztők saját adataikkal képezhetnek modelleket, költségük körülbelül egyharmada a korábbi Enterprise-csomagnak.
A motor új ThunderMLA kernelt használ, amely egyetlen lépésben futtatja a számításokat, kiküszöbölve a korábbi dupla kernelindításból eredő többletterhelést. A cég szerint ez 20-35%-kal gyorsabbá teszi a feldolgozást, miközben a teljes stack optimalizálása, beleértve a meghajtó viselkedését és a memóriaelrendezést, minden korlátot eltávolított. A kódolási ügynökök munkafolyamatait szimuláló tesztben az utasítások hossza 45 000-től 200 000 tokenig terjedt, átlagosan 450 tokenes generálási hosszal.
Kapcsolódó: LLM-ek pontosságának javítása
A válaszidő (TTFT) fontossága
A fejlesztők számára a válaszidő (TTFT) kritikus, ez dönti el, hogy egy eszköz gyorsnak vagy lassúnak érződik. A Together Inference Engine 4 darab NVIDIA B200 GPU-n futtatva 0,71 másodperces TTFT-t produkált 2,5 millió token/perc terhelés mellett, míg a TensorRT-LLM 1,1 másodpercet, a SGLang pedig 5,1 másodpercet. A rendszer így olyan terhelés mellett is használható marad, ahol más motorok már nem.
Kapcsolódó: NVIDIA FP8 kvantálás
Költséghatékonyság és minőség
A Together AI közölte, hogy a Kimi K2.6 modelljük 76%-kal alacsonyabb költséggel, hasonló minőséget produkál, mint a Claude Opus 4.6, miközben a teljesítményteszt eredmények nem függetlenek.
Kapcsolódó: Automatizált LLM-stratégia