Count Anything pontosabb objektumszámlálást ér el, mint a versenytársak
Az új Count Anything modell átlagosan csak kilenc hibát követ el egy képben, miközben a legközelebbi versenytárs több mint tizennyolc hibát tesz — a Tsinghua kutatók a 220 000 képes CLOC adathalmazon alapozzák.

220 000 képen tanították a Count Anything modellt, amely 619 kategóriát és 15 millió címkézett objektumot fed le — írja a The Decoder.
Mire épül a modell
A rendszer a Meta SAM3 előre betanított modelljére épül, és két számláló‑modult kombinál: nagy objektumokhoz keretrajzot, kis, sűrű célokhoz pontot helyez.
Kapcsolódó: Mistral AI
Átfogó képességek
Szöveges promptokkal a modell képes számolni fejhallgatókat, autókat vagy sejteket, anélkül, hogy külön rendszert kellene fejleszteni.
Kapcsolódó: Z.AI GLM-5.1
A saját teljesítményteszt tesztekben a Count Anything átlagosan kilenc hibát követ el egy kategóriában, míg a legjobb versenytárs több mint kétszer annyit téved.
Kapcsolódó: DeepSeek V4
Versenytársakhoz viszonyítva
A kutatók elismerik, hogy a modell nehézségekbe ütközik a homályos kifejezésekkel és a rendkívül sűrű jelenetekkel.
Kapcsolódó: GPT-5.5 modell
A Count Anything kódja a GitHubon érhető el, a kutatók szerint a kilenc hibás számolás a jelenlegi csúcs, a Tsinghua kutatók a CLOC adathalmazon alapozzák.
Kapcsolódó: Microsoft AI modellek