Több mint 5000 versenyző javította az AI-érvelést az NVIDIA Kaggle-versenyén
Az NVIDIA Nemotron Model Reasoning Challenge több mint 5000 aktív résztvevőt és 4000 csapatot vonzott a Kaggle-re, ahol a legjobb megoldások az érvelést teljes mérnöki munkafolyamatként kezelték, tömörítették az érvelési lépéseket és célzott megoldókat építettek.

Az NVIDIA Nemotron Model Reasoning Challenge több mint 5000 aktív résztvevőt és 4000 csapatot vonzott a Kaggle platformjára, hogy az AI-érvelés pontosságát javítsák. A verseny a nyílt modellek, az egységes infrastruktúra és a szigorú értékelési keretek között zajlott, különös hangsúlyt fektetve a verifikálható lánc-követés (chain-of-thought) adatokra, a tömörített érvelési nyomokra és a hatékony munkafolyamatokra. A résztvevők több ezer szubmissziót és több mint 1000 vitaposztot generáltak, megosztva egymással a fejlesztési technikákat és a felmerült problémákat.
A legeredményesebb megoldások az érvelést teljes mérnöki munkafolyamatként kezelték. Ellenőrizték a betanításhoz használt nyomok minőségét, tömörítették a hosszú érvelési lépéseket a token-budgetbe, célzott megoldókat építettek a legnehezebb feladatokhoz, és gondosan hangolták a betanítási beállításokat. A közösségi megbeszélések kulcsfontosságú szerepet játszottak az új technikák megosztásában és a hibák elemzésében. A verseny korlátai – mint az internet-hozzáférés hiánya értékeléskor, az inferencia kód módosításának tilalma és a LoRA adapterekre (rank 32 vagy alacsonyabb) vonatkozó korlátozások – arra ösztönözték a résztvevőket, hogy az infrastruktúra helyett az érvelési munkafolyamatokra fókuszáljanak. A Google Cloud G4 VM-eken és NVIDIA RTX PRO 6000 Blackwell GPU-kon futó feladatok valós gyártási környezetet szimuláltak.
Kapcsolódó: AI ügynökök képességei
Verifikálható lánc-követés, nem csak adatok
Számos csapat szintetikus lánc-követés adatokkal tanította a modellt, amelyek bemutatják az egyes lépéseket a válasz eléréséig. A legerősebb megközelítések olyan munkafolyamatokat építettek, amelyek ellenőrizték ezen nyomok helyességét, és javították azokat, ha hibát találtak. A kutatók szerint a nyomokat úgy kell kezelni, mint a kódot vagy a matematikai bizonyításokat: minden lépést ellenőrizni kell, hogy megbízható utat tanítsanak a problémától a megoldásig. A csapatok auditálták a köztes lépéseket, nem csak a végső válaszokat, és megoldókat, szabályellenőrzőket vagy emberi felülvizsgálatot használtak a nyomok reprodukálhatóságának biztosítására. Az első helyezett csapat szintetikus problémákat generált, megoldó által generált nyomokat csatolt, és ezeken tanította a modellt. Shehab Anwer ATLAS-diszkussziója is megerősítette, hogy a hitelesített nyomok fontosabbak, mint a szűretlen skála.
Kapcsolódó: klinikai beszédfelismerés tesztelése
Tervezés a token-budget figyelembevételével
Több erős megoldás a token-budgetet a problémamegoldás részének tekintette, nem csupán futásidejű korlátnak. A hosszú nyomok tartalmazhatták a helyes logikát, de megbukhattak, ha a modell kifutott a helyből. A legjobb megközelítések a nyomokat rövidebbé tették anélkül, hogy elhomályosították volna azokat. Ez segít a modellnek a kontextust a nehéz lépésekre fordítani, nem pedig az ismétlődő sablonokra. A csapatok, mint a Tong Hui Kang által kidolgozott Open Progress Prize, megmutatták, mennyire számít a reprezentáció. Az ő bit-manipulációs stratégiája elkerülte a pazarló brute-force érvelést, miközben hasznos struktúrát tartott a modell teljesítési költségvetésében. Az első, második és harmadik helyezett csapatok ezt az ötletet továbbvitték.
Kapcsolódó: Anchor rendszer bemutatása
Szétválasztani a megjegyzendő tudást a megoldandó feladattól
A legerősebb érvelési munkafolyamatok szétválasztották a stabil tudást az élő érveléstől, ahelyett, hogy a modelltől mindent a nulláról kellett volna megoldani. Az újrahasznosítható minták, keresőtáblák és kompakt szignatúrák tárolhatók vagy lekérdezhetők voltak, míg a modell az érvelési költségvetését a problémáról problémára változó részre fordította. A cél nem a volt, hogy a modell válaszokat memorizáljon, hanem hogy elkerülje az érvelési lépések pazarlását olyan struktúrákon, amelyeket már ismer.
Kapcsolódó: AI-ügynökök amnéziája
Eszközök a minőségi adatok generálásához és auditálásához
A verseny rávilágított arra, hogy az eszközök használata a kiváló minőségű betanítási adatok generálásához és auditálásához hatékonyabbnak bizonyult, mint pusztán a végső válaszok javítására koncentrálni. A feladat típusától függő teljesítménymérés és a valós hibamódusok elleni validálás kulcsfontosságú. A közösségi megbeszélések segítettek feltárni a szélső eseteket és az újrahasznosítható technikákat, amelyek optimalizálhatják az érvelési munkafolyamatokat. A Nemotron-3-Nano-30B modell és a LoRA adapterek használata a Google Cloud G4 VM-eken és NVIDIA RTX PRO 6000 Blackwell GPU-kon realisztikus kereteket biztosított a kutatóknak.
Kapcsolódó: MI modellek gondolkodása
A verseny tanulságai, beleértve a verifikálható lánc-követést és a token-budget hatékony kihasználását, segítenek az AI-érvelés javításában, amit a Nemotron-3-Nano-30B modell képvisel.