ÉlőUtoljára: 2 órájaMa: 5
Kutatásfrissítve: 01:20

Több mint 5000 versenyző javította az AI-érvelést az NVIDIA Kaggle-versenyén

Az NVIDIA Nemotron Model Reasoning Challenge több mint 5000 aktív résztvevőt és 4000 csapatot vonzott a Kaggle-re, ahol a legjobb megoldások az érvelést teljes mérnöki munkafolyamatként kezelték, tömörítették az érvelési lépéseket és célzott megoldókat építettek.

Több mint 5000 versenyző javította az AI-érvelést az NVIDIA Kaggle-versenyén
Fotó: Đào Hiếu / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA Nemotron Model Reasoning Challenge több mint 5000 aktív résztvevőt és 4000 csapatot vonzott a Kaggle platformjára, hogy az AI-érvelés pontosságát javítsák. A verseny a nyílt modellek, az egységes infrastruktúra és a szigorú értékelési keretek között zajlott, különös hangsúlyt fektetve a verifikálható lánc-követés (chain-of-thought) adatokra, a tömörített érvelési nyomokra és a hatékony munkafolyamatokra. A résztvevők több ezer szubmissziót és több mint 1000 vitaposztot generáltak, megosztva egymással a fejlesztési technikákat és a felmerült problémákat.

A legeredményesebb megoldások az érvelést teljes mérnöki munkafolyamatként kezelték. Ellenőrizték a betanításhoz használt nyomok minőségét, tömörítették a hosszú érvelési lépéseket a token-budgetbe, célzott megoldókat építettek a legnehezebb feladatokhoz, és gondosan hangolták a betanítási beállításokat. A közösségi megbeszélések kulcsfontosságú szerepet játszottak az új technikák megosztásában és a hibák elemzésében. A verseny korlátai – mint az internet-hozzáférés hiánya értékeléskor, az inferencia kód módosításának tilalma és a LoRA adapterekre (rank 32 vagy alacsonyabb) vonatkozó korlátozások – arra ösztönözték a résztvevőket, hogy az infrastruktúra helyett az érvelési munkafolyamatokra fókuszáljanak. A Google Cloud G4 VM-eken és NVIDIA RTX PRO 6000 Blackwell GPU-kon futó feladatok valós gyártási környezetet szimuláltak.

Kapcsolódó: AI ügynökök képességei

Verifikálható lánc-követés, nem csak adatok

Számos csapat szintetikus lánc-követés adatokkal tanította a modellt, amelyek bemutatják az egyes lépéseket a válasz eléréséig. A legerősebb megközelítések olyan munkafolyamatokat építettek, amelyek ellenőrizték ezen nyomok helyességét, és javították azokat, ha hibát találtak. A kutatók szerint a nyomokat úgy kell kezelni, mint a kódot vagy a matematikai bizonyításokat: minden lépést ellenőrizni kell, hogy megbízható utat tanítsanak a problémától a megoldásig. A csapatok auditálták a köztes lépéseket, nem csak a végső válaszokat, és megoldókat, szabályellenőrzőket vagy emberi felülvizsgálatot használtak a nyomok reprodukálhatóságának biztosítására. Az első helyezett csapat szintetikus problémákat generált, megoldó által generált nyomokat csatolt, és ezeken tanította a modellt. Shehab Anwer ATLAS-diszkussziója is megerősítette, hogy a hitelesített nyomok fontosabbak, mint a szűretlen skála.

Kapcsolódó: klinikai beszédfelismerés tesztelése

Tervezés a token-budget figyelembevételével

Több erős megoldás a token-budgetet a problémamegoldás részének tekintette, nem csupán futásidejű korlátnak. A hosszú nyomok tartalmazhatták a helyes logikát, de megbukhattak, ha a modell kifutott a helyből. A legjobb megközelítések a nyomokat rövidebbé tették anélkül, hogy elhomályosították volna azokat. Ez segít a modellnek a kontextust a nehéz lépésekre fordítani, nem pedig az ismétlődő sablonokra. A csapatok, mint a Tong Hui Kang által kidolgozott Open Progress Prize, megmutatták, mennyire számít a reprezentáció. Az ő bit-manipulációs stratégiája elkerülte a pazarló brute-force érvelést, miközben hasznos struktúrát tartott a modell teljesítési költségvetésében. Az első, második és harmadik helyezett csapatok ezt az ötletet továbbvitték.

Kapcsolódó: Anchor rendszer bemutatása

Szétválasztani a megjegyzendő tudást a megoldandó feladattól

A legerősebb érvelési munkafolyamatok szétválasztották a stabil tudást az élő érveléstől, ahelyett, hogy a modelltől mindent a nulláról kellett volna megoldani. Az újrahasznosítható minták, keresőtáblák és kompakt szignatúrák tárolhatók vagy lekérdezhetők voltak, míg a modell az érvelési költségvetését a problémáról problémára változó részre fordította. A cél nem a volt, hogy a modell válaszokat memorizáljon, hanem hogy elkerülje az érvelési lépések pazarlását olyan struktúrákon, amelyeket már ismer.

Kapcsolódó: AI-ügynökök amnéziája

Eszközök a minőségi adatok generálásához és auditálásához

A verseny rávilágított arra, hogy az eszközök használata a kiváló minőségű betanítási adatok generálásához és auditálásához hatékonyabbnak bizonyult, mint pusztán a végső válaszok javítására koncentrálni. A feladat típusától függő teljesítménymérés és a valós hibamódusok elleni validálás kulcsfontosságú. A közösségi megbeszélések segítettek feltárni a szélső eseteket és az újrahasznosítható technikákat, amelyek optimalizálhatják az érvelési munkafolyamatokat. A Nemotron-3-Nano-30B modell és a LoRA adapterek használata a Google Cloud G4 VM-eken és NVIDIA RTX PRO 6000 Blackwell GPU-kon realisztikus kereteket biztosított a kutatóknak.

Kapcsolódó: MI modellek gondolkodása

A verseny tanulságai, beleértve a verifikálható lánc-követést és a token-budget hatékony kihasználását, segítenek az AI-érvelés javításában, amit a Nemotron-3-Nano-30B modell képvisel.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom