ÉlőUtoljára: 6 órájaMa: 2
Kutatásfrissítve: 06:30

Új hibrid módszerrel mélyebb szemantikai struktúrát érhetnek el a nyelvi modellek

Az arXiv kutatói JEPA és MLM célokat kombináló hibrid módszert javasolnak a nyelvi modellek mélyebb szemantikai megértéséért, amely egyenletesebb és gazdagabb reprezentációkat eredményez.

Új hibrid módszerrel mélyebb szemantikai struktúrát érhetnek el a nyelvi modellek
Fotó: Tien Vu Ngoc / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

Az arXiv kutatói új hibrid pre-tréning célkitűzést dolgoztak ki a nyelvi modellek számára. Az új módszer a korábbi, elsősorban felszíni tokenazonosságra fókuszáló masked language modelling (MLM) objektívumot a Joint Embedding Predictive Architectures (JEPA) elvén alapuló, mélyebb szemantikai struktúrát célzó predikciós loss-szal ötvözi. A kutatás előnyomtatott formában jelent meg az arXiv-on.

A hibrid modell működése

A hibrid modell egyetlen, megosztott encoderen keresztül dolgozik, miközben egy tanulható skalár paraméter folyamatosan egyensúlyozza a két célkitűzést a betanítás során. A kutatók angol Wikipédián végeztek kísérleteket, azonos architektúrával és számítási kapacitással (NVIDIA H100), összehasonlítva a hibrid modellt egy tisztán MLM-alapú baseline-nal.

Kapcsolódó: Vizuális AI-modellek

Gazdagabb spektrális geometria és egyenletesebb reprezentációk

Az öt GLUE teljesítményteszten (SST-2, MRPC, MNLI, CoLA, STS-B) végzett kiterjedt elemzés kimutatta, hogy a hibrid encoder által generált reprezentációk szignifikánsan egyenletesebbek (uniformitásuk -0.16 alatt, szemben a MLM -0.05-ös értékével). A modell emellett gazdagabb spektrális geometriát mutatott max pooling alatt, kevesebb felszíni lexikai információt kódolt, és jobb szemantikai-lexikai egyensúlyt ért el.

Kapcsolódó: LLM-ek mérete

Bár a downstream feladatok pontossága hasonló maradt a hagyományos lineáris probe-ok esetében, a geometrikus különbségek konzisztensek és szignifikánsak. Ez arra utal, hogy a JEPA prediktív célkitűzése olyan módon alakítja át a latent teret, amelyet a szokásos pontossági metrikák önmagukban nem tudnak megragadni. A kutatás a ComRAM nevű módszert használja, amely a robot-navigáció memóriaigényét két nagyságrenddel csökkenti. A kutatás eredményeit az arXiv:2606.05173v1 publikáció részletezi, 2024. január 15-én jelent meg.

Kapcsolódó: Hibajavító módszer

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom