Új hibrid módszerrel mélyebb szemantikai struktúrát érhetnek el a nyelvi modellek
Az arXiv kutatói JEPA és MLM célokat kombináló hibrid módszert javasolnak a nyelvi modellek mélyebb szemantikai megértéséért, amely egyenletesebb és gazdagabb reprezentációkat eredményez.

Az arXiv kutatói új hibrid pre-tréning célkitűzést dolgoztak ki a nyelvi modellek számára. Az új módszer a korábbi, elsősorban felszíni tokenazonosságra fókuszáló masked language modelling (MLM) objektívumot a Joint Embedding Predictive Architectures (JEPA) elvén alapuló, mélyebb szemantikai struktúrát célzó predikciós loss-szal ötvözi. A kutatás előnyomtatott formában jelent meg az arXiv-on.
A hibrid modell működése
A hibrid modell egyetlen, megosztott encoderen keresztül dolgozik, miközben egy tanulható skalár paraméter folyamatosan egyensúlyozza a két célkitűzést a betanítás során. A kutatók angol Wikipédián végeztek kísérleteket, azonos architektúrával és számítási kapacitással (NVIDIA H100), összehasonlítva a hibrid modellt egy tisztán MLM-alapú baseline-nal.
Kapcsolódó: Vizuális AI-modellek
Gazdagabb spektrális geometria és egyenletesebb reprezentációk
Az öt GLUE teljesítményteszten (SST-2, MRPC, MNLI, CoLA, STS-B) végzett kiterjedt elemzés kimutatta, hogy a hibrid encoder által generált reprezentációk szignifikánsan egyenletesebbek (uniformitásuk -0.16 alatt, szemben a MLM -0.05-ös értékével). A modell emellett gazdagabb spektrális geometriát mutatott max pooling alatt, kevesebb felszíni lexikai információt kódolt, és jobb szemantikai-lexikai egyensúlyt ért el.
Kapcsolódó: LLM-ek mérete
Bár a downstream feladatok pontossága hasonló maradt a hagyományos lineáris probe-ok esetében, a geometrikus különbségek konzisztensek és szignifikánsak. Ez arra utal, hogy a JEPA prediktív célkitűzése olyan módon alakítja át a latent teret, amelyet a szokásos pontossági metrikák önmagukban nem tudnak megragadni. A kutatás a ComRAM nevű módszert használja, amely a robot-navigáció memóriaigényét két nagyságrenddel csökkenti. A kutatás eredményeit az arXiv:2606.05173v1 publikáció részletezi, 2024. január 15-én jelent meg.
Kapcsolódó: Hibajavító módszer