ÉlőUtoljára: 1 órájaMa: 7
Modellek & LLMfrissítve: 16:50

DPO-módszerrel csökkentik a szöveggenerálás ismétlődési hibáit — 59%-os átlagjavulás

A Direct Preference Optimization (DPO) módszerét alkalmazva a DharmaOCR modellje 59%-kal csökkentette a szöveggenerálás során fellépő ismétlődési hibákat, a korábbi SFT-modellekhez képest.

DPO-módszerrel csökkentik a szöveggenerálás ismétlődési hibáit — 59%-os átlagjavulás
Fotó: BoliviaInteligente / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

A Hugging Face-en megjelent DharmaOCR modellje új utat nyit a szöveggenerálási hibák, különösen az ismétlődési ciklusok (text degeneration) kezelésében. A kutatás kimutatta, hogy a Direct Preference Optimization (DPO) technika alkalmazása, amely a modell saját hibás kimeneteit használja fel negatív példákként, átlagosan 59,4%-kal, bizonyos esetekben akár 87,6%-kal is csökkentheti ezeket a problémákat.

A probléma gyökere a szöveggenerálás során fellépő ismétlődési ciklusokban rejlik, ahol a modell egy ponton túl önmagát ismétlő szövegrészeket generál. Ez a jelenség SFT után is fennmarad, mivel a SFT a tokenek helyes sorrendjére optimalizál, de nem bünteti kifejezetten a teljes kimenet szintjén jelentkező ismétlődést. A DPO ezzel szemben a teljes kimenetet értékeli, így explicit módon tudja jelezni a degenerált kimeneteket helytelenként, ami a Hugging Face által közzétett DharmaOCR teljesítményteszt eredményei szerint minden tesztelt modellcsaládnál javulást eredményezett.

Kapcsolódó: emberi preferencia

A szöveggenerálás labirintusában

A DharmaOCR folyamat egyedi megközelítése, hogy a SFT modell saját, hibás kimeneteit használta fel a DPO-s betanításhoz. Míg a hagyományos DPO-alkalmazások, mint például a csevegő AI-k igazításánál, emberi ítéletekre támaszkodnak, addig az OCR-feladatoknál objektív a helyes transzkripció és a degenerált kimenet közötti különbség.

Kapcsolódó: GPT-5.5 bemutatása

A technika hatékonyságának bizonyítéka

A DharmaOCR ezt a bináris jelzést használta fel, bizonyítva, hogy a DPO nem csak a felhasználói élmény javítására, hanem specifikus technikai hibák közvetlen orvoslására is alkalmas lehet. A kutatás rávilágít arra, hogy a képességfejlesztés és a degenerációval szembeni ellenállás függetlenül fejlődhet. A DharmaOCR 2026. áprilisában megjelent, és a teljesítményteszten a Nanonets-OCR2–3B modell degenerációs rátája 1,61%-ról 0,20%-ra csökkent a DPO alkalmazása után, a Hugging Face által végzett tesztek során.

Kapcsolódó: GPT-5.5 Instant

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom