DPO-módszerrel csökkentik a szöveggenerálás ismétlődési hibáit — 59%-os átlagjavulás
A Direct Preference Optimization (DPO) módszerét alkalmazva a DharmaOCR modellje 59%-kal csökkentette a szöveggenerálás során fellépő ismétlődési hibákat, a korábbi SFT-modellekhez képest.

A Hugging Face-en megjelent DharmaOCR modellje új utat nyit a szöveggenerálási hibák, különösen az ismétlődési ciklusok (text degeneration) kezelésében. A kutatás kimutatta, hogy a Direct Preference Optimization (DPO) technika alkalmazása, amely a modell saját hibás kimeneteit használja fel negatív példákként, átlagosan 59,4%-kal, bizonyos esetekben akár 87,6%-kal is csökkentheti ezeket a problémákat.
A probléma gyökere a szöveggenerálás során fellépő ismétlődési ciklusokban rejlik, ahol a modell egy ponton túl önmagát ismétlő szövegrészeket generál. Ez a jelenség SFT után is fennmarad, mivel a SFT a tokenek helyes sorrendjére optimalizál, de nem bünteti kifejezetten a teljes kimenet szintjén jelentkező ismétlődést. A DPO ezzel szemben a teljes kimenetet értékeli, így explicit módon tudja jelezni a degenerált kimeneteket helytelenként, ami a Hugging Face által közzétett DharmaOCR teljesítményteszt eredményei szerint minden tesztelt modellcsaládnál javulást eredményezett.
Kapcsolódó: emberi preferencia
A szöveggenerálás labirintusában
A DharmaOCR folyamat egyedi megközelítése, hogy a SFT modell saját, hibás kimeneteit használta fel a DPO-s betanításhoz. Míg a hagyományos DPO-alkalmazások, mint például a csevegő AI-k igazításánál, emberi ítéletekre támaszkodnak, addig az OCR-feladatoknál objektív a helyes transzkripció és a degenerált kimenet közötti különbség.
Kapcsolódó: GPT-5.5 bemutatása
A technika hatékonyságának bizonyítéka
A DharmaOCR ezt a bináris jelzést használta fel, bizonyítva, hogy a DPO nem csak a felhasználói élmény javítására, hanem specifikus technikai hibák közvetlen orvoslására is alkalmas lehet. A kutatás rávilágít arra, hogy a képességfejlesztés és a degenerációval szembeni ellenállás függetlenül fejlődhet. A DharmaOCR 2026. áprilisában megjelent, és a teljesítményteszten a Nanonets-OCR2–3B modell degenerációs rátája 1,61%-ról 0,20%-ra csökkent a DPO alkalmazása után, a Hugging Face által végzett tesztek során.
Kapcsolódó: GPT-5.5 Instant