LLM-ek átírják az afroamerikai angolt – új módszer csökkenti a nyelvi torzítást
A nagy nyelvi modellek (LLM) rendszeresen átírják az afroamerikai angolt (AAE) standard amerikai angolra (SAE), még akkor is, ha a felhasználó AAE-ben ír. Egy új kutatás szerint az aktivációs kormányzás nevű módszer 5-20-szor hatékonyabban csökkenti ezt a nyelvi torzítást, mint a hagyományos promptolás.

A nagy nyelvi modellek (LLM) szisztematikusan részesítik előnyben a standard amerikai angol (SAE) folytatásokat az afroamerikai angollal (AAE) szemben, még akkor is, ha az előzményi szöveg AAE-ben íródott. Ez gyakorlatilag AAE átírását jelenti SAE-re, ami hat legfejlettebb, 14 és 70 milliárd paraméter közötti LLM-re terjed ki — írja az arXiv-en publikált tanulmány.
A nyelvi torzítás auditálása
A kutatók bemutatták a feltételes tárcsoport-invariancia (cDGI) nevű módszert, amely elkülöníti a valódi modell torzítást a fordításból eredő tárgyaktól. Emellett egy funkció-szintű elemzést is végeztek, amely azonosítja az AAE-jelzőket, leginkább a szintaktikai szerkezeteket, különösen a negatív konkordanciát (például „ain’t nobody”), mint univerzális trigger-eket minden modell esetében.
Kapcsolódó: LLM hibaszázalék becslése
Aktivációs kormányzás a torzítás csökkentésére
A torzítás mérséklésére a kutatók az aktivációs kormányzás nevű, képzés nélküli, tesztidő alatti módszert alkalmazták. Ez a technika kauzális nyomon keresztül extrahálja a tárcsa irányokat, és azokat a torzítás-releváns rétegekbe injektálja. Az aktivációs kormányzás 5-20-szor hatékonyabban csökkenti a torzítást, mint a hagyományos promptolás, miközben megőrzi a SAE folyékonyságát.
Kapcsolódó: Audio AI szemantikus tesztelése
REAL-AAE: Új adathalmaz a kutatáshoz
A munka támogatására a kutatók kiadták a REAL-AAE-t, amely a legnagyobb valós AAE párhuzamos corpusnak számít. Az adathalmaz 17 479 AAE/SAE/AAE_back hármast tartalmaz természetes tweetekből, amelyeket automatikusan validáltak (BERTScore F1 = 0,95), és három, anyanyelvi AAE beszélő által is ellenőriztek (83,0%-os szemantikai egyezés).
Kapcsolódó: C-3PO kultúrák közötti harmonizálása
A REAL-AAE adathalmaz lehetővé teszi, hogy a kutatók tovább dolgozhassanak a tárcsa-semlegesség terén.
Kapcsolódó: ADAPT általánosítási javítása