Új adathalmazzal segíti a GitHub a többnyelvű AI-fejlesztést
A GitHub Multilingual Repositories adathalmaz több mint 80 millió osztályozási sort tartalmaz, amelyek több mint 40 millió adattárházból származó adatokat foglalnak magukban.

A GitHub új, CC0-1.0 licenc alatt elérhető adathalmazával a kutatók és fejlesztők könnyebben fedezhetnek fel többnyelvű kódolási tartalmakat. A több mint 40 millió adattárházból származó adatokat tartalmazó gyűjtemény a fejlesztői együttműködés nyelvi sokszínűségét hivatott feltárni.
A GitHub Multilingual Repositories adathalmaz több mint 80 millió osztályozási sort tartalmaz, amelyek több mint 40 millió adattárházból származnak. Az adathalmaz célja, hogy segítse a kutatókat és fejlesztőket a nyilvános GitHub adattárházak felfedezésében, amelyek bizonyítékot szolgáltatnak nem angol nyelvű, természetes nyelvű tartalomra.
Kapcsolódó: Nyílt forráskódú Euphony
Az adathalmaz jellemzői
Az adathalmaz nem tartalmazza a tárolók teljes tartalmát, hanem metaadatokat biztosít. Minden nyilvános adattárhoz nyelvi osztályozásokat kínál a README fájlokhoz, a leggyakrabban kommentelt issue-hoz és a leggyakrabban kommentelt pull request-hez. Ezekhez az osztályozásokhoz a fastText, a gcld3 és a lingua-py classifier-eket használták, 0,5-ös konfidencia-küszöbértékkel.
Kapcsolódó: TinyFish BigSet
Az adathalmazt olyan kutatásokhoz tervezték, amelyek általános webes szövegekkel nehezen végezhetők el. Lehetővé teszi a fejlesztői dokumentációt vagy együttműködést tartalmazó adattárak felfedezését specifikus nyelveken, valamint az AI kódolási eszközök, dokumentációgenerátorok vagy áttekintő asszisztensek értékelési készleteinek felépítését.
Kapcsolódó: AI-kódoló eszközök
A nyelvi azonosítás kihívásai
A kiadó felhívja a figyelmet arra, hogy a nyelvi azonosítás kihívást jelenthet a szoftver adattárházakban, mivel a szövegek gyakran rövidek, és tartalmazhatnak kódrészleteket, felhasználóneveket vagy vegyes nyelvű tartalmakat. Az adathalmazt ezért nem szabad a nyelvi azonosítás „ground-truth” benchmarkjaként kezelni, hanem átlátható felfedező eszközként.
Kapcsolódó: OpenAI Codex fejlesztések
A nyílt, többnyelvű adatok fontosságát hangsúlyozva a GitHub kiemeli, hogy sok európai nyelv alulreprezentált az AI-rendszerek építéséhez és értékeléséhez használt online szövegekben. A GitHub a Strasbourgban megrendezésre kerülő Open Innovation Dialogue Hub rendezvényen, június 16-án mutatja be részletesebben az adathalmazt és a többnyelvű AI-fejlesztésben rejlő nyílt adatok fontosságát, a Microsoft Open Innovation Center, az Európa Tanács és a GitHub szervezésében.
Kapcsolódó: LLM-ek általánosítása