ÉlőUtoljára: 1 órájaMa: 11
Eszközökfrissítve: 09:30

Új adathalmazzal segíti a GitHub a többnyelvű AI-fejlesztést

A GitHub Multilingual Repositories adathalmaz több mint 80 millió osztályozási sort tartalmaz, amelyek több mint 40 millió adattárházból származó adatokat foglalnak magukban.

Új adathalmazzal segíti a GitHub a többnyelvű AI-fejlesztést
Fotó: Mohammad Rahmani / Unsplash
forrás: GitHub Blog·AI Forradalom szerk.·
Megosztás

A GitHub új, CC0-1.0 licenc alatt elérhető adathalmazával a kutatók és fejlesztők könnyebben fedezhetnek fel többnyelvű kódolási tartalmakat. A több mint 40 millió adattárházból származó adatokat tartalmazó gyűjtemény a fejlesztői együttműködés nyelvi sokszínűségét hivatott feltárni.

A GitHub Multilingual Repositories adathalmaz több mint 80 millió osztályozási sort tartalmaz, amelyek több mint 40 millió adattárházból származnak. Az adathalmaz célja, hogy segítse a kutatókat és fejlesztőket a nyilvános GitHub adattárházak felfedezésében, amelyek bizonyítékot szolgáltatnak nem angol nyelvű, természetes nyelvű tartalomra.

Kapcsolódó: Nyílt forráskódú Euphony

Az adathalmaz jellemzői

Az adathalmaz nem tartalmazza a tárolók teljes tartalmát, hanem metaadatokat biztosít. Minden nyilvános adattárhoz nyelvi osztályozásokat kínál a README fájlokhoz, a leggyakrabban kommentelt issue-hoz és a leggyakrabban kommentelt pull request-hez. Ezekhez az osztályozásokhoz a fastText, a gcld3 és a lingua-py classifier-eket használták, 0,5-ös konfidencia-küszöbértékkel.

Kapcsolódó: TinyFish BigSet

Az adathalmazt olyan kutatásokhoz tervezték, amelyek általános webes szövegekkel nehezen végezhetők el. Lehetővé teszi a fejlesztői dokumentációt vagy együttműködést tartalmazó adattárak felfedezését specifikus nyelveken, valamint az AI kódolási eszközök, dokumentációgenerátorok vagy áttekintő asszisztensek értékelési készleteinek felépítését.

Kapcsolódó: AI-kódoló eszközök

A nyelvi azonosítás kihívásai

A kiadó felhívja a figyelmet arra, hogy a nyelvi azonosítás kihívást jelenthet a szoftver adattárházakban, mivel a szövegek gyakran rövidek, és tartalmazhatnak kódrészleteket, felhasználóneveket vagy vegyes nyelvű tartalmakat. Az adathalmazt ezért nem szabad a nyelvi azonosítás „ground-truth” benchmarkjaként kezelni, hanem átlátható felfedező eszközként.

Kapcsolódó: OpenAI Codex fejlesztések

A nyílt, többnyelvű adatok fontosságát hangsúlyozva a GitHub kiemeli, hogy sok európai nyelv alulreprezentált az AI-rendszerek építéséhez és értékeléséhez használt online szövegekben. A GitHub a Strasbourgban megrendezésre kerülő Open Innovation Dialogue Hub rendezvényen, június 16-án mutatja be részletesebben az adathalmazt és a többnyelvű AI-fejlesztésben rejlő nyílt adatok fontosságát, a Microsoft Open Innovation Center, az Európa Tanács és a GitHub szervezésében.

Kapcsolódó: LLM-ek általánosítása

Forrás

Feldolgozott sajtóforrás·GitHub Blog

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom