1990-es évekbeli technikai írásra tanítják az AI-t — 37 millió szavas archívummal
A kutatócsoport egy olcsó, 8 dolláros folyamattal tanította az AI-modellt. A cél, hogy 2030-ra specializált, helyileg futó AI-modellek álljanak a technikai írók rendelkezésére.

Egy kutató 37 millió szavas archívumot használt fel, hogy egy AI-modellt 1990-es évekbeli technikai írásra tanítson. A folyamat 8 dollárba került.
A kutató a Bitsavers weboldalról töltött le régi számítógépes kézikönyveket és brosúrákat. A Microsoft gyűjteménye 1977 és 2005 között megjelent, kiadványokon kívüli dokumentumokat tartalmaz, több mint 37 millió szót.
Kapcsolódó: LLM-kritikák
Régi dokumentumok gyűjtése és tisztítása
A letöltött OCR-szövegeket Python szkriptekkel tisztította meg. Ezt követően egy olcsó és gyors modellt, a gemma-4-26b-t használta az OpenRouteren keresztül, hogy minden bekezdést „megtartandó” vagy „eldobandó” kategóriába soroljon.
Kapcsolódó: LLM-kutatás
Ez a második tisztítási lépés körülbelül 8 dollárba került. A szanitált szöveget 512 tokenes darabokra bontotta, szintetikus utasításokkal párosítva, így 192 456 példány jött létre JSONL formátumban.
Kapcsolódó: Kontrollos kísérlet
Finomhangolás, nem teljes betanítás
A kutató a QLoRA (Quantized Low-Rank Adaptation) módszert alkalmazott, ami a súlyok befagyasztásával és egy kis adapter hozzáadásával alakítja át a modell viselkedését. Két modellt, a Llama 3.1 8B Instructot és a Qwen 2.5 7B Instructot tesztelt.
Kapcsolódó: LLM-kutatások
A finomhangolás összesen körülbelül egy napot vett igénybe, és 50 dollárba került. A kutató két adaptert elveszített, mert a Runpod törölte a podokat, ha a finanszírozás nulla volt. A tesztek eredményeként létrejött adaptereket laptopjára exportálta és GGUF LoRA fájlként konvertálta az Nvidia B200 GPU segítségével, a Runpod szolgáltatásán keresztül.
Kapcsolódó: LLM-áttanulás