ÉlőUtoljára: 7 órájaMa: 10
Eszközökfrissítve: 04:50

Tesztelhetővé teszi az ETL-folyamatokat a fejlesztői környezet

Az ETL-folyamatok teszteléséhez szükséges környezet beállításához három eszköz telepítése szükséges: Docker Desktop, VS Code és a Dev Containers kiterjesztés.

Tesztelhetővé teszi az ETL-folyamatokat a fejlesztői környezet
Fotó: Itadaki / Unsplash
forrás: Towards Data Science·AI Forradalom szerk.·
Megosztás

Az adatmérnökök első munkanapján az új cégnél gyakran az örökölt ETL-folyamatok karbantartása jelenti a fő kihívást. Az ilyen rendszerek váratlanul meghibásodhatnak upstream sémaváltozások, adatminőségi problémák, hiányos dokumentáció vagy a növekvő adatmennyiség miatti teljesítménycsökkenés következtében. Az automatizált tesztelési munkafolyamat segít ezeknek a problémáknak a gyors megértésében és megoldásában.

Az automatizált teszteléshez szükséges környezet beállításához mindössze három dolgot kell telepíteni: Docker Desktopot, a VS Code-ot és a Dev Containers kiterjesztést. A Docker izolált, megismételhető tesztkörnyezeteket hoz létre, amelyekkel mock adatinfrastruktúrák indíthatók helyi gépen vagy CI-folyamatban. A VS Code a szkriptelés, hibakeresés és tesztelés központi fejlesztői környezeteként szolgál, míg a Dev Containers kiterjesztés Docker-konténert használ teljes értékű, reprodukálható fejlesztői környezetként.

Kapcsolódó: GitHub többnyelvű AI adatok

A Dev Containers konfiguráció részletei

A Dev Containers kiterjesztés .devcontainer mappát és devcontainer.json fájlt használ a környezet konfigurálásához, amely meghatározza a letöltendő Docker-képet, a továbbítandó portokat és a konténeren belül telepítendő VS Code-kiterjesztéseket. Ez a mappa Git-be commitálható a forráskóddal együtt. A „Reopen in Container” funkció újraindítja a VS Code backend-motorját a Docker-konténerben, így a forráskód és az adatok biztonságosan, izolált sandboxban futtathatók.

Kapcsolódó: CleoP adatcsővezetékek

A tesztelési folyamat értelmezése

Az ismeretlen ETL-folyamatok megértéséhez ahelyett, hogy a kód működését kérdeznénk, érdemesebb a várt rendszerműködést vizsgálni. Például, ha egy cég LLM-eket használ a csapatszintű AI-költségek nyomon követésére, a CSV-adatok oszlopait szabványosítani kell (pl. szóközök aláhúzásra cserélése), mielőtt azokat a downstream rendszerek feldolgozzák. Az ingest.py és ai_cost_ingest.py fájlok definiálják a szükséges oszlopszintű tisztítási és adatbevitel funkciókat.

Kapcsolódó: Kindle jegyzetek összefoglalása

Az AI-alapú szerkesztők, mint a Cursor és a Windsurf, felgyorsíthatják ezt a folyamatot. Ezek a fejlesztői eszközök képesek automatikusan generálni teszteket, dokumentációt és kódot, jelentősen növelve a produktivitást. A fejlesztőknek csupán a kód alapvető logikáját kell megadniuk, a többit az AI elvégzi.

Kapcsolódó: Promptflow OpenAI biztonság

Forrás

Feldolgozott sajtóforrás·Towards Data Science

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom