Git för AI-projekt
git init, .gitignore för data/modeller, versionshantering av notebooks och DVC för dataversionshantering.
Git för AI-projekt är en gratis lektion i Lär Er AI med Python på CoddyKit. Detta är lektion 2 av 4. Du kan läsa vilka 3 lektioner som helst i den här lärvägen kostnadsfritt i sin helhet – därefter låser CoddyKit PRO upp alla lektioner, plus praktisk övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Den ingår i lärvägen för Lär Er AI med Python, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Lär Er AI med Python innehåller totalt 4 lektioner.
Git i AI-projekt
Git håller reda på ändringar i koden, så att Ni kan samarbeta, återställa misstag och granska historiken. Men AI-projekt har en särskild utmaning: stora datafiler och binära modeller hör inte hemma i Git.
Den här lektionen tar upp en genomtänkt .gitignore och hur DVC används för versionshantering av data.
Vad Git versionshanterar bra
Git är utmärkt för text: källkod, konfigurationer, notebooks (med rensade utdata) och dokumentation. Det lagrar effektiva diffar för textfiler.
Git hanterar stora binärfiler dåligt – varje version lagras i sin helhet, vilket gör lagringsutrymmet större för alltid.
Varför inte committa data och modeller?
Att committa en datamängd på 2 GB eller en modell på 500 MB:
- Gör repot större och varje kloning långsammare
- Kan inte jämföras på ett meningsfullt sätt
- Finns kvar i historiken för alltid, även efter att filen har tagits bort
Lösningen är att ignorera dem i Git och versionshantera dem med ett särskilt verktyg.
Filen .gitignore
.gitignore innehåller mönster som Git inte ska versionshantera. Skapa filen i projektroten. Varje rad är ett globmönster.
# .gitignore
*.pkl
*.joblib
*.h5
data/raw/*
data/processed/*
models/*
__pycache__/
*.pyc
.ipynb_checkpoints/
.envIgnorera modell- och cachefiler
Vanliga ignoreringsmönster för AI-projekt:
*.pkl,*.joblib,*.h5— serialiserade modeller__pycache__/,*.pyc— Python-bytecode.ipynb_checkpoints/— Jupyters automatiska säkerhetskopior.env— hemligheter och API-nycklar (committa aldrig dessa!)
Behålla tomma kataloger med .gitkeep
Git ignorerar tomma kataloger. För att behålla data/raw/ i repots struktur samtidigt som innehållet ignoreras lägger Ni till en tom .gitkeep-fil och ett negationsmönster.
# .gitignore
data/raw/*
!data/raw/.gitkeepIntroduktion till DVC
DVC (Data Version Control) versionshanterar stora datamängder och modeller tillsammans med Git. Git spårar små .dvc-pekfiler; de faktiska datafilerna lagras i fjärrlagring (S3, GCS och så vidare).
Ni får reproducerbara dataversioner utan att göra Git-repot onödigt stort.
dvc init
Initiera DVC i ett befintligt Git-repo. Det skapar en .dvc/-katalog och en konfiguration som Ni committar till Git.
# in your git repo
dvc init
git add .dvc .gitignore
git commit -m "Initialize DVC"dvc add — versionshantera data
dvc add börjar versionshantera en fil eller katalog. DVC flyttar datan till sin cache och skapar en liten .dvc-pekfil. Ni committar pekfilen till Git, inte datan.
dvc add data/raw/dataset.csv
# creates data/raw/dataset.csv.dvc
git add data/raw/dataset.csv.dvc data/raw/.gitignore
git commit -m "Track dataset with DVC"dvc push och dvc pull
Konfigurera en fjärrlagring. Därefter laddar dvc push upp data till den och dvc pull laddar ner den version som motsvarar den aktuella Git-committen. Så här delar teammedlemmar data.
dvc remote add -d storage s3://my-bucket/dvcstore
dvc push # upload data to the remote
# teammate after git clone + git checkout:
dvc pull # fetch the matching data versionArbetsflödet för teamet
Loopen med Git och DVC kopplar samman kod- och dataversioner:
git pullför att hämta den senaste koden och.dvc-pekfilernadvc pullför att hämta motsvarande data och modeller- Arbeta och kör sedan
dvc add+git commit+dvc push
Om Ni checkar ut en gammal commit och kör dvc pull återskapas exakt det tillståndet.
Snabbkontroll: Stora filer
Projektet innehåller en träningsdatamängd på 1 GB och en modellfil på 300 MB.
Sammanfattning: Git för AI-projekt
Ni har lärt er versionshantering för AI-projekt:
- Git för text (kod, konfigurationer och notebooks), inte för stora binärfiler
- En
.gitignoreför*.pkl,data/raw/*,__pycache__och.env .gitkeepför att bevara tomma kataloger- DVC:
dvc init,dvc add,dvc push/pullför versionshantering av data och modeller - Arbetsflödet med Git och DVC håller kod och data synkroniserade
Nästa steg: göra experiment reproducerbara.
Lär dig Python med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 53
- Lektioner
- 225
Vanliga frågor
Är lektionen ”Git för AI-projekt” gratis?
Ja – du kan läsa vilka 3 lektioner som helst i lärvägen Lär Er AI med Python, inklusive ”Git för AI-projekt”, kostnadsfritt i sin helhet här på webben. Därefter låser CoddyKit PRO upp alla lektioner, plus interaktiv övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Kursen i Lär Er AI med Python innehåller totalt 4 lektioner.
Vad lär jag mig i ”Git för AI-projekt”?
git init, .gitignore för data/modeller, versionshantering av notebooks och DVC för dataversionshantering. Ni övar på Lär Er AI med Python med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig Lär Er AI med Python?
Du behöver inga förkunskaper. Utbildningen i Lär Er AI med Python på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.
Hur lång tid tar lektionen ”Git för AI-projekt”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här Lär Er AI med Python-lektionen?
Ja. Varje Lär Er AI med Python-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Professionell katalogstruktur för AI-projekt
- Git för AI-projekt
- Reproducerbarhet: seeds, konfigurationer och miljöer
- Bästa praxis för Jupyter Notebooks