Git til AI-projekter
git init, .gitignore til data/modeller, commit af notebooks og DVC til dataversionering.
Git til AI-projekter er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Git i AI-projekter
Git sporer ændringer i din kode, så du kan samarbejde, rulle fejl tilbage og gennemgå historikken. Men AI-projekter har en særlig udfordring: Store datafiler og binære modeller hører ikke hjemme i Git.
Denne lektion gennemgår en fornuftig .gitignore og brugen af DVC til versionsstyring af data.
Hvad Git sporer godt
Git er fremragende til tekst: kildekode, konfigurationer, notebooks (med ryddede resultater) og dokumentation. Det gemmer effektive forskelle mellem tekstfiler.
Det håndterer store binære filer dårligt — hver version gemmes i sin helhed, så arkivet vokser for altid.
Hvorfor du ikke bør lægge data og modeller i Git
Hvis du lægger et datasæt på 2 GB eller en model på 500 MB i Git:
- Bliver arkivet større, så hver kloning bliver langsommere
- Kan indholdet ikke sammenlignes meningsfuldt
- Bliver det liggende i historikken for altid, selv efter sletning
Løsningen er at ignorere dem i Git og versionsstyre dem med et dedikeret værktøj.
Filen .gitignore
.gitignore viser de mønstre, Git ikke skal spore. Opret den i projektroden. Hver linje er et glob-mønster.
# .gitignore
*.pkl
*.joblib
*.h5
data/raw/*
data/processed/*
models/*
__pycache__/
*.pyc
.ipynb_checkpoints/
.envIgnorering af model- og cachefiler
Almindelige ignoreringsmønstre i AI-projekter:
*.pkl,*.joblib,*.h5— serialiserede modeller__pycache__/,*.pyc— Python-bytecode.ipynb_checkpoints/— Jupyters automatiske gemninger.env— hemmeligheder og API-nøgler (committ aldrig disse!)
Bevarelse af tomme mapper med .gitkeep
Git ignorerer tomme mapper. Hvis du vil beholde data/raw/ i arkivstrukturen, men ignorere indholdet, skal du tilføje en tom .gitkeep-fil og et negationsmønster.
# .gitignore
data/raw/*
!data/raw/.gitkeepIntroduktion til DVC
DVC (Data Version Control) versionsstyrer store datafiler og modeller sammen med Git. Git sporer små .dvc-pegefiler; de faktiske data ligger i et fjernlager (S3, GCS osv.).
Du får reproducerbare dataversioner uden at gøre Git-arkivet unødigt stort.
dvc init
Initialiser DVC i et eksisterende Git-arkiv. Det opretter mappen .dvc/ og en konfiguration, som du committer til Git.
# in your git repo
dvc init
git add .dvc .gitignore
git commit -m "Initialize DVC"dvc add — Sporing af data
dvc add begynder at spore en fil eller mappe. DVC flytter dataene til sin cache og opretter en lille .dvc-pegefil. Du committer pegefilen til Git, ikke dataene.
dvc add data/raw/dataset.csv
# creates data/raw/dataset.csv.dvc
git add data/raw/dataset.csv.dvc data/raw/.gitignore
git commit -m "Track dataset with DVC"dvc push og dvc pull
Konfigurér et fjernlager. Derefter uploader dvc push dataene til det, og dvc pull downloader den version, der svarer til den aktuelle Git-commit. Sådan deler teammedlemmer data.
dvc remote add -d storage s3://my-bucket/dvcstore
dvc push # upload data to the remote
# teammate after git clone + git checkout:
dvc pull # fetch the matching data versionArbejdsgangen for teamet
Arbejdsgangen med Git og DVC knytter kode- og dataversioner sammen:
git pullfor at hente den nyeste kode og de nyeste.dvc-pegefildvc pullfor at hente de tilsvarende data og modeller- Arbejd, og kør derefter
dvc add+git commit+dvc push
Hvis du går til en gammel commit og kører dvc pull, genskaber du præcis den tilstand.
Hurtigt tjek: Store filer
Dit projekt har et træningsdatasæt på 1 GB og en modelfil på 300 MB.
Opsummering: Git til AI-projekter
Du har lært versionsstyring, der er specifik for AI:
- Git til tekst (kode, konfigurationer, notebooks), ikke til store binære filer
- En
.gitignoretil*.pkl,data/raw/*,__pycache__og.env .gitkeeptil at bevare tomme mapper- DVC:
dvc init,dvc add,dvc push/pulltil versionsstyring af data og modeller - Arbejdsgangen med Git og DVC holder kode og data synkroniseret
Næste emne: at gøre eksperimenter reproducerbare.
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 53
- Lektioner
- 225
Ofte stillede spørgsmål
Er lektionen “Git til AI-projekter” gratis?
Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Git til AI-projekter”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Git til AI-projekter”?
git init, .gitignore til data/modeller, commit af notebooks og DVC til dataversionering. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Lær AI med Python?
Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.
Hvor lang tid tager lektionen “Git til AI-projekter”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?
Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Professionel mappestruktur til AI-projekter
- Git til AI-projekter
- Reproducerbarhed: seeds, konfigurationer og miljøer
- Bedste praksis for Jupyter Notebooks