Profesjonell katalogstruktur for KI-prosjekter
Oppsett med data/, notebooks/, src/, models/ og tests/, etter mønsteret cookiecutter-data-science.
Profesjonell katalogstruktur for KI-prosjekter er en gratis leksjon i Lær AI med Python på CoddyKit. Dette er leksjon 1 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Lær AI med Python, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.
Hvorfor struktur er viktig
En samling notatbøker kalt final.ipynb, final2.ipynb og really_final.ipynb er slik AI-prosjekter går til grunne. En konsekvent katalogstruktur gjør prosjekter lesbare, reproduserbare og enklere å samarbeide om.
Denne leksjonen dekker den mye brukte strukturen fra Cookiecutter Data Science.
data-mappen
Skill data etter behandlingstrinn, slik at rådata aldri overskrives:
data/raw/— opprinnelige, uforanderlige kildedatadata/processed/— rensede data som er klare for modellendata/interim/— mellomliggende transformasjoner
Behandle data/raw som skrivebeskyttet — du bør alltid kunne generere alt annet på nytt fra disse dataene.
Hvorfor rådata er uforanderlige
Hvis en feil i datarensingen ødelegger den eneste kopien av dataene, er prosjektet i praksis ødelagt. Ved å la data/raw være urørt kan hver behandlet fil gjenskapes ved å kjøre pipelinen på nytt.
Behandlede resultater kan kastes; rådata er hellige.
notebooks-mappen
notebooks/ inneholder notatbøker for utforskning og rapportering. En vanlig konvensjon er å nummerere dem etter trinn og legge til initialer, for eksempel 1.0-mk-eda.ipynb.
Notatbøker er til utforskning; gjenbrukbar logikk bør flyttes til src/.
src-pakken
src/ inneholder den importerbare Python-koden, delt inn etter ansvarsområde:
src/data/— skript for lasting og behandlingsrc/features/— feature engineeringsrc/models/— kode for trening og prediksjonsrc/visualization/— diagrammer og rapporter
src/features og src/models
Det lønner seg å holde feature engineering og modellering i separate moduler: Du kan enhetsteste feature-koden, gjenbruke den på tvers av notatbøker og bytte modeller uten å skrive om dataklargjøringen.
from src.features.build_features import make_features
from src.models.train import train_model
X = make_features(df)
model = train_model(X, y)models-mappen
models/ lagrer serialiserte, trente artefakter (for eksempel model.pkl og model.joblib). Dette er resultater, ikke kildekode.
Store modellfiler bør vanligvis ikke legges i Git — spor dem heller med DVC eller objektlagring (dette dekkes i neste leksjon).
reports-mappen
reports/ inneholder genererte resultater for mennesker: reports/figures/ for diagrammer og et rapportdokument på toppnivå. Disse produseres av koden din, så de kan genereres på nytt.
Konfigurasjons- og miljøfiler
Fullfør prosjektet med filer på prosjektnivå:
requirements.txtellerenvironment.yml— avhengigheterconfig.yaml— hyperparametere og filstierREADME.md— hva prosjektet er, og hvordan det kjøres.gitignore— hva Git skal hoppe over
Den fullstendige strukturen
Satt sammen ser et ryddig AI-prosjekt slik ut:
project/
data/
raw/
interim/
processed/
notebooks/
src/
data/
features/
models/
visualization/
models/
reports/
figures/
config.yaml
requirements.txt
README.mdGenerere den med Cookiecutter
Du trenger ikke å bygge dette for hånd hver gang. Malen cookiecutter-data-science oppretter hele grunnstrukturen med én kommando.
# pip install cookiecutter
# cookiecutter -c v1 https://github.com/drivendata/cookiecutter-data-science
# Answer a few prompts -> full project tree createdKort sjekk: Hvor lagres rådata?
Du laster ned en original CSV-fil fra en dataleverandør.
Oppsummering: Prosjektstruktur
Du har lært den profesjonelle strukturen for AI-prosjekter:
data/raw(uforanderlige data),data/processedfor behandlingstrinnnotebooks/for utforskning,src/featuresogsrc/modelsfor gjenbrukbar kodemodels/for artefakter,reports/for resultater- Konfigurasjon, krav, README og .gitignore i roten
- cookiecutter-data-science for å opprette grunnstrukturen umiddelbart
Neste: effektiv bruk av Git i AI-prosjekter.
Lær deg Python med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 53
- Leksjoner
- 225
Ofte stilte spørsmål
Er leksjonen «Profesjonell katalogstruktur for KI-prosjekter» gratis?
Ja – du kan lese valgfritt 3 av leksjonene i læringsstien Lær AI med Python, inkludert «Profesjonell katalogstruktur for KI-prosjekter», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.
Hva lærer jeg i «Profesjonell katalogstruktur for KI-prosjekter»?
Oppsett med data/, notebooks/, src/, models/ og tests/, etter mønsteret cookiecutter-data-science. Du øver på Lær AI med Python med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med Lær AI med Python?
Ingen tidligere erfaring er nødvendig. Lær AI med Python på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 1 av 4.
Hvor lang tid tar leksjonen «Profesjonell katalogstruktur for KI-prosjekter»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne Lær AI med Python-leksjonen?
Ja. Alle Lær AI med Python-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Profesjonell katalogstruktur for KI-prosjekter
- Git for KI-prosjekter
- Reproduserbarhet: seeds, konfigurasjoner og miljøer
- Beste praksis for Jupyter Notebooks