Lær AI med Python · Lektion

Professionel mappestruktur til AI-projekter

Layout med data/, notebooks/, src/, models/, tests/ samt cookiecutter-data-science-mønsteret.

Lektion 1 af 413 trin

Professionel mappestruktur til AI-projekter er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvorfor struktur er vigtig

En bunke notebooks med navnene final.ipynb, final2.ipynb og really_final.ipynb er sådan, AI-projekter går til grunde. En ensartet mappestruktur gør projekter læsbare, reproducerbare og nemme at samarbejde om.

Denne lektion gennemgår det udbredte layout fra Cookiecutter Data Science.

Mappen data

Opdel data efter behandlingstrin, så rå input aldrig overskrives:

  • data/raw/ — oprindelige, uforanderlige kildedata
  • data/processed/ — rensede data, der er klar til modellen
  • data/interim/ — mellemliggende transformationer

Betragt data/raw som skrivebeskyttet — du skal altid kunne genskabe alt andet ud fra den.

Hvorfor raw er uforanderlig

Hvis en fejl i datarensningen ødelægger din eneste kopi af dataene, er projektet fortabt. Hvis du lader data/raw være urørt, kan alle behandlede filer genskabes ved at køre din arbejdsgang igen.

Behandlede resultater kan kasseres; rådata er hellige.

Mappen notebooks

notebooks/ indeholder notebooks til udforskning og rapportering. En almindelig konvention er at nummerere dem efter trin og tilføje initialer, f.eks. 1.0-mk-eda.ipynb.

Notebooks er til udforskning; genanvendelig logik bør flyttes til src/.

Pakken src

src/ indeholder den Python-kode, der kan importeres, opdelt efter ansvarsområde:

  • src/data/ — scripts til indlæsning og behandling
  • src/features/ — udvikling af features
  • src/models/ — kode til træning og forudsigelse
  • src/visualization/ — diagrammer og rapporter

src/features og src/models

Det kan betale sig at holde udvikling af features og modellering i separate moduler: Du kan enhedsteste feature-kode, genbruge den på tværs af notebooks og udskifte modeller uden at omskrive dataforberedelsen.

from src.features.build_features import make_features
from src.models.train import train_model

X = make_features(df)
model = train_model(X, y)

Mappen models

models/ gemmer serialiserede, trænede artefakter (f.eks. model.pkl og model.joblib). Det er resultater, ikke kildekode.

Store modelfiler bør normalt ikke lægges i Git — versionsspor dem i stedet med DVC eller objektlagring (det gennemgås i næste lektion).

Mappen reports

reports/ indeholder genererede resultater til mennesker: reports/figures/ til diagrammer og et rapportdokument i rodniveauet. De produceres af din kode, så de kan genskabes.

Konfigurations- og miljøfiler

Rund projektet af med filer på projektniveau:

  • requirements.txt eller environment.yml — afhængigheder
  • config.yaml — hyperparametre og stier
  • README.md — hvad projektet er, og hvordan det køres
  • .gitignore — hvad Git skal springe over

Den fulde struktur

Samlet ser et velstruktureret AI-projekt sådan ud:

project/
  data/
    raw/
    interim/
    processed/
  notebooks/
  src/
    data/
    features/
    models/
    visualization/
  models/
  reports/
    figures/
  config.yaml
  requirements.txt
  README.md

Generering med Cookiecutter

Du behøver ikke opbygge dette manuelt hver gang. Skabelonen cookiecutter-data-science opretter hele strukturen med én kommando.

# pip install cookiecutter
# cookiecutter -c v1 https://github.com/drivendata/cookiecutter-data-science
# Answer a few prompts -> full project tree created

Hurtigt tjek: Hvor skal rådata ligge

Du downloader en oprindelig CSV-fil fra en dataleverandør.

Opsummering: Projektstruktur

Du har lært den professionelle struktur for AI-projekter:

  • data/raw (uforanderlig), data/processed til forskellige trin
  • notebooks/ til udforskning, src/features og src/models til genanvendelig kode
  • models/ til artefakter, reports/ til resultater
  • Konfiguration, afhængigheder, README og .gitignore i roden
  • cookiecutter-data-science til at oprette strukturen med det samme

Næste emne: effektiv brug af Git i AI-projekter.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Professionel mappestruktur til AI-projekter” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Professionel mappestruktur til AI-projekter”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Professionel mappestruktur til AI-projekter”?

Layout med data/, notebooks/, src/, models/, tests/ samt cookiecutter-data-science-mønsteret. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “Professionel mappestruktur til AI-projekter”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Professionel mappestruktur til AI-projekter
  2. Git til AI-projekter
  3. Reproducerbarhed: seeds, konfigurationer og miljøer
  4. Bedste praksis for Jupyter Notebooks
← Tilbage til Lær AI med Python