Struktur Direktori Proyek Kecerdasan Buatan Profesional
Tata letak data/, notebooks/, src/, models/, tests/, serta pola cookiecutter-data-science.
Struktur Direktori Proyek Kecerdasan Buatan Profesional adalah pelajaran Learn AI with Python gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Learn AI with Python, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Learn AI with Python mencakup 4 pelajaran total.
Mengapa Struktur Itu Penting
Tumpukan buku catatan bernama final.ipynb, final2.ipynb, dan really_final.ipynb dapat membuat proyek AI berakhir kacau. Struktur direktori yang konsisten membuat proyek mudah dibaca, dapat direproduksi, dan mendukung kolaborasi.
Pelajaran ini membahas tata letak Cookiecutter Data Science yang banyak digunakan.
Direktori data
Pisahkan data berdasarkan tahap pemrosesan agar input mentah tidak pernah ditimpa:
data/raw/— data sumber asli yang tidak dapat diubahdata/processed/— data yang telah dibersihkan dan siap digunakan modeldata/interim/— transformasi antara
Perlakukan data/raw sebagai hanya-baca — Anda harus selalu dapat membuat ulang semua hal lainnya dari sana.
Mengapa Data Mentah Tidak Dapat Diubah
Jika bug dalam pembersihan merusak satu-satunya salinan data Anda, proyek tersebut tidak dapat diselamatkan. Membiarkan data/raw tetap utuh berarti setiap berkas hasil pemrosesan dapat direproduksi dengan menjalankan ulang alur kerja Anda.
Keluaran hasil pemrosesan dapat dibuang; data mentah harus dijaga.
Direktori notebooks
notebooks/ menyimpan buku catatan untuk eksplorasi dan pelaporan. Konvensi yang umum adalah memberi nomor berdasarkan tahap dan menambahkan inisial, misalnya 1.0-mk-eda.ipynb.
Buku catatan digunakan untuk eksplorasi; logika yang dapat digunakan ulang sebaiknya dipindahkan ke src/.
Paket src
src/ berisi kode Python yang dapat diimpor, dan dibagi berdasarkan tanggung jawab:
src/data/— skrip pemuatan dan pemrosesansrc/features/— rekayasa fitursrc/models/— kode pelatihan dan prediksisrc/visualization/— grafik dan laporan
src/features dan src/models
Memisahkan rekayasa fitur dan pemodelan ke dalam modul yang berbeda memberikan banyak manfaat: Anda dapat melakukan uji unit pada kode fitur, menggunakannya kembali di berbagai buku catatan, dan mengganti model tanpa menulis ulang persiapan data.
from src.features.build_features import make_features
from src.models.train import train_model
X = make_features(df)
model = train_model(X, y)Direktori models
models/ menyimpan artefak hasil pelatihan yang diserialkan (misalnya model.pkl, model.joblib). Ini adalah keluaran, bukan kode sumber.
Berkas model besar biasanya tidak seharusnya dimasukkan ke Git — lacak berkas tersebut dengan DVC atau penyimpanan objek (dibahas pada pelajaran berikutnya).
Direktori reports
reports/ menyimpan keluaran yang dibuat untuk manusia: reports/figures/ untuk grafik dan dokumen laporan tingkat teratas. Keluaran ini dibuat oleh kode Anda, sehingga dapat dibuat ulang.
Berkas Konfigurasi dan Lingkungan
Lengkapi proyek dengan berkas tingkat proyek:
requirements.txtatauenvironment.yml— dependensiconfig.yaml— hiperparameter dan jalurREADME.md— penjelasan tentang proyek dan cara menjalankannya.gitignore— hal-hal yang harus dilewati Git
Tata Letak Lengkap
Jika disatukan, proyek AI yang tertata akan terlihat seperti ini:
project/
data/
raw/
interim/
processed/
notebooks/
src/
data/
features/
models/
visualization/
models/
reports/
figures/
config.yaml
requirements.txt
README.mdMembuatnya dengan Cookiecutter
Anda tidak perlu membangun struktur ini secara manual setiap kali. Template cookiecutter-data-science membuat kerangka seluruh struktur dengan satu perintah.
# pip install cookiecutter
# cookiecutter -c v1 https://github.com/drivendata/cookiecutter-data-science
# Answer a few prompts -> full project tree createdPemeriksaan Singkat: Di Mana Data Mentah Disimpan
Anda mengunduh CSV asli dari penyedia data.
Ringkasan: Struktur Proyek
Anda telah mempelajari tata letak proyek AI profesional:
data/raw(tidak dapat diubah),data/processeduntuk berbagai tahapnotebooks/untuk eksplorasi,src/featuresdansrc/modelsuntuk kode yang dapat digunakan ulangmodels/untuk artefak,reports/untuk keluaran- Konfigurasi, dependensi, README, dan .gitignore di direktori akar
- cookiecutter-data-science untuk membuat kerangkanya secara instan
Selanjutnya: menggunakan Git secara efektif pada proyek AI.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Struktur Direktori Proyek Kecerdasan Buatan Profesional” gratis?
Ya — teks lengkap “Struktur Direktori Proyek Kecerdasan Buatan Profesional” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Learn AI with Python, upgrade ke CoddyKit PRO. Kursus Learn AI with Python mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Struktur Direktori Proyek Kecerdasan Buatan Profesional”?
Tata letak data/, notebooks/, src/, models/, tests/, serta pola cookiecutter-data-science. Kamu berlatih Learn AI with Python dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Learn AI with Python?
Tidak diperlukan pengalaman sebelumnya. Learn AI with Python di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Struktur Direktori Proyek Kecerdasan Buatan Profesional” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Learn AI with Python ini?
Ya. Setiap pelajaran Learn AI with Python menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Struktur Direktori Proyek Kecerdasan Buatan Profesional
- Git untuk Proyek Kecerdasan Buatan
- Reproduktibilitas: Seed, Konfigurasi, dan Lingkungan
- Praktik Terbaik Jupyter Notebooks