0Pricing
Learn AI with Python · 강의

인공지능 프로젝트를 위한 Git

git init, 데이터와 모델을 위한 .gitignore, 노트북 커밋, 데이터 버전 관리를 위한 DVC를 학습합니다.

인공지능 프로젝트를 위한 Git은(는) CoddyKit의 무료 Learn AI with Python 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Learn AI with Python 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.

인공지능 프로젝트에서의 깃

깃은 코드 변경 사항을 추적하므로 협업하고, 실수를 되돌리고, 변경 이력을 검토할 수 있습니다. 하지만 인공지능 프로젝트에는 한 가지 특성이 더 있습니다. 대용량 데이터 파일과 바이너리 모델은 깃에 저장하지 않아야 합니다.

이 단원에서는 적절한 .gitignore를 사용하고 데이터 버전 관리를 위해 DVC를 사용하는 방법을 다룹니다.

깃이 잘 추적하는 것

깃은 텍스트에 강합니다. 소스 코드, 구성 파일, 출력이 지워진 노트북, 문서 등을 효율적으로 처리하며 텍스트 파일의 변경 사항 비교를 저장합니다.

반면 대용량 바이너리는 잘 처리하지 못합니다. 모든 버전을 전체로 저장하므로 저장소가 영원히 비대해집니다.

데이터와 모델을 커밋하지 않는 이유

2 GB 데이터 세트나 500 MB 모델을 커밋하면 다음과 같은 문제가 생깁니다.

  • 저장소가 비대해져 모든 복제 작업이 느려집니다.
  • 의미 있게 변경 사항을 비교할 수 없습니다.
  • 삭제한 뒤에도 이력에 영원히 남습니다.

해결책은 깃에서 이를 무시하고 전용 도구로 버전 관리하는 것입니다.

.gitignore 파일

.gitignore에는 깃이 추적하지 않아야 할 패턴을 나열합니다. 프로젝트 루트에 만드세요. 각 줄은 글로브 패턴입니다.

# .gitignore
*.pkl
*.joblib
*.h5
data/raw/*
data/processed/*
models/*
__pycache__/
*.pyc
.ipynb_checkpoints/
.env

모델 및 캐시 파일 무시하기

인공지능 프로젝트에서 흔히 사용하는 무시 패턴은 다음과 같습니다.

  • *.pkl, *.joblib, *.h5 — 직렬화된 모델
  • __pycache__/, *.pyc — 파이썬 바이트코드
  • .ipynb_checkpoints/ — 주피터 자동 저장 파일
  • .env — 비밀 정보 및 응용 프로그램 인터페이스 키(절대 커밋하지 마세요!)

.gitkeep으로 빈 폴더 유지하기

깃은 빈 디렉터리를 무시합니다. 내용을 무시하면서 data/raw/를 저장소 구조에 유지하려면 빈 .gitkeep 파일과 부정 패턴을 추가합니다.

# .gitignore
data/raw/*
!data/raw/.gitkeep

DVC 소개

DVC(데이터 버전 관리)는 깃과 함께 대용량 데이터와 모델의 버전을 관리합니다. 깃은 작은 .dvc 포인터 파일을 추적하고, 실제 데이터는 원격 스토리지(S3, GCS 등)에 저장됩니다.

깃 저장소를 비대하게 만들지 않고도 재현 가능한 데이터 버전을 얻을 수 있습니다.

dvc init

기존 깃 저장소 안에서 DVC를 초기화합니다. 깃에 커밋할 .dvc/ 디렉터리와 구성을 만듭니다.

# in your git repo
dvc init
git add .dvc .gitignore
git commit -m "Initialize DVC"

dvc add — 데이터 추적하기

dvc add는 파일이나 폴더의 추적을 시작합니다. DVC는 데이터를 캐시로 옮기고 작은 .dvc 포인터 파일을 만듭니다. 데이터가 아니라 포인터를 깃에 커밋합니다.

dvc add data/raw/dataset.csv
# creates data/raw/dataset.csv.dvc
git add data/raw/dataset.csv.dvc data/raw/.gitignore
git commit -m "Track dataset with DVC"

dvc push 및 dvc pull

원격 저장소를 구성한 다음 dvc push로 데이터를 업로드하고, dvc pull로 현재 깃 커밋에 해당하는 버전을 다운로드합니다. 이것이 팀원들이 데이터를 공유하는 방법입니다.

dvc remote add -d storage s3://my-bucket/dvcstore
dvc push          # upload data to the remote

# teammate after git clone + git checkout:
dvc pull          # fetch the matching data version

팀 작업 흐름

깃과 DVC의 순환 과정은 코드 버전과 데이터 버전을 연결합니다.

  • 최신 코드와 .dvc 포인터를 가져오려면 git pull
  • 해당 데이터와 모델을 가져오려면 dvc pull
  • 작업한 다음 dvc add + git commit + dvc push

이전 커밋으로 전환한 뒤 dvc pull을 실행하면 해당 시점의 상태를 정확히 재현할 수 있습니다.

빠른 확인: 대용량 파일

프로젝트에 1 GB 학습 데이터 세트와 300 MB 모델 파일이 있습니다.

복습: 인공지능 프로젝트를 위한 깃

인공지능에 맞춘 버전 관리를 배웠습니다.

  • 텍스트(코드, 구성 파일, 노트북)에는 깃을 사용하고 대용량 바이너리에는 사용하지 않음
  • *.pkl, data/raw/*, __pycache__, .env를 위한 .gitignore
  • 빈 폴더를 보존하는 .gitkeep
  • DVC의 dvc init, dvc add, 데이터와 모델의 버전 관리를 위한 dvc push/pull
  • 깃과 DVC 작업 흐름으로 코드와 데이터를 동기화

다음 주제: 실험을 재현 가능하게 만들기입니다.

자주 묻는 질문

“인공지능 프로젝트를 위한 Git” 강의는 무료인가요?

네 — “인공지능 프로젝트를 위한 Git” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Learn AI with Python 강의 전체를 잠금 해제할 수 있습니다. Learn AI with Python 강의에는 총 4개의 강의가 포함되어 있습니다.

“인공지능 프로젝트를 위한 Git”에서 뭘 배우나요?

git init, 데이터와 모델을 위한 .gitignore, 노트북 커밋, 데이터 버전 관리를 위한 DVC를 학습합니다. 브라우저에서 직접 실행하는 실습 코드로 Learn AI with Python을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

Learn AI with Python을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 Learn AI with Python은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“인공지능 프로젝트를 위한 Git” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 Learn AI with Python 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 Learn AI with Python 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 전문적인 인공지능 프로젝트 디렉터리 구조
  2. 인공지능 프로젝트를 위한 Git
  3. 재현성: 시드, 구성, 환경
  4. Jupyter 노트북 모범 사례
← Learn AI with Python(으)로 돌아가기