0Pricing
R Academy · 강의

xgboost를 활용한 그래디언트 부스팅

xgboost 매개변수, 조기 중단 및 학습률 일정을 설정합니다.

xgboost를 활용한 그래디언트 부스팅은(는) CoddyKit의 무료 R Academy 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 R Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. R Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

그래디언트 부스팅이란 무엇입니까?

그래디언트 부스팅은 앙상블을 순차적으로 구축합니다. 새로 추가되는 각 트리는 손실 함수의 음의 그래디언트에 맞춰 학습함으로써 이전 앙상블의 잔차 오차를 보정합니다. 트리를 병렬로 학습하는 랜덤 포레스트와 달리, 부스팅은 한 번에 하나씩 트리를 학습하며 각 트리가 이전 트리의 실수에서 학습합니다.

library(xgboost)

# XGBoost expects data in a special matrix format
# We'll build a simple example step by step
cat('XGBoost version:', packageVersion('xgboost'))

# Key concept: each tree reduces the ensemble error
# Final prediction = sum of all tree predictions

xgb.DMatrix()

xgb.DMatrix(data, label)은 XGBoost의 최적화된 내부 데이터 형식입니다. 특성 행렬과 레이블 벡터를 함께 저장하여 메모리를 효율적으로 사용하면서 빠르게 계산할 수 있습니다. 학습하기 전에 항상 데이터를 DMatrix로 변환하십시오.

library(xgboost)
library(MASS)

X_train <- as.matrix(Boston[1:400, -14])  # features
y_train <- Boston[1:400, 14]              # medv (target)

X_test  <- as.matrix(Boston[401:506, -14])
y_test  <- Boston[401:506, 14]

dtrain <- xgb.DMatrix(data = X_train, label = y_train)
dtest  <- xgb.DMatrix(data = X_test,  label = y_test)

cat('DMatrix rows:', nrow(dtrain))

xgboost() — 기본 학습

xgboost(data, nrounds, eta, max_depth, objective)는 모델을 학습합니다. 주요 매개변수는 eta(학습률, 작을수록 더 견고하지만 느림), max_depth(트리 깊이, 모델 복잡도 제어), nrounds(트리 수)입니다.

params <- list(
  objective  = 'reg:squarederror',
  eta        = 0.1,     # learning rate
  max_depth  = 6,       # tree depth
  subsample  = 0.8,     # row subsampling
  colsample_bytree = 0.8  # column subsampling
)

set.seed(42)
model <- xgboost(
  data    = dtrain,
  params  = params,
  nrounds = 100,
  verbose = 0
)

cat('Model trained with', model$niter, 'rounds')

Watchlist — 검증 손실 모니터링

watchlist 인수는 이름이 지정된 DMatrix 객체 목록을 받습니다. XGBoost는 각 부스팅 라운드가 끝날 때마다 목록에 포함된 각 데이터 세트의 손실을 계산하고 출력합니다. 이를 사용하여 학습 손실과 검증 손실을 추적하고 과적합이 시작되는 시점을 감지할 수 있습니다.

watchlist <- list(train = dtrain, eval = dtest)

model <- xgb.train(
  params    = params,
  data      = dtrain,
  nrounds   = 200,
  watchlist = watchlist,
  verbose   = 1
)

# The log shows train-rmse and eval-rmse per round
# Watch for eval-rmse increasing (overfitting signal)

early_stopping_rounds

early_stopping_rounds = 20은 검증 지표가 20라운드 연속으로 개선되지 않으면 학습을 중지합니다. 이를 통해 최적의 트리 수를 자동으로 찾아 철저한 수동 조정 없이 과소적합과 과적합을 모두 방지할 수 있습니다.

model <- xgb.train(
  params              = params,
  data                = dtrain,
  nrounds             = 1000,      # max rounds
  watchlist           = list(train = dtrain, eval = dtest),
  early_stopping_rounds = 20,      # stop if no improvement
  print_every_n       = 50,
  verbose             = 1
)

cat('Best iteration:', model$best_iteration)
cat('Best eval RMSE:', model$best_score)

이진 분류

이진 분류에서는 예측 확률을 출력하는 objective = 'binary:logistic'을 사용합니다. 레이블은 0/1 numeric이어야 합니다. eval_metric 매개변수를 사용하여 AUC 또는 로그 손실로 평가합니다.

# Binary classification example
library(MASS)
Pima <- MASS::Pima.tr

X_cl <- as.matrix(Pima[, -8])
y_cl <- as.numeric(Pima$type) - 1  # factor to 0/1

dt_cl <- xgb.DMatrix(data = X_cl, label = y_cl)

mod_cl <- xgboost(
  data       = dt_cl,
  objective  = 'binary:logistic',
  eval_metric = 'auc',
  eta        = 0.05,
  max_depth  = 4,
  nrounds    = 100,
  verbose    = 0
)

예측

predict(model, dtest)는 분류에서는 확률을, 회귀에서는 실수값 예측을 반환합니다. 분류 작업에서 확률을 클래스 레이블로 변환하려면 0.5를 임계값으로 적용합니다.

# Regression predictions
reg_preds <- predict(model, dtest)
rmse <- sqrt(mean((reg_preds - y_test)^2))
cat('Test RMSE:', round(rmse, 3))

# Classification predictions
prob_preds  <- predict(mod_cl, dt_cl)
class_preds <- ifelse(prob_preds > 0.5, 1, 0)
accuracy <- mean(class_preds == y_cl)
cat('Training Accuracy:', round(accuracy, 3))

xgb.cv() — 교차 검증

xgb.cv(params, data, nrounds, nfold)는 XGBoost 내부에서 k-겹 교차 검증을 실행합니다. XGBoost가 폴드를 내부적으로 처리하므로 rsample을 사용하는 것보다 빠릅니다. 출력에는 각 라운드별 지표의 평균과 SD가 표시됩니다.

cv_result <- xgb.cv(
  params    = params,
  data      = dtrain,
  nrounds   = 200,
  nfold     = 5,
  early_stopping_rounds = 15,
  print_every_n = 20,
  verbose   = 1
)

# Best nrounds from CV
best_nrounds <- cv_result$best_iteration
cat('Optimal nrounds:', best_nrounds)

# CV RMSE at best iteration
cat('CV RMSE:', cv_result$evaluation_log[best_nrounds, 'test_rmse_mean'][[1]])

주요 하이퍼파라미터

영향이 가장 큰 XGBoost 하이퍼파라미터는 다음과 같습니다.

  • eta: 학습률(0.01~0.3)입니다. 낮을수록 더 많은 트리가 필요하지만 더 견고합니다.
  • max_depth: 트리 깊이(3~10)입니다. 클수록 더 복잡해지고 더 빠르게 과적합됩니다.
  • subsample: 트리당 행 비율(0.5~1.0)입니다. 과적합을 줄입니다.
  • colsample_bytree: 트리당 특성 비율(0.5~1.0)입니다.
  • lambda: 리프 가중치에 적용되는 L2 정규화입니다.
  • alpha: 리프 가중치에 적용되는 L1 정규화입니다.
params_tuned <- list(
  objective         = 'reg:squarederror',
  eta               = 0.05,
  max_depth         = 5,
  subsample         = 0.75,
  colsample_bytree  = 0.75,
  lambda            = 1.0,    # L2 regularization
  alpha             = 0.1,    # L1 regularization
  min_child_weight  = 3       # min samples in leaf
)

model_tuned <- xgboost(
  data = dtrain, params = params_tuned,
  nrounds = best_nrounds, verbose = 0
)

모델 저장 및 불러오기

XGBoost 모델은 xgb.save(model, 'model.xgb')를 사용하여 이진 형식으로 디스크에 저장하고, xgb.load('model.xgb')로 다시 불러올 수 있습니다. 이는 운영 환경에 배포할 때 권장되는 형식이며 비트 단위로 정확한 재현성을 보장합니다.

# Save model
xgb.save(model, '/tmp/xgb_boston.xgb')

# Reload and predict
loaded_model <- xgb.load('/tmp/xgb_boston.xgb')
new_preds <- predict(loaded_model, dtest)

# Verify predictions match
all.equal(reg_preds, new_preds)  # TRUE

다중 클래스 분류

다중 클래스 문제에서는 objective = 'multi:softprob'를 사용하고 num_class를 클래스 수로 설정합니다. 레이블은 0부터 시작하는 정수여야 합니다. 출력은 각 클래스에 대한 확률 행렬입니다.

X_mc <- as.matrix(iris[, -5])
y_mc <- as.integer(iris$Species) - 1  # 0, 1, 2

dt_mc <- xgb.DMatrix(data = X_mc, label = y_mc)

params_mc <- list(
  objective  = 'multi:softprob',
  num_class  = 3,
  eta        = 0.1,
  max_depth  = 3
)

mod_mc <- xgboost(
  data = dt_mc, params = params_mc,
  nrounds = 50, verbose = 0
)

# Predictions: matrix of shape (n, num_class)
prob_matrix <- matrix(predict(mod_mc, dt_mc), ncol = 3, byrow = TRUE)
head(prob_matrix)

빠른 확인

xgb.train()에서 early_stopping_rounds = 20을 설정하는 목적은 무엇입니까?

XGBoost 복습

XGBoost를 사용한 그래디언트 부스팅에서 기억할 핵심 내용:

  • xgb.DMatrix(data, label)은 XGBoost의 최적화된 데이터 형식을 생성합니다.
  • 주요 매개변수는 eta(학습률), max_depth, subsample, colsample_bytree입니다.
  • watchlist는 라운드별 학습 손실과 검증 손실을 모니터링합니다.
  • early_stopping_rounds는 최적의 트리 수를 자동으로 찾습니다.
  • xgb.cv()는 빠른 하이퍼파라미터 탐색을 위해 XGBoost 내부에서 k-겹 CV를 실행합니다.
  • 이진 분류에는 objective = 'binary:logistic'을, 다중 클래스 분류에는 'multi:softprob'를 사용합니다.
  • xgb.save() 및 xgb.load()로 모델을 저장하고 불러옵니다.
# Production XGBoost pipeline
dtrain <- xgb.DMatrix(data = X_train, label = y_train)
dtest  <- xgb.DMatrix(data = X_test,  label = y_test)

params <- list(objective = 'reg:squarederror',
               eta = 0.05, max_depth = 5, subsample = 0.8)

cv  <- xgb.cv(params, dtrain, nrounds = 500, nfold = 5,
              early_stopping_rounds = 20, verbose = 0)

model <- xgboost(data = dtrain, params = params,
                 nrounds = cv$best_iteration, verbose = 0)

preds <- predict(model, dtest)
cat('RMSE:', sqrt(mean((preds - y_test)^2)))

자주 묻는 질문

“xgboost를 활용한 그래디언트 부스팅” 강의는 무료인가요?

네 — “xgboost를 활용한 그래디언트 부스팅” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 R Academy 강의 전체를 잠금 해제할 수 있습니다. R Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“xgboost를 활용한 그래디언트 부스팅”에서 뭘 배우나요?

xgboost 매개변수, 조기 중단 및 학습률 일정을 설정합니다. 브라우저에서 직접 실행하는 실습 코드로 R Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

R Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 R Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.

“xgboost를 활용한 그래디언트 부스팅” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 R Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 R Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 의사결정나무: 앙상블의 기초
  2. ranger로 랜덤 포레스트 만들기
  3. xgboost를 활용한 그래디언트 부스팅
  4. 특성 중요도와 모델 해석
← R Academy(으)로 돌아가기