R Academy · Pelajaran

Menulis Model Stan dalam R

Tentukan blok data, parameter dan blok model dalam sintaks Stan.

Pelajaran 2 daripada 413 langkah

Menulis Model Stan dalam R ialah pelajaran R Academy percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran R Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus R Academy merangkumi sejumlah 4 pelajaran.

Apakah Stan?

Stan ialah bahasa pengaturcaraan kebarangkalian untuk pemodelan statistik Bayesian. RStan ialah antara muka R kepada Stan. Anda menulis model dalam bahasa Stan (seakan-akan C++), kemudian Stan menyusunnya menjadi kod C++ yang cekap untuk menjalankan pensampelan Hamiltonian Monte Carlo (HMC) bagi menghampiri posterior.

# Stan installation check
library(rstan)

# Check version
cat('RStan version:', as.character(packageVersion('rstan')), '\n')

# Enable parallel chains
options(mc.cores = parallel::detectCores())

# Reuse compiled models across sessions
rstan_options(auto_write = TRUE)

cat('Stan ready. Cores:', parallel::detectCores(), '\n')

Struktur Model Stan

Model Stan mempunyai sehingga enam blok bernama: data, transformed data, parameters, transformed parameters, model dan generated quantities. Tiga blok penting ialah data, parameters dan model.

library(rstan)

# Stan model as a character string in R
stan_code <- '
data {
  int<lower=0> N;       // number of observations
  vector[N] x;          // predictor
  vector[N] y;          // response
}
parameters {
  real alpha;           // intercept
  real beta;            // slope
  real<lower=0> sigma;  // noise (must be positive)
}
model {
  // Priors
  alpha ~ normal(0, 10);
  beta  ~ normal(0, 10);
  sigma ~ exponential(1);

  // Likelihood
  y ~ normal(alpha + beta * x, sigma);
}
'

cat('Stan model defined as a string in R\n')
cat('Blocks: data, parameters, model\n')

data{}: Mengisytiharkan Data Input

Blok data mengisytiharkan semua data luaran yang diterima oleh model daripada R. Jenisnya termasuk int, real, vector[N], matrix[M,N] dan array. Kekangan seperti <lower=0> diperiksa semasa masa jalan.

library(rstan)

# Comprehensive data block examples
data_block_examples <- '
data {
  // Scalars
  int<lower=1> N;               // at least 1 observation
  int<lower=2> K;               // at least 2 groups

  // Constrained scalars
  real<lower=0, upper=1> rate;  // probability

  // Vectors
  vector[N] y;                  // continuous response
  array[N] int<lower=0, upper=1> z;  // binary outcomes

  // Matrix
  matrix[N, K] X;               // design matrix

  // Integer array
  array[N] int group;           // group membership 1..K
}
'

cat(data_block_examples)

parameters{}: Jenis Parameter

Blok parameters mengisytiharkan perkara yang tidak diketahui yang akan diambil sampelnya oleh Stan. Kekangan dalam blok ini mentakrifkan ruang parameter: <lower=0> untuk kuantiti positif, <lower=0, upper=1> untuk kebarangkalian. Stan secara automatik menggunakan pembetulan Jakobian kebarangkalian log untuk parameter yang mempunyai kekangan.

library(rstan)

# Common parameter declarations
param_examples <- '
parameters {
  // Unconstrained
  real mu;                        // mean
  vector[K] beta;                 // regression coefficients

  // Positive (sigma, lambda, variance)
  real<lower=0> sigma;
  real<lower=0> lambda;

  // Probability
  real<lower=0, upper=1> theta;

  // Simplex (sums to 1, for mixture weights)
  simplex[K] pi;

  // Correlation matrix
  corr_matrix[K] Omega;

  // Cholesky factor of covariance
  cholesky_factor_cov[K] L_Sigma;
}
'
cat(param_examples)

model{}: Keutamaan dan Kebolehjadian

Blok model mengumpulkan posterior log melalui sintaks ~ (tilde). y ~ normal(mu, sigma) ialah bentuk ringkas untuk menambahkan log PDF Normal kepada target. Anda boleh menulis penambahan kebarangkalian log secara jelas dengan target += normal_lpdf(y | mu, sigma).

library(rstan)

model_block_example <- '
model {
  // --- Priors ---
  mu    ~ normal(0, 10);          // weakly informative
  sigma ~ cauchy(0, 2.5);         // half-Cauchy for scale
  beta  ~ normal(0, 1);           // standardised coefficients

  // --- Likelihood ---
  // Tilde notation (most common)
  y ~ normal(mu + X * beta, sigma);

  // Equivalent explicit notation:
  // target += normal_lpdf(y | mu + X * beta, sigma);

  // For loop (less common but valid)
  // for (i in 1:N)
  //   target += normal_lpdf(y[i] | mu, sigma);
}
'
cat(model_block_example)

Memadankan Model Normal Ringkas

Berikut ialah aliran kerja Stan minimum yang lengkap: takrifkan rentetan model, sediakan senarai data, panggil stan(), dan periksa hasil dengan print(). Stan menyusun model pada kali pertama dan menyimpannya untuk pelaksanaan seterusnya.

library(rstan)

# Stan model: estimate mean and SD of a normal distribution
normal_model <- '
data {
  int<lower=0> N;
  vector[N] y;
}
parameters {
  real mu;
  real<lower=0> sigma;
}
model {
  mu    ~ normal(0, 10);
  sigma ~ exponential(0.1);
  y     ~ normal(mu, sigma);
}
'

# Simulate data
set.seed(42)
y_data <- rnorm(50, mean = 5, sd = 2)

# Fit the model
fit <- stan(
  model_code = normal_model,
  data       = list(N = length(y_data), y = y_data),
  chains     = 2,
  iter       = 1000,
  warmup     = 500,
  refresh    = 0  # suppress iteration output
)

print(fit, pars = c('mu', 'sigma'))

Regresi Linear dalam Stan

Stan menjadikan regresi linear Bayesian mudah dilaksanakan: tentukan keutamaan normal pada pekali dan keutamaan eksponen atau separuh-Cauchy pada sigma. Posterior memberikan taburan ketidakpastian penuh bagi setiap pekali, bukan sekadar anggaran titik.

library(rstan)

lin_reg_model <- '
data {
  int<lower=0> N;
  vector[N] x;
  vector[N] y;
}
parameters {
  real alpha;
  real beta;
  real<lower=0> sigma;
}
model {
  alpha ~ normal(0, 10);
  beta  ~ normal(0, 10);
  sigma ~ exponential(1);
  y ~ normal(alpha + beta * x, sigma);
}
generated quantities {
  vector[N] y_rep;  // posterior predictive
  for (i in 1:N)
    y_rep[i] = normal_rng(alpha + beta * x[i], sigma);
}
'

set.seed(7)
n <- 80
x <- rnorm(n); y <- 2 + 3 * x + rnorm(n, 0, 1)

fit <- stan(model_code = lin_reg_model,
            data = list(N = n, x = x, y = y),
            chains = 2, iter = 1000, refresh = 0)
print(fit, pars = c('alpha', 'beta', 'sigma'))

Blok transformed parameters{}

Blok transformed parameters mengira kuantiti terbitan daripada parameter yang disampel. Kuantiti ini berguna untuk memparameterkan model dengan cara yang stabil dari segi berangka, contohnya penguraian Cholesky dan transformasi log, sambil mengekalkan kebolehfahaman parameter utama.

library(rstan)

# Model with transformed parameters
trans_param_example <- '
data {
  int<lower=0> N;
  array[N] int<lower=0> y;  // counts
}
parameters {
  real log_lambda;           // work in log space for stability
}
transformed parameters {
  real<lower=0> lambda;
  lambda = exp(log_lambda);  // transform back to original scale
}
model {
  log_lambda ~ normal(1, 2);  // prior on log scale
  y ~ poisson(lambda);
}
'

set.seed(42)
y_counts <- rpois(30, lambda = 5)

fit_poisson <- stan(
  model_code = trans_param_example,
  data       = list(N = length(y_counts), y = y_counts),
  chains     = 2, iter = 1000, refresh = 0
)
print(fit_poisson, pars = c('log_lambda', 'lambda'))

Blok generated quantities{}

Blok generated quantities dijalankan selepas pensampelan untuk mengira kuantiti tambahan: sampel ramalan posterior (y_rep), kebolehjadian log untuk LOO-CV, atau parameter yang diubah untuk ringkasan. Nilai di sini disampel daripada taburan ramalan posterior.

library(rstan)

# Use generated quantities for posterior predictive checks
model_with_gq <- '
data {
  int<lower=0> N;
  vector[N] y;
}
parameters {
  real mu;
  real<lower=0> sigma;
}
model {
  mu    ~ normal(0, 10);
  sigma ~ exponential(0.5);
  y     ~ normal(mu, sigma);
}
generated quantities {
  vector[N] y_rep;           // replicated datasets
  real mean_y_rep;           // mean of replicated data
  for (i in 1:N)
    y_rep[i] = normal_rng(mu, sigma);
  mean_y_rep = mean(y_rep);
}
'

set.seed(1)
y_obs <- rnorm(40, 3, 1.5)
fit <- stan(model_code = model_with_gq,
            data = list(N = length(y_obs), y = y_obs),
            chains = 2, iter = 1000, refresh = 0)
print(fit, pars = c('mu', 'sigma', 'mean_y_rep'))

Menghantar Data daripada R kepada Stan

Argumen data kepada stan() ialah senarai R bernama. Nama mesti sepadan tepat dengan nama pemboleh ubah yang diisytiharkan dalam blok data{} Stan. Vektor menjadi vector[N] Stan; integer menjadi int; matriks R menjadi matrix[M,N] Stan.

library(rstan)

# Data preparation: names must match Stan data block exactly
set.seed(42)
n <- 60
x1 <- rnorm(n)
x2 <- rnorm(n)
y  <- 1.5 + 2 * x1 - 0.8 * x2 + rnorm(n, 0, 0.5)

# Build the design matrix
X <- cbind(x1, x2)  # 60 x 2 matrix

# Named list passed to stan(data = ...)
stan_data <- list(
  N = n,          # int
  K = ncol(X),    # int
  X = X,          # matrix[N, K]
  y = y           # vector[N]
)

cat('Stan data list elements:\n')
for (nm in names(stan_data)) {
  cat(' ', nm, ': class =', class(stan_data[[nm]]),
      'dim =', paste(dim(stan_data[[nm]]), collapse = 'x'),
      '\n')
}

Melihat Model yang Disusun

Selepas pemadanan, gunakan print(fit) untuk melihat ringkasan posterior (min, se_mean, sd, kuantil, Rhat, n_eff) bagi semua parameter. Gunakan stan_plot(fit) untuk plot sela visual dan traceplot(fit) untuk menilai pencampuran rantai.

library(rstan)

# Reuse the simple normal model from scene 6
normal_model <- '
data { int<lower=0> N; vector[N] y; }
parameters { real mu; real<lower=0> sigma; }
model {
  mu ~ normal(0, 10);
  sigma ~ exponential(0.1);
  y ~ normal(mu, sigma);
}
'

set.seed(5)
fit <- stan(model_code = normal_model,
            data = list(N = 50, y = rnorm(50, 7, 3)),
            chains = 2, iter = 1000, refresh = 0)

# Detailed summary table
print(fit)

# Extract as data frame
posterior_df <- as.data.frame(fit)
cat('\nPosterior samples shape:', nrow(posterior_df),
    'rows x', ncol(posterior_df), 'cols\n')

Semakan Pantas

Dalam model Stan, anda mahu mengehadkan parameter supaya benar-benar positif, contohnya sisihan piawai. Pengisytiharan yang manakah betul?

Imbas Kembali: Menulis Model Stan

Inti pati utama:

  • Model Stan mempunyai tiga blok penting: data{}, parameters{}, model{}
  • Kekangan: <lower=0>, <upper=1>, <lower=0, upper=1> untuk kebarangkalian
  • Jenis: int, real, vector[N], matrix[M,N], simplex[K]
  • Blok model: gunakan sintaks tilde y ~ normal(mu, sigma) untuk keutamaan dan kebolehjadian
  • transformed parameters{} untuk kuantiti terbitan; generated quantities{} untuk selepas pensampelan
  • Hantar data sebagai senarai R bernama yang sepadan tepat dengan nama blok Stan
  • rstan_options(auto_write = TRUE) menyimpan model yang telah disusun
library(rstan)

# Stan model skeleton
model_skeleton <- '
data    { int N; vector[N] y; }
parameters { real mu; real<lower=0> sigma; }
model   { mu ~ normal(0,10); sigma ~ exponential(1); y ~ normal(mu, sigma); }
'
cat(model_skeleton)
cat('\nFit with: stan(model_code = model_skeleton, data = list(N=..., y=...), chains=4)\n')
Percuma untuk bermula

Pelajari R dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
43
Pelajaran
159

Soalan Lazim

Adakah pelajaran “Menulis Model Stan dalam R” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran R Academy, termasuk “Menulis Model Stan dalam R”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus R Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Menulis Model Stan dalam R”?

Tentukan blok data, parameter dan blok model dalam sintaks Stan. Anda berlatih R Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan R Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran R Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.

Berapa lamakah pelajaran “Menulis Model Stan dalam R” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran R Academy ini?

Ya. Setiap pelajaran R Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Pengenalan kepada Pemikiran Bayesian
  2. Menulis Model Stan dalam R
  3. Persampelan MCMC dan Diagnostik
  4. Semakan Ramalan Posterior
← Kembali ke R Academy