UTF-8과 문자
유니코드 처리
UTF-8과 문자은(는) CoddyKit의 무료 Learn Rust Coding 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Learn Rust Coding 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Learn Rust Coding 강의에는 총 4개의 강의가 포함되어 있습니다.
Rust 문자열은 UTF-8입니다
모든 Rust String과 &str은 UTF-8로 인코딩됩니다. 따라서 ASCII뿐 아니라 모든 유니코드 문자를 텍스트에 포함할 수 있습니다.
fn main() {
let s = String::from("caf\u{e9}");
println!("{}", s);
}UTF-8이란 무엇인가요
UTF-8은 각 유니코드 문자를 1~4개의 바이트로 인코딩합니다. ASCII 문자는 1바이트를 사용하고, 악센트가 있는 문자와 이모지는 더 많은 바이트를 사용합니다.
fn main() {
let ascii = "A"; // 1 byte
let accent = "\u{e9}"; // 2 bytes (e-acute)
println!("{} bytes vs {} bytes", ascii.len(), accent.len());
}바이트와 문자
멀티바이트 인코딩을 사용하므로 len()은 바이트 수를 반환하며, 문자 수는 이보다 적을 수 있습니다.
fn main() {
let s = "caf\u{e9}";
println!("bytes {}", s.len());
println!("chars {}", s.chars().count());
}char 타입은 유니코드입니다
Rust의 char는 모든 유니코드 스칼라 값을 저장할 수 있는 4바이트 값이므로, 단일 바이트보다 훨씬 많은 정보를 표현할 수 있습니다.
fn main() {
let letter = 'Z';
let accented = '\u{f1}'; // n with tilde
println!("{} {}", letter, accented);
}문자 반복하기
chars()를 사용하면 문자를 기준으로 텍스트를 순회할 수 있습니다. 멀티바이트 문자도 올바르게 처리합니다.
fn main() {
let s = "a\u{e9}z";
for c in s.chars() {
println!("{}", c);
}
}숫자로 인덱싱할 수 없는 이유
Rust에서는 문자열에 대해 s[0]을 사용할 수 없습니다. 문자마다 바이트 크기가 다르므로 단일 숫자로 인덱싱하면 의미가 모호하고 안전하지 않기 때문입니다.
fn main() {
let s = "hello";
// let c = s[0]; // error: cannot index a str
let first = s.chars().next().unwrap();
println!("{}", first);
}nth 문자 가져오기
위치로 문자를 가져오려면 반복자 메서드 nth를 사용하세요. Option을 반환합니다.
fn main() {
let s = "abcdef";
let third = s.chars().nth(2);
println!("{:?}", third);
}바이트 반복하기
원시 바이트가 꼭 필요할 때는 bytes()를 사용하세요. 이 메서드는 u8 값을 생성합니다.
fn main() {
let s = "AB";
for b in s.bytes() {
println!("{}", b);
}
}바이트 경계에서 슬라이스하기
문자열 슬라이스는 바이트 인덱스를 사용합니다. 슬라이스의 시작과 끝은 유효한 문자 경계에 있어야 하며, 그렇지 않으면 프로그램이 패닉을 일으킵니다.
fn main() {
let s = "hello";
let part = &s[0..3]; // valid ASCII boundary
println!("{}", part);
}char 메서드
char 타입에는 is_alphabetic, is_numeric, to_uppercase 같은 편리한 메서드가 있습니다.
fn main() {
let c = 'k';
println!("alpha {} numeric {}", c.is_alphabetic(), c.is_numeric());
println!("upper {}", c.to_uppercase());
}특정 문자 수 세기
chars와 filter를 결합하면 조건에 맞는 문자의 수를 셀 수 있습니다.
fn main() {
let s = "banana";
let a_count = s.chars().filter(|&c| c == 'a').count();
println!("a appears {} times", a_count);
}빠른 확인
문자열 길이가 예상과 다를 수 있는 이유를 떠올려 보세요.
복습
Rust의 UTF-8과 chars:
- 문자열은 UTF-8이며, 문자는 1~4바이트를 사용합니다.
len()은 바이트 수를 제공하고,chars().count()는 문자 수를 제공합니다.- 문자열을 숫자로 인덱싱할 수 없으므로
chars()또는nth를 사용하세요. - 슬라이스는 문자 경계에 맞아야 합니다.
fn main() {
let s = "sm\u{ee}le";
println!("bytes {} chars {}", s.len(), s.chars().count());
for c in s.chars() {
print!("{} ", c);
}
println!();
}자주 묻는 질문
“UTF-8과 문자” 강의는 무료인가요?
네 — “UTF-8과 문자” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Learn Rust Coding 강의 전체를 잠금 해제할 수 있습니다. Learn Rust Coding 강의에는 총 4개의 강의가 포함되어 있습니다.
“UTF-8과 문자”에서 뭘 배우나요?
유니코드 처리 브라우저에서 직접 실행하는 실습 코드로 Learn Rust Coding을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Learn Rust Coding을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Learn Rust Coding은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“UTF-8과 문자” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Learn Rust Coding 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Learn Rust Coding 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- String과 &str 비교
- 슬라이스
- 문자열 메서드
- UTF-8과 문자