추론 지연 시간 프로파일링하고 조정하기
perf_analyzer로 최적의 지점을 찾으세요.
추론 지연 시간 프로파일링하고 조정하기은(는) CoddyKit의 무료 MLOps Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 MLOps Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. MLOps Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
측정하며 조정하기
측정하지 않은 것은 조정할 수 없습니다. 설정을 변경하기 전에 신뢰할 수 있는 부하에서 실제 지연 시간과 처리량을 측정하십시오. 📏
perf_analyzer 알아보기
Triton에는 perf_analyzer가 포함되어 있습니다. 이 도구는 요청을 모델에 집중적으로 보내고 지연 시간과 처리량을 보고하므로 구성을 비교할 수 있습니다.
기본 테스트 실행하기
perf_analyzer에서 모델을 지정하면 합성 요청을 보낸 뒤 초당 추론 수와 지연 시간 분석 결과를 출력합니다.
perf_analyzer -m my_model동시성 범위 확인하기
가장 유용한 플래그는 동시성을 변화시키는 플래그입니다. 동시성은 처리 중인 요청 수를 뜻하며, 부하가 증가할 때 처리량과 지연 시간이 어떻게 변하는지 보여 줍니다.
perf_analyzer -m my_model --concurrency-range 1:8곡선 읽기
동시성이 증가하면 처리량은 오르다가 평평해지는 반면 지연 시간은 계속 늘어납니다. 이 곡선의 무릎 지점이 실용적인 운영 지점입니다.
백분위수 사용하기
평균은 문제를 감춥니다. 요청의 95%가 이 값보다 빠르게 처리되는 p95 지연 시간을 확인하십시오. 사용자가 실제로 체감하는 것은 꼬리 지연 시간이기 때문입니다.
대기열 지연 시간 조정하기
지연 시간이 너무 높으면 max_queue_delay_microseconds를 낮추십시오. 부하가 클 때 처리량이 너무 낮다면 값을 높여 더 가득 찬 배치를 구성하십시오.
인스턴스 조정하기
GPU 사용률이 낮으면 인스턴스를 추가하십시오. 메모리가 부족하거나 처리량이 정체되면 하나 줄이십시오. 한 번에 하나의 설정만 변경하고 다시 측정하십시오.
한 번에 하나만 변경하기
조정은 도약이 아니라 반복 과정입니다. 하나의 설정만 변경하고 perf_analyzer를 다시 실행한 뒤 결과를 비교하십시오. 수치가 실제로 개선된 경우에만 변경을 유지하십시오.
지연 시간 예산 설정하기
먼저 예산을 정하십시오. 예를 들어 p95를 50ms 미만으로 설정할 수 있습니다. 그런 다음 이 한도 안에서 배치 크기와 인스턴스 수를 가능한 한 높이십시오.
전체 경로 고려하기
서버 수치만으로는 전체 상황을 알 수 없습니다. 네트워크 구간과 클라이언트 코드도 시간을 추가하므로 사용자가 있는 위치에서 측정한 종단 간 지연 시간도 확인하십시오.
빠른 확인
조정할 때 평균 지연 시간보다 p95 지연 시간을 선호하는 이유는 무엇인가요?
복습
perf_analyzer로 동시성 범위를 확인하고 p95에서 처리량과 지연 시간 곡선을 읽었으며, 예산 안에서 한 번에 하나씩 변경해 대기열 지연 시간과 인스턴스를 조정했습니다. 🙌
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“추론 지연 시간 프로파일링하고 조정하기” 강의는 무료인가요?
네 — “추론 지연 시간 프로파일링하고 조정하기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 MLOps Academy 강의 전체를 잠금 해제할 수 있습니다. MLOps Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“추론 지연 시간 프로파일링하고 조정하기”에서 뭘 배우나요?
perf_analyzer로 최적의 지점을 찾으세요. 브라우저에서 직접 실행하는 실습 코드로 MLOps Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
MLOps Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 MLOps Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“추론 지연 시간 프로파일링하고 조정하기” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 MLOps Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 MLOps Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- GPU에 배칭이 필요한 이유
- Triton에서 동적 배칭 설정하기
- GPU당 여러 모델 인스턴스 실행하기
- 추론 지연 시간 프로파일링하고 조정하기