Профилирование и настройка задержки предсказаний
Используйте perf_analyzer, чтобы найти оптимальный баланс
«Профилирование и настройка задержки предсказаний» — бесплатный урок MLOps Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения MLOps Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс MLOps Academy содержит 4 уроков всего.
Настраивайте по результатам измерений
Невозможно настроить то, что Вы не измеряете. Перед изменением параметров получите реальные значения задержки и пропускной способности при надёжной рабочей нагрузке. 📏
Знакомство с perf_analyzer
В состав Triton входит perf_analyzer — инструмент, который отправляет модели множество запросов и сообщает задержку и пропускную способность, чтобы Вы могли сравнивать конфигурации.
Запуск простого теста
Вы указываете perf_analyzer модель, после чего он отправляет синтетические запросы и выводит количество инференсов в секунду и разбивку задержки.
perf_analyzer -m my_modelПеребор уровней параллелизма
Самый полезный флаг перебирает значения параллелизма — количества запросов, выполняющихся одновременно. Это показывает, как меняются пропускная способность и задержка при росте нагрузки.
perf_analyzer -m my_model --concurrency-range 1:8Читайте график
По мере роста параллелизма пропускная способность увеличивается, а затем выравнивается, тогда как задержка продолжает расти. Точка перегиба этой кривой — Ваш практический рабочий режим.
Используйте процентили
Средние значения скрывают проблемы. Следите за задержкой p95 — значением, которое превышают 95 процентов запросов, поскольку именно высокую задержку в хвосте распределения ощущают пользователи.
Настройка задержки в очереди
Если задержка слишком велика, уменьшите max_queue_delay_microseconds. Если при высокой нагрузке пропускная способность слишком мала, увеличьте его, чтобы формировать более полные пакеты.
Настройка экземпляров
Если GPU используется недостаточно, добавьте экземпляр. Если памяти мало или обработка останавливается, удалите один экземпляр. Меняйте только один параметр за раз и повторяйте измерения.
Меняйте по одному параметру
Настройка — это цикл, а не один резкий шаг. Измените один параметр, снова запустите perf_analyzer, сравните результаты и сохраните изменение только в том случае, если показатели действительно улучшились.
Задайте ограничение по задержке
Сначала определите свой бюджет, например p95 менее 50 мс. Затем увеличивайте размер пакета и количество экземпляров настолько, насколько возможно, не выходя за этот предел.
Учитывайте весь путь
Показатели сервера не дают полной картины. Сетевые переходы и код клиента добавляют время, поэтому также измеряйте задержку от начала до конца — от места, где находится пользователь.
Быстрая проверка
Почему при настройке следует предпочитать задержку p95 средней задержке?
Повторение
Вы использовали perf_analyzer для перебора уровней параллелизма, изучили кривую зависимости пропускной способности от задержки по p95 и настроили задержку в очереди и количество экземпляров в пределах заданного бюджета, изменяя по одному параметру за раз. 🙌
Изучай Python с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 30
- Уроки
- 120
Часто задаваемые вопросы
Урок «Профилирование и настройка задержки предсказаний» бесплатный?
Да — полный текст урока «Профилирование и настройка задержки предсказаний» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс MLOps Academy, подпишись на CoddyKit PRO. Курс MLOps Academy содержит 4 уроков всего.
Чему я научусь в уроке «Профилирование и настройка задержки предсказаний»?
Используйте perf_analyzer, чтобы найти оптимальный баланс Ты практикуешь MLOps Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать MLOps Academy?
Предыдущий опыт не требуется. MLOps Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.
Сколько времени занимает урок «Профилирование и настройка задержки предсказаний»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке MLOps Academy?
Да. Каждый урок MLOps Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему GPU требуют пакетной обработки
- Настройка динамической пакетной обработки в Triton
- Запуск нескольких экземпляров модели на одном GPU
- Профилирование и настройка задержки предсказаний