0Pricing
CUDA Academy · Урок

printf внутри ядра

Просматривайте вывод потоков устройства.

«printf внутри ядра» — бесплатный урок CUDA Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения CUDA Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс CUDA Academy содержит 4 уроков всего.

Печать с GPU

Как ни удивительно, прямо внутри ядра можно вызвать printf. Это самый простой способ заглянуть в работу потоков. 👀

__global__ void hi() {
    printf("Hello from the GPU\n");
}

Печатает каждый поток

Помните: ядро выполняется в каждом потоке, поэтому одна строка printf срабатывает один раз для каждого потока. Запустите 256 потоков — и получите 256 строк.

hi<<<1, 256>>>(); // 256 hellos

Определяйте каждый поток

Включите threadIdx в сообщение, чтобы различать потоки. Иначе вывод превратится в стену одинаковых строк.

printf("thread %d\n", threadIdx.x);

Порядок вывода не фиксирован

Потоки выполняются параллельно, поэтому порядок вывода непредсказуем. Не рассчитывайте, что строки будут поступать в порядке индексов.

Строки формата работают

Устройство поддерживает в printf обычные спецификаторы формата, такие как %d, %f и %s. Это почти так же, как printf на хосте.

printf("i=%d val=%f\n", i, x[i]);

Вывод поступает в буфер

Вывод с устройства сначала помещается в буфер GPU, а позднее отправляется в консоль, не сразу при выполнении printf. Это нормально.

Чтобы увидеть вывод, нужно подождать

Поскольку запуск асинхронный, печать появится только после завершения работы GPU. Вызовите cudaDeviceSynchronize, чтобы сбросить буфер.

hi<<<1, 4>>>();
cudaDeviceSynchronize();

Ограничивайте интенсивную печать

Печать из миллионов потоков переполняет буфер. Ограничьте её так, чтобы печатал только поток 0 или лишь несколько потоков.

if (threadIdx.x == 0) printf("block done\n");

Отлично подходит для быстрой отладки

printf — ваш самый быстрый инструмент отладки: добавьте его, чтобы проверить индекс или значение, подтвердите ошибку, а затем удалите.

printf("i=%d should be < n=%d\n", i, n);

Это замедляет ядра

Интенсивная печать сильно ухудшает производительность. Используйте её для поиска проблемы, а затем удалите до измерения настоящей скорости.

Старые GPU могут отличаться

Для printf на устройстве требуется достаточно современная вычислительная возможность (2.0 и выше). Почти все современные GPU поддерживают её без проблем.

Быстрая проверка

Проверим, что вы знаете о printf на устройстве.

Итоги: printf в ядре

Используйте printf, чтобы заглянуть внутрь потоков, добавляйте threadIdx для их различения, синхронизируйтесь для сброса буфера и удаляйте printf перед измерением времени. Полезный инструмент! 🎉

Часто задаваемые вопросы

Урок «printf внутри ядра» бесплатный?

Да — полный текст урока «printf внутри ядра» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс CUDA Academy, подпишись на CoddyKit PRO. Курс CUDA Academy содержит 4 уроков всего.

Чему я научусь в уроке «printf внутри ядра»?

Просматривайте вывод потоков устройства. Ты практикуешь CUDA Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать CUDA Academy?

Предыдущий опыт не требуется. CUDA Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.

Сколько времени занимает урок «printf внутри ядра»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке CUDA Academy?

Да. Каждый урок CUDA Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Анатомия ядра
  2. Запуск с тройными угловыми скобками
  3. printf внутри ядра
  4. Объяснение cudaDeviceSynchronize
← Назад к CUDA Academy