CUDA Academy · Урок

Конвейер с двойной буферизацией

Разбивайте данные на части, чтобы GPU не простаивал.

Урок 4 из 413 шагов

«Конвейер с двойной буферизацией» — бесплатный урок CUDA Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения CUDA Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс CUDA Academy содержит 4 уроков всего.

Проблема простаивающего GPU

Сначала скопируйте огромный массив, затем запустите ядро, а после этого скопируйте данные обратно. Во время каждого копирования GPU простаивает, а во время вычислений простаивают механизмы передачи.

Разделите работу

Начните с разделения одного огромного массива на небольшие части. Каждую часть можно копировать и обрабатывать отдельно, что открывает возможность перекрытия операций.

Два буфера, два потока

Двойная буферизация использует два буфера устройства и два потока. Пока поток A вычисляет одну часть, поток B копирует следующую.

Перекрывайте копирование и вычисления

Секрет заключается в параллелизме: передача и ядро одновременно работают с разными частями. Время передачи скрывается за полезными вычислениями.

Требуется закреплённая память

Это работает только в том случае, если данные хоста находятся в закреплённой памяти. Буферы со страницами, которые можно выгружать, вынуждают выполнять блокирующее копирование, и весь конвейер снова становится последовательным.

Цикл конвейера

Вы перебираете части и на каждом шаге выполняете асинхронное копирование данных на устройство, запускаете ядро и асинхронно копируете данные обратно — всё в одном потоке.

cudaMemcpyAsync(d_in, h_in + off, csz, H2D, s);
proc<<<g, b, 0, s>>>(d_in, d_out);
cudaMemcpyAsync(h_out + off, d_out, csz, D2H, s);

Чередуйте потоки

Назначайте каждую часть потоку, чередуя их. Чётные части отправляйте в поток 0, нечётные — в поток 1, чтобы соседние операции корректно перекрывались.

cudaStream_t s = streams[i % 2];

Почему достаточно двух

Два потока уже позволяют перекрыть копирование и вычисления. Дополнительные буферы увеличивают глубину, но дают всё меньший выигрыш и требуют больше памяти, поэтому начните с двух.

Опустошите очереди в конце

После постановки всех частей в очередь дождитесь завершения всей работы, прежде чем читать результаты. Простая функция cudaDeviceSynchronize сразу опустошает все потоки.

cudaDeviceSynchronize();

Ускорение

Когда копирование скрыто за вычислениями, общее время приближается к длительности только более долгой из двух операций, а не к их сумме. В этом и заключается настоящий выигрыш. 🚀

Когда это особенно эффективно

Двойная буферизация особенно эффективна, когда время передачи и время вычислений примерно сбалансированы. Если одна из операций существенно дольше другой, сначала сосредоточьтесь на её ускорении.

Быстрая проверка

Каково главное преимущество конвейера с двойной буферизацией?

Итоги

Разделите данные на части, используйте два закреплённых буфера и два потока, а затем перекрывайте копирование с вычислениями. Синхронизируйтесь в конце и наблюдайте, как время передачи исчезает. 🎉

Можно начать бесплатно

Изучай C++ с ИИ-репетитором — бесплатно

Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.

Курсы
30
Уроки
120

Часто задаваемые вопросы

Урок «Конвейер с двойной буферизацией» бесплатный?

Да — полный текст урока «Конвейер с двойной буферизацией» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс CUDA Academy, подпишись на CoddyKit PRO. Курс CUDA Academy содержит 4 уроков всего.

Чему я научусь в уроке «Конвейер с двойной буферизацией»?

Разбивайте данные на части, чтобы GPU не простаивал. Ты практикуешь CUDA Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать CUDA Academy?

Предыдущий опыт не требуется. CUDA Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Конвейер с двойной буферизацией»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке CUDA Academy?

Да. Каждый урок CUDA Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Почему страничная память медленная
  2. Закреплённая память с помощью cudaMallocHost
  3. cudaMemcpyAsync в потоке выполнения
  4. Конвейер с двойной буферизацией
← Назад к CUDA Academy