Конвейер с двойной буферизацией
Разбивайте данные на части, чтобы GPU не простаивал.
«Конвейер с двойной буферизацией» — бесплатный урок CUDA Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения CUDA Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс CUDA Academy содержит 4 уроков всего.
Проблема простаивающего GPU
Сначала скопируйте огромный массив, затем запустите ядро, а после этого скопируйте данные обратно. Во время каждого копирования GPU простаивает, а во время вычислений простаивают механизмы передачи.
Разделите работу
Начните с разделения одного огромного массива на небольшие части. Каждую часть можно копировать и обрабатывать отдельно, что открывает возможность перекрытия операций.
Два буфера, два потока
Двойная буферизация использует два буфера устройства и два потока. Пока поток A вычисляет одну часть, поток B копирует следующую.
Перекрывайте копирование и вычисления
Секрет заключается в параллелизме: передача и ядро одновременно работают с разными частями. Время передачи скрывается за полезными вычислениями.
Требуется закреплённая память
Это работает только в том случае, если данные хоста находятся в закреплённой памяти. Буферы со страницами, которые можно выгружать, вынуждают выполнять блокирующее копирование, и весь конвейер снова становится последовательным.
Цикл конвейера
Вы перебираете части и на каждом шаге выполняете асинхронное копирование данных на устройство, запускаете ядро и асинхронно копируете данные обратно — всё в одном потоке.
cudaMemcpyAsync(d_in, h_in + off, csz, H2D, s);
proc<<<g, b, 0, s>>>(d_in, d_out);
cudaMemcpyAsync(h_out + off, d_out, csz, D2H, s);Чередуйте потоки
Назначайте каждую часть потоку, чередуя их. Чётные части отправляйте в поток 0, нечётные — в поток 1, чтобы соседние операции корректно перекрывались.
cudaStream_t s = streams[i % 2];Почему достаточно двух
Два потока уже позволяют перекрыть копирование и вычисления. Дополнительные буферы увеличивают глубину, но дают всё меньший выигрыш и требуют больше памяти, поэтому начните с двух.
Опустошите очереди в конце
После постановки всех частей в очередь дождитесь завершения всей работы, прежде чем читать результаты. Простая функция cudaDeviceSynchronize сразу опустошает все потоки.
cudaDeviceSynchronize();Ускорение
Когда копирование скрыто за вычислениями, общее время приближается к длительности только более долгой из двух операций, а не к их сумме. В этом и заключается настоящий выигрыш. 🚀
Когда это особенно эффективно
Двойная буферизация особенно эффективна, когда время передачи и время вычислений примерно сбалансированы. Если одна из операций существенно дольше другой, сначала сосредоточьтесь на её ускорении.
Быстрая проверка
Каково главное преимущество конвейера с двойной буферизацией?
Итоги
Разделите данные на части, используйте два закреплённых буфера и два потока, а затем перекрывайте копирование с вычислениями. Синхронизируйтесь в конце и наблюдайте, как время передачи исчезает. 🎉
Изучай C++ с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 30
- Уроки
- 120
Часто задаваемые вопросы
Урок «Конвейер с двойной буферизацией» бесплатный?
Да — полный текст урока «Конвейер с двойной буферизацией» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс CUDA Academy, подпишись на CoddyKit PRO. Курс CUDA Academy содержит 4 уроков всего.
Чему я научусь в уроке «Конвейер с двойной буферизацией»?
Разбивайте данные на части, чтобы GPU не простаивал. Ты практикуешь CUDA Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать CUDA Academy?
Предыдущий опыт не требуется. CUDA Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.
Сколько времени занимает урок «Конвейер с двойной буферизацией»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке CUDA Academy?
Да. Каждый урок CUDA Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему страничная память медленная
- Закреплённая память с помощью cudaMallocHost
- cudaMemcpyAsync в потоке выполнения
- Конвейер с двойной буферизацией