CUDA Academy · Урок

Перекрытие копирования и вычислений

Скрывайте передачи данных за выполнением ядер.

Урок 4 из 413 шагов

«Перекрытие копирования и вычислений» — бесплатный урок CUDA Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения CUDA Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс CUDA Academy содержит 4 уроков всего.

Главная идея

Настоящее ускорение достигается, когда две операции выполняются одновременно: копирование одного фрагмента данных, пока GPU вычисляет другой. 🔀

Раздельные аппаратные движки

У GPU есть отдельные движки копирования и вычислительные блоки. Перекрытие работает, потому что они действительно могут выполняться параллельно, а не просто чередоваться.

Требуется закреплённая память

Для асинхронного копирования требуется закреплённая память хоста, выделенная с помощью cudaMallocHost. Обычный выгружаемый malloc заставляет выполнять блокирующее копирование, которое нельзя перекрыть с другими операциями.

cudaMallocHost(&h_data, bytes);

Асинхронное копирование

Используйте cudaMemcpyAsync с потоком, чтобы передача сразу возвращала управление и добавлялась в очередь этого потока вместе с ядрами.

cudaMemcpyAsync(d_in, h_in, bytes, cudaMemcpyHostToDevice, s);

Разделите работу на фрагменты

Разделите массив на части и назначьте каждой части собственный поток. Пока поток 0 выполняет вычисления, поток 1 уже может выполнять копирование.

Копирование, вычисление, обратное копирование

Каждый фрагмент выполняет в своём потоке одни и те же три шага: загрузить входные данные, запустить ядро, выгрузить выходные данные — всё без блокировки хоста.

cudaMemcpyAsync(d, h, n, H2D, s);
k<<<g, b, 0, s>>>(d);
cudaMemcpyAsync(h, d, n, D2H, s);

Как возникает перекрытие

Поскольку фрагменты находятся в разных потоках, GPU может копировать второй фрагмент, продолжая вычислять первый. Временная шкала заполняется. 📊

Скрытие затрат PCIe

Передачи больше не увеличивают общее время: они скрываются за вычислениями. В идеале время выполнения сокращается примерно до большей из длительностей копирования и работы ядра.

Следите за потоком по умолчанию

Один случайный вызов потока по умолчанию в середине цикла снова может сериализовать всё выполнение. Связывайте каждую асинхронную операцию с настоящим потоком, отличным от потока по умолчанию.

Проверьте в профилировщике

Откройте Nsight Systems и найдите дорожки копирования и вычислений, которые перекрываются по времени. Наложенные занятые дорожки означают, что параллельность действительно работает.

Синхронизация в конце

После постановки всех фрагментов вызовите cudaDeviceSynchronize один раз, чтобы все потоки завершились до чтения итоговых результатов на хосте.

cudaDeviceSynchronize();

Быстрая проверка

Что требуется асинхронной передаче, чтобы перекрываться с вычислениями?

Итоги

Разделяя работу между потоками, используя закреплённую память и асинхронное копирование, Вы скрываете передачи за вычислениями и поддерживаете настоящую загрузку GPU. 🚀

Можно начать бесплатно

Изучай C++ с ИИ-репетитором — бесплатно

Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.

Курсы
30
Уроки
120

Часто задаваемые вопросы

Урок «Перекрытие копирования и вычислений» бесплатный?

Да — полный текст урока «Перекрытие копирования и вычислений» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс CUDA Academy, подпишись на CoddyKit PRO. Курс CUDA Academy содержит 4 уроков всего.

Чему я научусь в уроке «Перекрытие копирования и вычислений»?

Скрывайте передачи данных за выполнением ядер. Ты практикуешь CUDA Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать CUDA Academy?

Предыдущий опыт не требуется. CUDA Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Перекрытие копирования и вычислений»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке CUDA Academy?

Да. Каждый урок CUDA Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Ловушка потока по умолчанию
  2. Создание и использование потоков выполнения
  3. События для измерения времени и синхронизации
  4. Перекрытие копирования и вычислений
← Назад к CUDA Academy