CUDA Academy · Урок

Настройка части для хоста

Выделите память, скопируйте данные, запустите ядро, скопируйте результат обратно и освободите память.

Урок 2 из 413 шагов

«Настройка части для хоста» — бесплатный урок CUDA Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения CUDA Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс CUDA Academy содержит 4 уроков всего.

У хоста тоже есть задача

Ядро выполняет вычисления, но CPU на хосте подготавливает всё остальное. Его задачи — выделить память, скопировать данные, запустить ядро, скопировать результат обратно и освободить память. 🧩

Два набора указателей

Для массивов CPU используются указатели хоста, а для буферов GPU — отдельные указатели устройства. Обычно их называют h_A и d_A.

float *h_A, *h_B, *h_C;
float *d_A, *d_B, *d_C;

Заполните входные данные на CPU

Сначала подготовьте данные в обычной памяти хоста. Здесь нужно лишь инициализировать h_A и h_B значениями, которые GPU позже сложит.

for (int i = 0; i < n; i++) {
    h_A[i] = i; h_B[i] = 2 * i;
}

Выделите память на устройстве

GPU нужны собственные буферы, поэтому вызовите cudaMalloc для каждого массива. Обратите внимание: размер указывается в байтах и вычисляется как количество элементов, умноженное на sizeof(float).

size_t bytes = n * sizeof(float);
cudaMalloc(&d_A, bytes);

Скопируйте входные данные на устройство

Переместите входные массивы на GPU с помощью cudaMemcpy и направления HostToDevice. Ядро видит только данные, находящиеся на устройстве.

cudaMemcpy(d_A, h_A, bytes, cudaMemcpyHostToDevice);
cudaMemcpy(d_B, h_B, bytes, cudaMemcpyHostToDevice);

Определите форму запуска

Выберите количество потоков в блоке, затем вычислите, сколько блоков охватит все элементы. Округление вверх гарантирует, что каждый элемент получит поток.

int threads = 256;
int blocks = (n + threads - 1) / threads;

Запустите ядро

Теперь запустите ядро с помощью синтаксиса тройных угловых скобок, передав указатели устройства. Этот вызов сразу возвращает управление, пока GPU продолжает работу.

vecAdd<<<blocks, threads>>>(d_A, d_B, d_C, n);

Скопируйте результат обратно

Когда ядро завершится, верните C с помощью cudaMemcpyDeviceToHost. Это копирование также сначала дожидается завершения запуска.

cudaMemcpy(h_C, d_C, bytes, cudaMemcpyDeviceToHost);

Освободите память устройства

Память GPU не освобождается сборщиком мусора, поэтому освободите каждый буфер с помощью cudaFree. Если пропустить этот шаг, память будет утекать до завершения процесса.

cudaFree(d_A); cudaFree(d_B); cudaFree(d_C);

Порядок неизменен

Всегда соблюдайте одну последовательность: выделить память, скопировать данные на устройство, запустить ядро, скопировать результат обратно, освободить память. Если изменить порядок, ядро прочитает устаревшие или недействительные данные.

Код хоста — обычный C++

Обратите внимание: код на стороне хоста — это обычный C++ плюс несколько вызовов cuda. Помимо запуска ядра, никакой особой магии компилятора нет.

Быстрая проверка

Что должно произойти до запуска ядра vecAdd?

Итоги

Вы полностью связали код на стороне хоста: два набора указателей, cudaMalloc, копирование на устройство, запуск, копирование обратно и cudaFree. Это шаблонный код, на котором работает каждое ядро. ✅

Можно начать бесплатно

Изучай C++ с ИИ-репетитором — бесплатно

Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.

Курсы
30
Уроки
120

Часто задаваемые вопросы

Урок «Настройка части для хоста» бесплатный?

Да — полный текст урока «Настройка части для хоста» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс CUDA Academy, подпишись на CoddyKit PRO. Курс CUDA Academy содержит 4 уроков всего.

Чему я научусь в уроке «Настройка части для хоста»?

Выделите память, скопируйте данные, запустите ядро, скопируйте результат обратно и освободите память. Ты практикуешь CUDA Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать CUDA Academy?

Предыдущий опыт не требуется. CUDA Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.

Сколько времени занимает урок «Настройка части для хоста»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке CUDA Academy?

Да. Каждый урок CUDA Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Ядро сложения векторов
  2. Настройка части для хоста
  3. Проверка результата на CPU
  4. Измерение первого ускорения
← Назад к CUDA Academy