CUDA Academy · Урок

Сокращение, сканирование и сортировка в Thrust

Высокоуровневые примитивы одним вызовом

Урок 3 из 413 шагов

«Сокращение, сканирование и сортировка в Thrust» — бесплатный урок CUDA Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения CUDA Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс CUDA Academy содержит 4 уроков всего.

Сложные алгоритмы — одна строка

Редукции, сканирование и сортировку непросто быстро написать вручную. Thrust предоставляет оптимизированные реализации одним вызовом функции. 🎁

Reduce сворачивает данные в одно значение

thrust::reduce объединяет все элементы в один результат, например суммирует массив, причём вся работа параллельно выполняется внутри.

int total = thrust::reduce(d.begin(), d.end());

Пользовательские операторы редукции

По умолчанию reduce выполняет сложение, но Вы можете передать начальное значение и бинарный оператор, чтобы вычислить произведение, максимум или любую другую ассоциативную операцию.

int m = thrust::reduce(d.begin(), d.end(),
  0, thrust::maximum<int>());

Scan сохраняет накапливаемую сумму

Сканирование, или префиксная сумма, выдаёт на каждой позиции текущую накопленную сумму. Это основа уплотнения, сортировки и распределения в потоках.

Включающее и исключающее сканирование

inclusive_scan включает текущий элемент в сумму, а exclusive_scan — нет. Правильный выбор позволяет избежать ошибки на единицу.

thrust::inclusive_scan(d.begin(), d.end(),
  out.begin());

Сканирование непросто распараллелить

Префиксная сумма выглядит последовательной, однако Thrust выполняет её параллельно с помощью продуманного древовидного алгоритма, который Вам не приходится писать самостоятельно.

Сортировка на месте

thrust::sort сортирует device_vector на месте с помощью быстрой поразрядной или сортировки слиянием на GPU, что для больших объёмов данных намного быстрее сортировки на CPU.

thrust::sort(d.begin(), d.end());

Сортировка по ключу

sort_by_key сортирует один массив и переставляет второй массив значений в соответствии с ним. Это идеально подходит для сохранения соответствия записей их ключам.

thrust::sort_by_key(keys.begin(),
  keys.end(), values.begin());

Композиция примитивов

В реальных конвейерах эти операции объединяют в цепочки: сначала transform, затем reduce или сначала сортировка, затем сканирование. Каждый шаг — один оптимизированный вызов, поэтому Вы можете сосредоточиться на логике.

Объединённый transform_reduce

transform_reduce за один проход выполняет отображение и суммирование, вычисляя, например, скалярное произведение или сумму квадратов без временного массива.

float ss = thrust::transform_reduce(
  d.begin(), d.end(), sq, 0.0f, thrust::plus<float>());

Доверьтесь библиотеке

Эти примитивы тщательно оптимизированы компанией NVIDIA. Обычно сначала стоит использовать их: это эффективнее собственного ядра и экономит часы работы.

Быстрая проверка

Вспомните, что выдаёт префиксная сумма.

Итоги

Вы свернули данные с помощью reduce, построили накопленные суммы с помощью scan, отсортировали массивы с помощью sort и объединили шаги с помощью transform_reduce. 🏁

Можно начать бесплатно

Изучай C++ с ИИ-репетитором — бесплатно

Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.

Курсы
30
Уроки
120

Часто задаваемые вопросы

Урок «Сокращение, сканирование и сортировка в Thrust» бесплатный?

Да — полный текст урока «Сокращение, сканирование и сортировка в Thrust» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс CUDA Academy, подпишись на CoddyKit PRO. Курс CUDA Academy содержит 4 уроков всего.

Чему я научусь в уроке «Сокращение, сканирование и сортировка в Thrust»?

Высокоуровневые примитивы одним вызовом Ты практикуешь CUDA Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать CUDA Academy?

Предыдущий опыт не требуется. CUDA Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.

Сколько времени занимает урок «Сокращение, сканирование и сортировка в Thrust»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке CUDA Academy?

Да. Каждый урок CUDA Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Правильное использование GEMM в cuBLAS
  2. Векторы и преобразования Thrust
  3. Сокращение, сканирование и сортировка в Thrust
  4. cuDNN для глубокого обучения
← Назад к CUDA Academy