CUDA Academy · leksjon

Thrust Reduce, Scan og Sort

Høynivåprimitiver med ett kall

Leksjon 3 av 413 trinn

Thrust Reduce, Scan og Sort er en gratis leksjon i CUDA Academy på CoddyKit. Dette er leksjon 3 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i CUDA Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i CUDA Academy inneholder totalt 4 leksjoner.

Avanserte algoritmer på én linje

Reduksjoner, skanninger og sorteringer er vanskelige å skrive effektivt for hånd. Thrust gir Dem optimaliserte versjoner gjennom ett enkelt funksjonskall. 🎁

Reduce samler alt til én verdi

thrust::reduce kombinerer hvert element til ett enkelt resultat, for eksempel ved å summere en tabell, alt parallelt i bakgrunnen.

int total = thrust::reduce(d.begin(), d.end());

Egendefinerte reduksjonsoperatorer

Reduce bruker addisjon som standard, men De kan sende inn en init-verdi og en binær operasjon for å beregne et produkt, maksimum eller hva som helst som er assosiativt.

int m = thrust::reduce(d.begin(), d.end(),
  0, thrust::maximum<int>());

Scan beholder den løpende summen

En scan, eller prefikssum, skriver ut den løpende summen ved hver posisjon. Den er grunnlaget for komprimering, sortering og allokering av strømmer.

Inkluderende eller ekskluderende

inclusive_scan inkluderer det gjeldende elementet i summen, mens exclusive_scan ikke gjør det. Ved å velge riktig variant unngår De en «off-by-one»-feil.

thrust::inclusive_scan(d.begin(), d.end(),
  out.begin());

Scan er ikke opplagt å parallellisere

En prefikssum ser sekvensiell ut, men Thrust kjører den parallelt med en smart trealgoritme som De aldri trenger å skrive selv.

Sorter på stedet

thrust::sort sorterer en device_vector på stedet ved hjelp av en rask radix- eller flettesortering på GPU-en, langt raskere enn CPU-sortering for store datamengder.

thrust::sort(d.begin(), d.end());

Sorter etter nøkkel

sort_by_key sorterer én tabell og omorganiserer en annen verdi-tabell tilsvarende, noe som er perfekt for å holde poster på linje med nøklene sine.

thrust::sort_by_key(keys.begin(),
  keys.end(), values.begin());

Kombiner primitiver

Reelle prosesser setter disse sammen: transform og deretter reduce, eller sortering og deretter scan. Hvert trinn er ett optimalisert kall, slik at De kan konsentrere Dem om logikken.

Fusjonert transform_reduce

transform_reduce avbilder og summerer i én gjennomgang, og beregner ting som et skalarprodukt eller en sum av kvadrater uten en midlertidig tabell.

float ss = thrust::transform_reduce(
  d.begin(), d.end(), sq, 0.0f, thrust::plus<float>());

La biblioteket gjøre jobben

Disse primitivene er svært optimaliserte av NVIDIA. Hvis De prøver dem først, slår de vanligvis en egendefinert kernel og sparer Dem for timevis med arbeid.

Hurtigsjekk

Husk hva en prefikssum produserer.

Oppsummering

De samlet data med reduce, bygde løpende summer med scan, sorterte tabeller med sort og slo sammen trinn med transform_reduce. 🏁

Gratis å komme i gang

Lær deg C++ med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
30
Leksjoner
120

Ofte stilte spørsmål

Er leksjonen «Thrust Reduce, Scan og Sort» gratis?

Ja – hele teksten i «Thrust Reduce, Scan og Sort» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av CUDA Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i CUDA Academy inneholder totalt 4 leksjoner.

Hva lærer jeg i «Thrust Reduce, Scan og Sort»?

Høynivåprimitiver med ett kall Du øver på CUDA Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med CUDA Academy?

Ingen tidligere erfaring er nødvendig. CUDA Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.

Hvor lang tid tar leksjonen «Thrust Reduce, Scan og Sort»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne CUDA Academy-leksjonen?

Ja. Alle CUDA Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. cuBLAS GEMM på riktig måte
  2. Thrust-vektorer og transformasjoner
  3. Thrust Reduce, Scan og Sort
  4. cuDNN for deep learning
← Tilbake til CUDA Academy