0Pricing
CUDA Academy icon

CUDA Academy

CPPEnterpriseDesktopAi

Programmiere die GPU mit CUDA C++. Von Threads und Memory Hierarchy über Kernels bis hin zu Optimierung und echtem parallelem Computing.

🤖 KI-Gesteuert📚 30 Kurse👥 100.000+ Lernende⭐ 4,9 Bewertung
Kursübersicht

CUDA: GPU-Programmierung mit C++

Programmiere die GPU mit CUDA C++. Von Threads und Memory Hierarchy über Kernels bis hin zu Optimierung und echtem parallelem Computing. Diese Track umfasst 30 progressive Mini-Kurse von absoluten Anfängern (A1) bis fortgeschrittenen Lernenden (B2), mit kurzen fokussierten Lektionen und schnellen Quiz zum Verankerung jedes Konzepts.

Was du lernen wirst

Du beginnst mit den Grundlagen und arbeitest dich durch mittlere und fortgeschrittene Themen, wobei jeder Kurs auf dem vorherigen aufbaut. Jede Lektion ist praktisch und kompakt, mit einem 24/7 KI-Tutor, der dir bei Bedarf zur Verfügung steht.

Wie es funktioniert

Jeder Kurs ist in vier fokussierte, kompakte Lektionen unterteilt. Absolviere täglich ein paar Lektionen und du wirst die gesamte Track in Wochen statt Monaten beherrschen.

Lernen starten →

So wirst du lernen

🎯
Interaktive Lektionen
Praktische Coding-Übungen mit Live-Feedback
🤖
KI-Tutor
Erhalte sofortige Hilfe von unserem KI-Tutor, wenn du nicht weiterkommst
💻
Integrierter Editor
Schreibe und starte Code direkt in deinem Browser
🏆
Zertifikat
Verdiene ein Zertifikat, wenn du den Kurs abschließt
Lehrplan

30 Kurse

Alle Kurse im CUDA Academy Lernpfad.

01

Warum GPUs parallele Aufgaben meistern

A14 Lektionen

Erklären Sie, was eine GPU ist und warum Tausende kleiner Kerne bei parallelen Problemen einige schnelle CPU-Kerne übertreffen

02

Ihre CUDA-Toolchain einrichten

A14 LektionenPRO

Installieren Sie das CUDA Toolkit, überprüfen Sie Ihren Treiber und kompilieren Sie Ihr erstes Programm mit nvcc

03

Host und Device: Zwei Welten

A14 LektionenPRO

Unterscheiden Sie CPU-Host-Code von GPU-Device-Code und wissen Sie, auf welchen Speicher die jeweilige Seite zugreifen kann

04

Ihren ersten Kernel schreiben

A14 LektionenPRO

Definieren, starten und führen Sie einen GPU-Kernel aus, der direkt auf dem Device eine Ausgabe erzeugt

05

Threads, Blöcke und Grids

A14 LektionenPRO

Ordnen Sie ein Problem der CUDA-Hierarchie aus Threads, Blöcken und Grid zu

06

Globale Thread-Indizierung

A24 LektionenPRO

Berechnen Sie einen eindeutigen globalen Index, damit jeder Thread genau ein Datenelement verarbeitet

07

Device-Speicher verwalten

A24 LektionenPRO

Reservieren und geben Sie GPU-Speicher frei und verstehen Sie den Device-Heap

08

Daten mit cudaMemcpy verschieben

A24 LektionenPRO

Übertragen Sie Arrays zuverlässig in beide Richtungen zwischen Host und Device

09

Vektoraddition von Anfang bis Ende

A24 LektionenPRO

Schreiben Sie ein vollständiges C = A + B-Programm auf der GPU – von der Speicherreservierung bis zur Überprüfung

10

CUDA-Fehler richtig abfangen

A24 LektionenPRO

Erkennen und melden Sie CUDA-Fehler aus API-Aufrufen und Kernel-Starts

11

Die CUDA-Speicherhierarchie verstehen

B14 LektionenPRO

Wählen Sie den passenden Speicherbereich aus globalem, Shared-, Constant-, Local-Speicher und Registern

12

Globale Speicherzugriffe zusammenführen

B14 LektionenPRO

Gestalten Sie Zugriffsmuster so, dass ein Warp zusammenhängenden Speicher in einer Transaktion liest

13

On-Chip-Shared-Memory beherrschen

B14 LektionenPRO

Verwenden Sie __shared__-Speicher und __syncthreads, um Daten innerhalb eines Blocks zu teilen

14

Algorithmen mit Shared Memory kacheln

B14 LektionenPRO

Wenden Sie das Load-Sync-Compute-Kachelmuster an, um Daten wiederzuverwenden und den globalen Datenverkehr zu reduzieren

15

Gekachelte Matrixmultiplikation

B14 LektionenPRO

Erstellen Sie eine GEMM-Implementierung mit Shared-Memory-Kacheln, die die naive Version deutlich übertrifft

16

Parallele Reduktion richtig umgesetzt

B14 LektionenPRO

Summieren Sie ein Array auf der GPU effizient mit einer baumbasierten Reduktion

17

Atomics für sichere Nebenläufigkeit

B14 LektionenPRO

Verwenden Sie atomare Operationen, um gemeinsame Ergebnisse ohne Race Conditions zu aktualisieren

18

Arbeit mit CUDA-Streams überlappen

B14 LektionenPRO

Führen Sie Kernel und Transfers mit nicht standardmäßigen Streams gleichzeitig aus

19

Asynchrone Transfers und page-locked Speicher

B14 LektionenPRO

Beschleunigen Sie Transfers mit page-locked Host-Speicher und asynchronen Kopien in Streams

20

Mit Unified Memory vereinfachen

B14 LektionenPRO

Verwenden Sie cudaMallocManaged für einen gemeinsamen Zeiger von Host und Device

21

Belegung und Startkonfiguration optimieren

B24 LektionenPRO

Wählen Sie Blockgrößen und begrenzen Sie Ressourcen, um die SM-Belegung zu maximieren

22

Kernel mit Nsight profilieren

B24 LektionenPRO

Finden Sie Engpässe mithilfe von Metriken aus Nsight Systems und Nsight Compute

23

Warp-Level-Primitiven und Shuffles

B24 LektionenPRO

Tauschen Sie Daten innerhalb eines Warps mit Shuffle- und Vote-Intrinsics ohne Shared Memory aus

24

Fortgeschrittene Kernel-Optimierung

B24 LektionenPRO

Setzen Sie ILP, Schleifenentrollung und vektorisierte Ladevorgänge ein, um die Spitzenleistung auszuschöpfen

25

Über mehrere GPUs skalieren

B24 LektionenPRO

Teilen Sie die Arbeit auf mehrere GPUs auf und verschieben Sie Daten mit P2P direkt zwischen ihnen

26

Mit cuBLAS und Thrust beschleunigen

B24 LektionenPRO

Rufen Sie optimierte NVIDIA-Bibliotheken für GEMM, Sortierung und parallele Algorithmen auf

27

Dynamische Parallelität und CUDA Graphs

B24 LektionenPRO

Starten Sie Kernel vom Device aus und zeichnen Sie Arbeit in wiederverwendbaren CUDA Graphs auf

28

Tensor Cores programmieren

B24 LektionenPRO

Verwenden Sie Tensor Cores mit gemischter Präzision über die WMMA-API für schnelle Matrixberechnungen

29

Mit cuda-gdb und Sanitizer debuggen

B24 LektionenPRO

Spüren Sie Abstürze, Race Conditions und Speicherfehler mit den CUDA-Debugging-Tools auf

30

Abschlussprojekt: Eine GPU-Bildpipeline

B24 LektionenPRO

Führen Sie Kernel, Streams und Profiling zu einer echten GPU-beschleunigten Bildverarbeitung zusammen

FAQ

Häufig gestellte Fragen

Ist der CUDA Academy Kurs kostenlos?

Ja. Du kannst den CUDA Academy Kurs kostenlos starten und seine interaktiven Lektionen ohne Kosten abschließen. Ein optionales PRO-Abo schaltet erweiterte KI-Tools und ein teilbares Zertifikat frei.

Brauche ich Vorkenntnisse, um CPP zu lernen?

Nein. Der Kurs beginnt mit den Grundlagen und bewegt sich schrittweise zu fortgeschritteneren Themen, sodass du auch ohne CPP-Vorkenntnisse starten kannst.

Wie lerne ich CPP auf CoddyKit?

Du lernst durch Tun. Kurze interaktive Lektionen verbinden eine klare Erklärung mit einer praktischen Coding-Übung, die in Echtzeit läuft, und ein 24/7 KI-Tutor gibt dir personalisierte Hilfe, wann immer du steckenbleibst.

Erhalte ich ein Zertifikat für den Abschluss von CUDA Academy?

Ja. PRO-Lerner können eine Prüfung ablegen und verdienen sich ein teilbares Abschlusszertifikat mit verifizierbarem Code für den CUDA Academy Kurs.

Kann ich CPP auf meinem Telefon lernen?

Ja. CoddyKit ist im Web und als native iOS- und Android-Apps verfügbar, sodass du CPP auf jedem Gerät lernen kannst und dein Fortschritt überall synchronisiert wird.

Starte CUDA Academy jetzt

Schließe dich Tausenden von Lernenden an, die Programmierung mit KI-gestützten Lektionen beherrschen.

Kostenlos starten →Alle Kurse ansehen