Pelajari AI dengan Python · Pelajaran

DistributedDataParallel (DDP)

Kumpulan proses, dist.init_process_group, DistributedSampler, penyegerakan kecerunan.

Pelajaran 2 daripada 413 langkah

DistributedDataParallel (DDP) ialah pelajaran Pelajari AI dengan Python percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Pelajari AI dengan Python, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Pelajari AI dengan Python merangkumi sejumlah 4 pelajaran.

Apakah DDP

DistributedDataParallel (DDP) ialah pendekatan berprestasi tinggi PyTorch untuk latihan selari data. Ia melancarkan satu proses bagi setiap GPU, dengan setiap proses menyimpan replika model penuh, lalu menyegerakkan kecerunan dengan cekap. DDP membuat penskalaan hampir linear merentasi GPU dan mesin.

Kumpulan Proses

DDP menyelaraskan proses melalui kumpulan proses. Setiap proses mendapat kedudukan unik dan mengetahui jumlah saiz dunia. Proses-proses tersebut berkomunikasi melalui bahagian belakang; pada GPU NVIDIA, bahagian belakang itu ialah nccl.

init_process_group

Setiap proses bermula dengan menyertai kumpulan tersebut. dist.init_process_group dengan backend="nccl" menyediakan komunikasi GPU-ke-GPU.

import torch.distributed as dist
import os

dist.init_process_group(backend="nccl")
rank = dist.get_rank()
world_size = dist.get_world_size()

Menetapkan Peranti

Setiap proses hendaklah memiliki satu GPU. Gunakan kedudukan setempat untuk menetapkan peranti supaya proses 0 menggunakan cuda:0, proses 1 menggunakan cuda:1, dan seterusnya.

local_rank = int(os.environ["LOCAL_RANK"])
torch.cuda.set_device(local_rank)
device = torch.device("cuda", local_rank)

Membalut Model

Pindahkan model ke GPUnya, kemudian balut model itu dalam DDP dengan device_ids=[local_rank]. DDP mendaftarkan cangkuk yang akan menyegerakkan kecerunan semasa pengiraan undur.

from torch.nn.parallel import DistributedDataParallel as DDP

model = MyModel().to(device)
model = DDP(model, device_ids=[local_rank])

DistributedSampler

Setiap proses mesti melihat bahagian data yang berbeza, tanpa pertindihan. DistributedSampler membahagikan set data merentasi kedudukan supaya gabungannya meliputi seluruh set data tepat sekali bagi setiap epok.

from torch.utils.data import DataLoader
from torch.utils.data.distributed import DistributedSampler

sampler = DistributedSampler(dataset)
loader = DataLoader(dataset, batch_size=32, sampler=sampler)

Mengacak Setiap Epok

Panggil sampler.set_epoch(epoch) pada permulaan setiap epok. Ini menetapkan semula benih pengacakan secara konsisten merentasi proses supaya setiap kedudukan mengacak dengan cara yang sama dan bahagian data kekal tidak bertindih.

for epoch in range(epochs):
    sampler.set_epoch(epoch)
    for x, y in loader:
        ...

Pengurangan Semua Kecerunan

Semasa loss.backward(), DDP melakukan pengurangan semua: setiap proses menghantar kecerunannya dan menerima hasil yang dipuratakan, supaya semua replika menggunakan kemas kini yang sama. Pengurangan semua berlaku serentak dengan pengiraan undur, sekali gus menyembunyikan kos komunikasi.

Tiada Kesesakan GPU 0

Tidak seperti DataParallel, DDP tidak mempunyai GPU pusat yang mengumpulkan output. Setiap proses mengira kerugian dan kecerunannya sendiri; hanya kecerunan ditukar melalui pengurangan semua. Kesimetrian inilah sebab DDP membuat penskalaan jauh lebih baik.

Melancarkan dengan torchrun

torchrun melancarkan proses bagi setiap GPU dan menetapkan pemboleh ubah persekitaran kedudukan. --nproc_per_node=4 memulakan 4 proses (satu bagi setiap GPU) pada nod ini.

torchrun --nproc_per_node=4 train.py

Menyimpan Hanya pada Kedudukan 0

Semua kedudukan menyimpan pemberat yang sama, jadi hanya satu kedudukan yang patut menulis titik semak bagi mengelakkan fail ditulis secara bertindih. Lindungi operasi save dengan semakan kedudukan.

if rank == 0:
    torch.save(model.module.state_dict(), "model.pt")
dist.barrier()

Semakan Pantas

Uji pengetahuan DDP anda.

Imbas Kembali

Anda telah mempelajari DistributedDataParallel:

  • dist.init_process_group(backend="nccl") menyertai kumpulan proses
  • DistributedSampler memberikan setiap kedudukan bahagian data yang tidak bertindih
  • DDP(model, device_ids=[rank]) menyegerakkan kecerunan melalui pengurangan semua
  • Melancarkan dengan torchrun --nproc_per_node=4
  • Simpan hanya pada kedudukan 0
Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
53
Pelajaran
225

Soalan Lazim

Adakah pelajaran “DistributedDataParallel (DDP)” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran Pelajari AI dengan Python, termasuk “DistributedDataParallel (DDP)”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus Pelajari AI dengan Python merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “DistributedDataParallel (DDP)”?

Kumpulan proses, dist.init_process_group, DistributedSampler, penyegerakan kecerunan. Anda berlatih Pelajari AI dengan Python menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Pelajari AI dengan Python?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Pelajari AI dengan Python di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.

Berapa lamakah pelajaran “DistributedDataParallel (DDP)” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Pelajari AI dengan Python ini?

Ya. Setiap pelajaran Pelajari AI dengan Python menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Latihan Berbilang GPU dengan DataParallel
  2. DistributedDataParallel (DDP)
  3. Latihan Ketepatan Campuran dengan AMP
  4. Latihan Cekap dengan Hugging Face Accelerate
← Kembali ke Pelajari AI dengan Python