0Pricing
Deep Learning Academy · Lección

Lance trabajos con torchrun

Inicie y coordine procesos de trabajo

Lance trabajos con torchrun es una lección gratuita de Deep Learning Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Deep Learning Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Deep Learning Academy incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

Who Starts the Processes

DDP needs one process per GPU, but who spawns them? You do not launch them by hand. torchrun is the tool that does it for you.

Meet torchrun

torchrun is PyTorch's launcher. You give it your script and how many processes to start, and it handles the coordination.

torchrun --nproc_per_node=4 train.py

Processes per Node

The nproc_per_node flag sets how many processes to spawn on this machine. Usually it equals the number of GPUs you have.

torchrun --nproc_per_node=8 train.py

Environment Variables Appear

torchrun injects key values as environment variables: RANK, LOCAL_RANK, and WORLD_SIZE. Your script reads them to know who it is.

import os
local_rank = int(os.environ["LOCAL_RANK"])

No Manual Address Wiring

Older launchers made you pass ranks by hand. With torchrun, the rendezvous is automatic, so your script stays clean and portable.

Init Reads the Env

Because torchrun sets the env vars, your init_process_group call needs no arguments beyond the backend. It picks everything up automatically.

import torch.distributed as dist
dist.init_process_group(backend="nccl")

Scale to Many Machines

To go multi-node, add nnodes and a node rank. Each machine runs the same command with its own node id.

torchrun --nnodes=2 --node_rank=0 --nproc_per_node=4 train.py

Point to the Master

Across nodes, all processes must find a meeting point. The rdzv_endpoint gives the host and port they rendezvous on.

torchrun --rdzv_endpoint=host0:29500 train.py

Survive a Worker Crash

torchrun supports elastic training: set a min and max node count, and the job can recover if a worker drops out. 💪

torchrun --nnodes=1:4 --max_restarts=3 train.py

Log From One Rank

Every process prints, so logs get noisy. Gate prints behind a rank check so only rank 0 reports progress.

if int(os.environ["RANK"]) == 0:
    print("epoch done")

The Whole Recipe

The pattern is simple: write a normal DDP script, then launch it with torchrun. The launcher and DDP handle the rest together.

Quick Check

Recall what torchrun hands to your script.

Recap

You learned to launch jobs with torchrun: set processes per node, read the injected env vars, and scale to many nodes with elastic recovery.

Preguntas frecuentes

¿La lección «Lance trabajos con torchrun» es gratis?

Sí — el texto completo de «Lance trabajos con torchrun» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Deep Learning Academy, actualiza a CoddyKit PRO. El curso de Deep Learning Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Lance trabajos con torchrun»?

Inicie y coordine procesos de trabajo Practicas Deep Learning Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Deep Learning Academy?

No se requiere experiencia previa. Deep Learning Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Lance trabajos con torchrun»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Deep Learning Academy?

Sí. Cada lección de Deep Learning Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Paralelismo de datos frente a paralelismo de modelos
  2. Fundamentos de DistributedDataParallel
  3. Batch Norm sincronizada y estado fragmentado
  4. Lance trabajos con torchrun
← Volver a Deep Learning Academy