0Pricing
MLOps Academy · Aula

Ajuste corretamente as instâncias e réplicas

Relacione o hardware aos perfis reais de carga.

Ajuste corretamente as instâncias e réplicas é uma aula grátis de MLOps Academy no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de MLOps Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de MLOps Academy inclui 4 aulas no total.

Pague pelo que Usa

A maior parte das contas de disponibilização de ML vem de instâncias que ficam parcialmente ociosas. O dimensionamento adequado significa ajustar o hardware e a quantidade de réplicas à sua carga real, não a um receio de pior caso.

Meça Antes de Reduzir

Você não pode dimensionar adequadamente aquilo que não mediu. Comece observando a utilização de CPU e memória real durante um dia normal de tráfego.

A Armadilha do Superdimensionamento

Escolher uma instância enorme por precaução parece seguro, mas desperdiça dinheiro a cada hora. A baixa utilização crônica é o sinal mais claro de superdimensionamento.

Leia sua Utilização

Se a CPU média ficar perto de 15 por cento, sua instância é grande demais. Busque uma utilização-alvo saudável, com margem para picos curtos.

kubectl top pods -n serving

Vertical ou Horizontal

O escalonamento vertical fornece uma máquina maior a uma única réplica. O escalonamento horizontal adiciona mais réplicas pequenas, o que geralmente lida melhor com tráfego em rajadas.

Defina Solicitações e Limites

No Kubernetes, sua solicitação de recursos informa ao agendador quanto cada réplica realmente precisa. Defina esse valor com base no uso observado, não em uma estimativa arredondada.

resources:
  requests:
    cpu: "500m"
    memory: "1Gi"

Escolha a Quantidade Certa de Réplicas

Poucas réplicas significam solicitações em fila e respostas lentas. Muitas réplicas significam pods ociosos pelos quais você ainda paga. Dimensione as réplicas para sua carga simultânea de pico.

Deixe o Escalonamento Automático Acompanhar a Demanda

Um Horizontal Pod Autoscaler adiciona réplicas quando a carga aumenta e as remove quando ela diminui, para que você deixe de pagar por capacidade fora do horário de pico.

kubectl autoscale deploy model --min 2 --max 10 --cpu-percent 60

Mantenha um Piso de Segurança

Uma quantidade mínima de réplicas mantém alguns pods aquecidos, para que o tráfego nunca encontre um serviço frio e vazio. Esse é o equilíbrio entre custo e disponibilidade.

Máquinas com GPU São Caras

Instâncias com GPU custam muitas vezes mais do que as com CPU. Solicite uma GPU somente quando seu modelo realmente precisar dela e concentre o trabalho para que ela nunca fique ociosa.

O Dimensionamento Adequado é Contínuo

Os padrões de tráfego mudam ao longo de semanas e meses. Reavalie regularmente o tipo de instância e a quantidade de réplicas para que sua frota continue bem ajustada.

Verificação Rápida

Vamos ver o que a baixa utilização está informando a você.

Recapitulação

Você mediu a utilização, escolheu entre escalonamento vertical e horizontal, definiu solicitações e adicionou escalonamento automático. Agora sua frota corresponde à demanda real. 💸

Perguntas Frequentes

A aula “Ajuste corretamente as instâncias e réplicas” é grátis?

Sim — o texto completo de “Ajuste corretamente as instâncias e réplicas” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de MLOps Academy, atualize para CoddyKit PRO. O curso de MLOps Academy inclui 4 aulas no total.

O que vou aprender em “Ajuste corretamente as instâncias e réplicas”?

Relacione o hardware aos perfis reais de carga. Você pratica MLOps Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar MLOps Academy?

Nenhuma experiência prévia é necessária. MLOps Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Ajuste corretamente as instâncias e réplicas”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de MLOps Academy?

Sim. Cada aula de MLOps Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Ajuste corretamente as instâncias e réplicas
  2. Quantize e destile para uma inferência mais barata
  3. Utilize instâncias spot para treinamento
  4. Acompanhe o custo por previsão
← Voltar para MLOps Academy