Ajuste corretamente as instâncias e réplicas
Relacione o hardware aos perfis reais de carga.
Ajuste corretamente as instâncias e réplicas é uma aula grátis de MLOps Academy no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de MLOps Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de MLOps Academy inclui 4 aulas no total.
Pague pelo que Usa
A maior parte das contas de disponibilização de ML vem de instâncias que ficam parcialmente ociosas. O dimensionamento adequado significa ajustar o hardware e a quantidade de réplicas à sua carga real, não a um receio de pior caso.
Meça Antes de Reduzir
Você não pode dimensionar adequadamente aquilo que não mediu. Comece observando a utilização de CPU e memória real durante um dia normal de tráfego.
A Armadilha do Superdimensionamento
Escolher uma instância enorme por precaução parece seguro, mas desperdiça dinheiro a cada hora. A baixa utilização crônica é o sinal mais claro de superdimensionamento.
Leia sua Utilização
Se a CPU média ficar perto de 15 por cento, sua instância é grande demais. Busque uma utilização-alvo saudável, com margem para picos curtos.
kubectl top pods -n servingVertical ou Horizontal
O escalonamento vertical fornece uma máquina maior a uma única réplica. O escalonamento horizontal adiciona mais réplicas pequenas, o que geralmente lida melhor com tráfego em rajadas.
Defina Solicitações e Limites
No Kubernetes, sua solicitação de recursos informa ao agendador quanto cada réplica realmente precisa. Defina esse valor com base no uso observado, não em uma estimativa arredondada.
resources:
requests:
cpu: "500m"
memory: "1Gi"Escolha a Quantidade Certa de Réplicas
Poucas réplicas significam solicitações em fila e respostas lentas. Muitas réplicas significam pods ociosos pelos quais você ainda paga. Dimensione as réplicas para sua carga simultânea de pico.
Deixe o Escalonamento Automático Acompanhar a Demanda
Um Horizontal Pod Autoscaler adiciona réplicas quando a carga aumenta e as remove quando ela diminui, para que você deixe de pagar por capacidade fora do horário de pico.
kubectl autoscale deploy model --min 2 --max 10 --cpu-percent 60Mantenha um Piso de Segurança
Uma quantidade mínima de réplicas mantém alguns pods aquecidos, para que o tráfego nunca encontre um serviço frio e vazio. Esse é o equilíbrio entre custo e disponibilidade.
Máquinas com GPU São Caras
Instâncias com GPU custam muitas vezes mais do que as com CPU. Solicite uma GPU somente quando seu modelo realmente precisar dela e concentre o trabalho para que ela nunca fique ociosa.
O Dimensionamento Adequado é Contínuo
Os padrões de tráfego mudam ao longo de semanas e meses. Reavalie regularmente o tipo de instância e a quantidade de réplicas para que sua frota continue bem ajustada.
Verificação Rápida
Vamos ver o que a baixa utilização está informando a você.
Recapitulação
Você mediu a utilização, escolheu entre escalonamento vertical e horizontal, definiu solicitações e adicionou escalonamento automático. Agora sua frota corresponde à demanda real. 💸
Perguntas Frequentes
A aula “Ajuste corretamente as instâncias e réplicas” é grátis?
Sim — o texto completo de “Ajuste corretamente as instâncias e réplicas” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de MLOps Academy, atualize para CoddyKit PRO. O curso de MLOps Academy inclui 4 aulas no total.
O que vou aprender em “Ajuste corretamente as instâncias e réplicas”?
Relacione o hardware aos perfis reais de carga. Você pratica MLOps Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar MLOps Academy?
Nenhuma experiência prévia é necessária. MLOps Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Ajuste corretamente as instâncias e réplicas”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de MLOps Academy?
Sim. Cada aula de MLOps Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Ajuste corretamente as instâncias e réplicas
- Quantize e destile para uma inferência mais barata
- Utilize instâncias spot para treinamento
- Acompanhe o custo por previsão