Surveillance et alertes centralisées
Étendez la surveillance au-delà d’un seul serveur : envoyez les métriques et les journaux vers un système central, créez des tableaux de bord et configurez des alertes pour être informé des problèmes avant vos utilisateurs.
Surveillance et alertes centralisées est une leçon Linux Server Deployment & SSH Mastery gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Linux Server Deployment & SSH Mastery, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Linux Server Deployment & SSH Mastery comprend 4 leçons au total.
Pourquoi centraliser ?
Se connecter à chaque serveur avec top et journalctl fonctionne pour une seule machine. Avec de nombreux serveurs, cette méthode ne passe pas à l’échelle, et vous ne voyez les problèmes que lorsque vous pensez à vérifier.
La supervision centralisée rassemble les métriques et les journaux de tous les serveurs au même endroit, avec des tableaux de bord et des alertes automatiques.
Métriques ou journaux
Deux types de données alimentent l’observabilité :
- Métriques — séries temporelles numériques, comme le pourcentage de CPU, la mémoire ou le taux de requêtes
- Journaux — événements textuels ponctuels, comme les erreurs et les entrées d’accès
Vous collectez généralement les deux, avec des outils différents optimisés pour chacun.
Le modèle Prometheus
Prometheus est un système de métriques très répandu. Il récupère les métriques en interrogeant les points d’accès HTTP exposés par chaque serveur.
Sur chaque serveur, vous exécutez un exportateur — node_exporter pour les métriques de l’hôte — qui publie les données lues par Prometheus.
# On each monitored server:
sudo apt install prometheus-node-exporter
curl http://localhost:9100/metrics | headConfigurer une cible de collecte
Prometheus reçoit la liste des éléments à collecter via son fichier de configuration. Chaque tâche répertorie des cibles (hôte:port d’un exportateur).
Cet extrait collecte les données de node_exporter sur deux serveurs.
scrape_configs:
- job_name: 'nodes'
static_configs:
- targets: ['web1:9100', 'web2:9100']Interroger les métriques avec PromQL
Prometheus possède son propre langage d’interrogation, PromQL. Vous pouvez calculer des taux, des moyennes et bien plus encore sur l’ensemble de votre parc.
Cette expression estime l’utilisation du CPU par serveur.
100 - (avg by (instance) (rate(node_cpu_seconds_total{mode='idle'}[5m])) * 100)Visualiser avec Grafana
Grafana se connecte à Prometheus (ainsi qu’à de nombreuses autres sources) pour créer des tableaux de bord. Vous ajoutez Prometheus comme source de données, puis créez des panneaux à partir de requêtes PromQL.
Les tableaux de bord préconfigurés pour node_exporter vous fournissent en quelques minutes des graphiques du CPU, de la mémoire, du disque et du réseau.
sudo apt install grafana
sudo systemctl enable --now grafana-server
# Open http://server:3000 and add Prometheus as a data sourceCentraliser les journaux
Pour les journaux, envoyez-les depuis chaque serveur vers un stockage centralisé. Une pile courante associe Loki à Promtail, qui s’intègre à Grafana.
Promtail s’exécute sur chaque serveur et transfère les fichiers journaux ainsi que le journal système vers Loki.
# promtail tails the journal and ships to Loki
clients:
- url: http://loki:3100/loki/api/v1/push
scrape_configs:
- job_name: journal
journal:
max_age: 12hDéfinir des règles d’alerte
Les alertes transforment les métriques en actions. Les règles d’alerte de Prometheus se déclenchent lorsqu’une expression reste vraie pendant une certaine durée.
Cette règle déclenche une alerte lorsqu’un nœud est hors service depuis deux minutes.
groups:
- name: node
rules:
- alert: NodeDown
expr: up == 0
for: 2m
labels:
severity: critical
annotations:
summary: 'Instance {{ $labels.instance }} is down'Acheminer les alertes
Alertmanager reçoit les alertes déclenchées et les achemine vers le bon canal : e-mail, Slack, PagerDuty, etc. Il élimine également les doublons et met les alertes en sourdine.
Vous associez les alertes à des destinataires en fonction d’étiquettes telles que severity.
route:
receiver: 'team-slack'
receivers:
- name: 'team-slack'
slack_configs:
- channel: '#alerts'Éviter la fatigue liée aux alertes
Trop d’alertes sont aussi problématiques qu’une absence totale d’alertes — les utilisateurs finissent par les ignorer. Une bonne gestion des alertes :
- déclenche des alertes sur les symptômes ressentis par les utilisateurs, et non sur chaque variation de métrique
- utilise une durée
forpour éviter les déclenchements répétitifs - attribue un niveau de gravité afin de pouvoir filtrer le bruit
Bonnes pratiques
Construisez une observabilité durable :
- Collectez centralement les métriques et les journaux
- Partez de tableaux de bord communautaires, puis personnalisez-les
- Déclenchez des alertes uniquement sur les conditions nécessitant une action
- Vérifiez que les alertes vous parviennent effectivement
Vérification rapide
Testez vos connaissances sur la supervision centralisée.
Récapitulatif
Vous pouvez désormais superviser tout un parc de manière centralisée :
- Métriques via la collecte Prometheus de node_exporter, interrogées avec PromQL
- Tableaux de bord dans Grafana
- Journaux envoyés vers Loki via Promtail
- Alertes avec les règles Prometheus acheminées par Alertmanager
Cette approche étend les compétences acquises pour les journaux d’un seul serveur à une observabilité proactive de l’ensemble du parc.
Questions Fréquemment Posées
La leçon « Surveillance et alertes centralisées » est-elle gratuite ?
Oui — le texte complet de « Surveillance et alertes centralisées » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Linux Server Deployment & SSH Mastery, passe à CoddyKit PRO. Le cours Linux Server Deployment & SSH Mastery comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Surveillance et alertes centralisées » ?
Étendez la surveillance au-delà d’un seul serveur : envoyez les métriques et les journaux vers un système central, créez des tableaux de bord et configurez des alertes pour être informé des problèmes… Tu pratiques Linux Server Deployment & SSH Mastery avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Linux Server Deployment & SSH Mastery ?
Aucune expérience préalable n'est requise. Linux Server Deployment & SSH Mastery sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.
Combien de temps prend la leçon « Surveillance et alertes centralisées » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Linux Server Deployment & SSH Mastery ?
Oui. Chaque leçon Linux Server Deployment & SSH Mastery inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Outils de surveillance du système
- Comprendre les journaux système
- Rotation et archivage des journaux
- Surveillance et alertes centralisées