Draaiboek voor debuggen in productie en incidentrespons · Les

Tools en platforms voor Chaos-experimenten

Verken verschillende tools, zoals Chaos Monkey en LitmusChaos, die het gecontroleerd injecteren van storingen in systemen mogelijk maken

Les 2 van 411 stappen

Tools en platforms voor Chaos-experimenten is een gratis Draaiboek voor debuggen in productie en incidentrespons-les op CoddyKit. Dit is les 2 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Draaiboek voor debuggen in productie en incidentrespons. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Draaiboek voor debuggen in productie en incidentrespons bevat in totaal 4 lessen.

Gespecialiseerde hulpmiddelen voor gecontroleerde chaos

Chaos Engineering draait niet alleen om willekeurig dingen kapot te maken; het is een wetenschappelijke en gecontroleerde aanpak om de veerkracht van systemen te testen.

Om deze controle te bereiken en experimenten herhaalbaar te maken, zijn gespecialiseerde hulpmiddelen essentieel. Ze helpen je systematisch storingen te injecteren, het gedrag van systemen te observeren en te valideren dat je systemen onverwachte storingen kunnen doorstaan.

Verschillende vormen van storingsinjectie

Hulpmiddelen voor chaos engineering zijn vaak gespecialiseerd in verschillende gebieden of omgevingen. Over het algemeen kunnen we ze indelen op basis van hun primaire functie:

  • Storingsinjectoren: Introduceren rechtstreeks specifieke storingen (bijvoorbeeld processen beëindigen of netwerkverkeer vertragen).
  • Orchestrators: Beheren de volledige levenscyclus van een experiment, inclusief plannen, monitoren en terugdraaien.
  • Platformspecifieke hulpmiddelen: Ontworpen voor specifieke cloudproviders (AWS, Azure, GCP) of platformen voor containerorchestratie zoals Kubernetes.

Chaos Monkey: de pionier

Chaos Monkey, ontwikkeld door Netflix, is waarschijnlijk het bekendste hulpmiddel voor chaos engineering. Het is ontworpen om productie-instanties (virtuele machines of containers) willekeurig uit te schakelen.

Het basisidee is eenvoudig: als je weet dat instanties elk moment kunnen verdwijnen, word je gedwongen systemen te bouwen die dergelijke storingen netjes kunnen verdragen en ervan kunnen herstellen.

Hoe Chaos Monkey werkt

Chaos Monkey werkt als volgt:

  • Groepen instanties identificeren (bijvoorbeeld een groep met automatische schaling in AWS).
  • Willekeurig een instantie uit die groep selecteren.
  • Deze na een geconfigureerde vertraging beëindigen, waarmee een onverwachte crash of uitval wordt nagebootst.

Hierdoor worden engineers gedwongen ervoor te zorgen dat hun services automatisch kunnen herstellen en blijven werken, zelfs wanneer delen van de infrastructuur uitvallen.

Kennismaken met LitmusChaos

LitmusChaos is een open-sourceplatform voor Chaos Engineering dat speciaal is ontwikkeld voor Kubernetes-omgevingen. Hiermee kunnen ontwikkelaars en Site Reliability Engineers (SRE's) chaos engineering op een Kubernetes-native manier beoefenen.

Je kunt LitmusChaos gebruiken om verschillende soorten chaos te injecteren in toepassingen en infrastructuuronderdelen die op je Kubernetes-clusters draaien, en hun veerkracht te testen.

Werkstroom van een LitmusChaos-experiment

Met LitmusChaos definieer je chaos-experimenten met Kubernetes Custom Resources (CR's). Deze CR's zijn als blauwdrukken die het volgende specificeren:

  • Het type storing dat moet worden geïnjecteerd (bijvoorbeeld een pod verwijderen of netwerkvertraging introduceren).
  • De doeltoepassing of het doelinfrastructuuronderdeel.
  • De duur en reikwijdte van het experiment.

LitmusChaos biedt een besturingslaag om deze experimenten rechtstreeks vanuit je Kubernetes-cluster te beheren, in te plannen en te monitoren.

Gremlin: storingen als service

Gremlin is een commercieel platform voor "Failure as a Service" dat een uitgebreide reeks chaos-experimenten biedt. Het levert een gebruiksvriendelijke interface en API om verschillende soorten "aanvallen" op je systemen uit te voeren.

Gremlin wil chaos engineering toegankelijk en veilig maken voor ondernemingen, zodat die proactief zwakke plekken kunnen ontdekken voordat ze klanten raken.

Typen Gremlin-aanvallen

Gremlin deelt zijn aanvallen in om veelvoorkomende storingsvormen uit de echte wereld te simuleren:

  • Aanvallen op bronnen: Put CPU, geheugen, schijf-I/O of netwerkbandbreedte van een systeem uit.
  • Netwerkaanvallen: Introduceer latentie of pakketverlies, of blokkeer verkeer naar specifieke services.
  • Aanvallen op de toestand: Beëindig processen, schakel hosts uit of veroorzaak tijdsverschuivingen.

Met deze verschillende aanvalstypen kun je specifieke kwetsbaarheden van systemen gericht testen.

Het juiste hulpmiddel kiezen

Welke tool voor chaos engineering je kiest, hangt af van je specifieke behoeften en omgeving. Houd rekening met deze factoren:

  • Omgeving: Bestaat je infrastructuur voornamelijk uit Kubernetes, virtuele machines in de cloud of fysieke hardware?
  • Complexiteit: Heb je alleen eenvoudige beëindiging van instanties nodig, of ook complexe netwerk- en bronaanvallen?
  • Open source versus commercieel: Beoordeel het budget, de benodigde ondersteuning en geavanceerde functies.
  • Integratie: Hoe goed integreert het met je bestaande CI/CD-pijplijnen, monitoring- en waarschuwingssystemen?

Controle van chaos-hulpmiddelen

We hebben verschillende hulpmiddelen voor chaos engineering behandeld, elk met unieke sterke punten en aandachtsgebieden. Laten we je begrip testen.

Samenvatting: hulpmiddelen voor opzettelijke chaos

In deze les hebben we belangrijke hulpmiddelen behandeld die effectieve Chaos Engineering mogelijk maken.

We hebben geleerd over Chaos Monkey, een pionier op het gebied van het willekeurig beëindigen van instanties, en over LitmusChaos voor Kubernetes-native chaos-experimenten. Ook hebben we Gremlin behandeld, een commercieel platform voor "Failure as a Service" dat verschillende aanvalstypen biedt.

Deze hulpmiddelen zijn essentieel om systematisch te testen en veerkracht in je systemen op te bouwen, zodat mogelijke uitval verandert in een kans om te leren.

Gratis beginnen

Leer Draaiboek voor debuggen in productie en incidentrespons met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
12
Lessen
48

Veelgestelde vragen

Is de les “Tools en platforms voor Chaos-experimenten” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad Draaiboek voor debuggen in productie en incidentrespons, waaronder “Tools en platforms voor Chaos-experimenten”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus Draaiboek voor debuggen in productie en incidentrespons bevat in totaal 4 lessen.

Wat leer ik in “Tools en platforms voor Chaos-experimenten”?

Verken verschillende tools, zoals Chaos Monkey en LitmusChaos, die het gecontroleerd injecteren van storingen in systemen mogelijk maken Je oefent met Draaiboek voor debuggen in productie en incidentrespons door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Draaiboek voor debuggen in productie en incidentrespons te beginnen?

Ervaring vooraf is niet nodig. Draaiboek voor debuggen in productie en incidentrespons op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.

Hoe lang duurt de les “Tools en platforms voor Chaos-experimenten”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Draaiboek voor debuggen in productie en incidentrespons?

Ja. Elke les over Draaiboek voor debuggen in productie en incidentrespons bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Principes van Chaos Engineering
  2. Tools en platforms voor Chaos-experimenten
  3. Veerkracht in systeemontwerp inbouwen
  4. Blast radius en steady-statehypothesen meten
← Terug naar Draaiboek voor debuggen in productie en incidentrespons