L’article de Sean Goedecke aborde la gestion des incidents techniques en soulignant que la plupart se résolvent d’eux-mêmes grâce à des systèmes bien conçus, réduisant ainsi le besoin d’intervention humaine. L’auteur insiste sur les risques des actions précipitées, qui peuvent aggraver la situation, et recommande une approche initiale passive pour éviter les erreurs. Il met en avant l’importance de la connaissance du système et de la prise de décision rapide, même dans un contexte stressant.
Goedecke critique l’idée reçue selon laquelle les incidents nécessitent des solutions complexes ou héroïques, rappelant que les actions efficaces sont souvent simples, comme désactiver une fonctionnalité problématique. Il souligne également le rôle crucial de l’expérience et de la familiarité avec le codebase pour identifier rapidement les causes et les correctifs.
Enfin, l’article traite de la dimension psychologique des incidents, où la peur peut paralyser les équipes. L’auteur encourage les intervenants à agir avec assurance, même face à des managers, en s’appuyant sur leur expertise pour prendre des décisions décisives et éviter les blocages.
L'auteur partage son expérience avec Kyverno, un outil puissant pour Kubernetes, lors d'une mise à jour de cluster vers la version 1.34. L'upgrade a provoqué un deadlock entre les nouvelles fonctionnalités réseau de Kubernetes et Kyverno, rendant l'API Server injoignable. L'incident, initialement perçu comme un problème réseau, était en réalité causé par une collision entre la création automatique d'un objet ServiceCIDR par Kubernetes et l'interception par le webhook Kyverno. L'auteur détaille le mécanisme du deadlock et propose des solutions pour éviter de tels incidents à l'avenir.
Tout est dans le titre