29 septembre 2026

Des opérations qui ne demandent pas d’héroïsme

Série « Infrastructure »
5

Temps de lecture :

5 min

Quand ce sont toujours les mêmes personnes qui continuent à sauver les mêmes systèmes, c'est le système lui-même qui pose problème. Une automatisation qui évite d'avoir à passer des coups de fil au milieu de la nuit.

Auteur

Dimitri Phalen est le responsable marketing chez ISM , qui préfère un langage clair aux grandes promesses. Depuis des années, il bosse en coulisses pour transformer des problèmes informatiques complexes et confus en solutions concrètes pour les équipes. Si un texte donne l'impression d'avoir été écrit par quelqu'un en manque de caféine qui a passé trop de temps avec l'équipe de livraison, c'est sûrement de sa faute.

La plupart des équipes ne manquent pas de talent. Ce qui leur manque, c'est l'élan.

L'environnement est bruyant, imprévisible et regorge d'éléments que personne n'a correctement documentés. Tes employés passent donc leurs journées à réagir, à traduire et à expliquer. Puis, lors d'une réunion trimestrielle, quelqu'un demande pourquoi le carnet de commandes ne diminue jamais, et la moitié de la salle se met à rêver d'une cabane dans les bois, sans Wi-Fi ni instance ServiceNow.

Voici comment transformer le chaos en routine. Sans pour autant transformer tes employés en robots.

Le problème silencieux

Voilà à quoi ça ressemble en pratique.

Un architecte réseau payé 180 $/h copie-colle des entrées de journal dans un tableur parce que personne n'a jamais mis en place l'automatisation nécessaire. Personne ne le fera, car le projet d'automatisation passe après l'autre projet d'automatisation, qui passe lui-même après le projet de conformité, qui suit lui-même ce que Gary a cassé en janvier.

Pendant ce temps :

  • Les alertes se déclenchent trois fois parce que trois outils surveillent le même seuil sans se connaître
  • Les incidents surviennent sans contexte, sans responsable et sans suite claire, si bien que les vingt premières minutes de chaque intervention servent à déterminer si le problème est réel et à qui il incombe
  • les changements provoquent des pannes parce que le dérapage est passé inaperçu, et il est passé inaperçu parce que ceux qui auraient pu le remarquer sont partis, emportant avec eux la mémoire institutionnelle
  • Le manuel d'exploitation n'existe que dans la tête de Gary. Le téléphone de Gary est, techniquement, un composant d'infrastructure porteur

Personne n'a prévu ça. Personne n'est incompétent. C'est juste ce qui arrive quand cinq ans de décisions prises « au coup par coup » s'accumulent sans que personne ait le temps de revenir en arrière.

Ce qui aide vraiment

Éliminer le bruit avant qu'il n'atteigne quelqu'un

Trois outils qui se déclenchent pour le même événement, ce n'est pas de la « redondance ». Ce sont trois messages, trois notifications, trois personnes qui arrêtent ce qu'elles font pour examiner la même chose. Supprime les doublons. Mets les signaux en corrélation. Ajoute du contexte avant qu’une personne n’ait à ouvrir le dossier. Si ton instance ServiceNow est le point d’entrée, Kyndryl Bridge est la couche qui extrait les signaux de l’ensemble du parc informatique pour les rendre lisibles. [source] Elle exécute plus de 100 millions d’automatisations par mois. Voilà l’échelle. Le principe est plus simple : laisse les systèmes trier pour que les humains puissent réfléchir.

Automatiser le boulot que personne ne devrait faire deux fois

Si tes employés seniors passent un tiers de leur semaine sur des tâches qu'un manuel d'exploitation bien conçu traite en quelques secondes, ce n'est pas un problème de personnel. C'est un modèle opérationnel qui gaspille des ressources coûteuses dans du travail administratif tout en appelant ça des « opérations ».

Chaque heure que ton équipe passe à faire du tri répétitif, c'est une heure qu'elle ne consacre pas au travail préventif qui réduit vraiment le nombre d'incidents. Ce qui veut dire que le prochain trimestre sera exactement pareil que celui-ci. Les mêmes urgences, les mêmes héros, le même épuisement, la même réunion trimestrielle où quelqu'un demande pourquoi le carnet de commandes ne diminue jamais.

Donner du sens à la visibilité

Les tableaux de bord AIOps sont superbes. S'ils ne peuvent pas acheminer le travail, déclencher une réponse ou fournir des preuves à un auditeur, ils ne servent qu'à faire joli. [source]

Voici ce que la plupart des équipes opérationnelles oublient : la télémétrie, les modèles d'incidents et les journaux de changements que ton équipe génère chaque jour sont les mêmes données qui alimentent les opérations pilotées par l'IA. Quand elles sont propres, bien gérées et dirigées vers les bons systèmes, les outils que tu possèdes déjà deviennent plus performants. Sinon, tu achètes un autre outil. Puis un autre. Et quelqu’un finit par te demander pourquoi tu as neuf plateformes de surveillance et que tu ne peux toujours pas expliquer ce qui a changé mardi dernier.

Garder les mêmes personnes

C'est un aspect dont personne ne parle dans les présentations. Quand un même responsable technique principal reste sur ton compte pendant deux ans au lieu d'être remplacé tous les six mois, les processus se stabilisent. Les connaissances s'accumulent. Les problèmes sont résolus au lieu d'être redécouverts.

Quand quelqu’un quitte un projet et revient trois mois plus tard en ayant tout le contexte en tête, c’est pas juste une question de logistique. C’est la différence entre un environnement qui s’améliore et un autre qui repart de zéro à chaque cycle contractuel. C’est aussi la différence entre Gary qui part en vacances et Gary qui laisse un classeur rempli de procédures d’urgence sur un bureau, comme s’il ne comptait jamais revenir.

Ce qui s'améliore

Quand ça marche, c'est pas spectaculaire. C'est discret.

Le temps moyen de résolution diminue, car les incidents sont accompagnés du contexte nécessaire dès leur apparition. Les changements deviennent plus sûrs, car les dérives sont visibles avant qu’elles ne se transforment en incidents. Ton équipe passe plus de temps à prévenir les problèmes qu’à les gérer. Tes meilleurs éléments ne passent plus leur temps dans un salon de discussion intitulé « urgent ».

Gary dort tranquillement. Pas parce que les problèmes ont disparu, mais parce que les systèmes gèrent désormais ce qui, avant, ne dépendait que de lui.

Pas très glamour. Mais c'est mesurable.

Par quoi commencer ?

Fais l'inventaire de ce que tu as. Relie les services, les responsables et les modèles d'incidents. Si les équipes opérationnelles ne peuvent pas voir la réalité, tout le reste n'est que conjecture.

Intègre la confidentialité dans ton travail au quotidien. Les données de télémétrie des opérations constituent des données à part entière. Lorsque ta surveillance passe par le cloud d’un fournisseur étranger, tu soulèves une question de souveraineté à laquelle tu n’avais pas pensé. [source]

Mets en place la gouvernance: étapes de réponse, validations, exceptions. Dans les systèmes. Applicables. Révisables. Pas juste dans la tête de quelqu’un.

Protège les données elles-mêmes. Les preuves opérationnelles, les fichiers de sauvegarde et les données de télémétrie sont des cibles. Traite-les comme telles.

ISM met en place le modèle opérationnel. L’accueil, les manuels d’exploitation, la couche d’automatisation, la structure de responsabilité qui empêche le retour au chaos au bout de six mois. Kyndryl apporte la plateforme et les modèles qui ont fait leurs preuves dans des milliers d’environnements. Ton équipe peut se consacrer à l’ingénierie. Le service est assuré localement, par des personnes qui connaissent tes fenêtres de changement et qui seront toujours en charge de ton compte au trimestre suivant.

Tu veux comprendre comment on bosse ?

Chaque conversation commence par ton environnement. Pas par notre liste de produits.

Contacte-nous
FlècheFlèche

Ce n'est pas une question de technologie ou de processus. C'est une question de clients, d'utilisateurs et de la confiance que tu as mis tant d'efforts à gagner. Chaque membre de notre équipe garde ça à l'esprit.

CTA mobile