Tout le monde prétend avoir un plan de relance.
La différence, c’est de savoir s’il tient le coup un vendredi comme les autres, quand la moitié de l’équipe est absente, que les routes sont impraticables et que l’enfant de quelqu’un est malade à la maison. Une résilience qui ne marche que dans des conditions idéales, c’est juste du marketing. Une jolie brochure, sûrement plastifiée.
Il faut passer de « on pense pouvoir récupérer » à « on a fait le calcul et on a les preuves ».
Comment ça ne marche pas vraiment
La résilience, ça ne fait pas de bruit quand ça ne marche pas. Pas au début.
Ça se passe comme une fuite lente en janvier. En silence, dans l’ombre, pendant que tout le monde est occupé à autre chose. Des sauvegardes qui s’exécutent « d’habitude ». Des procédures de restauration qui n’ont pas été testées depuis que la personne qui les a rédigées a déménagé à Vancouver. Des dépendances que personne n’a répertoriées parce que le projet dépassait déjà son budget avant même que quelqu’un ne pense à poser la question.
Et puis, l’échec fait du bruit. Quelqu’un tombe dessus lors d’un incident réel et, d’un coup, trente personnes se retrouvent en conférence téléphonique, dont la moitié lit le manuel d’exploitation pour la première fois. Le manuel part du principe que Gary est aux commandes. Gary est à Kelowna. Le manuel, c’est de la fiction.
On a vu ce scénario se répéter assez souvent pour qu’on en ait marre. L’échec, c’est jamais rien d’extraordinaire. C’est toujours la même chose : ennuyeux. La dépendance que personne n’a documentée. Le test que personne n’a fait. L’hypothèse que les mêmes personnes seraient toujours là.
Ce qui change la donne
Teste comme si c'était pour de vrai
Si tu n’as pas testé ton plan de reprise, tu n’as pas de plan de reprise. Tu as juste une hypothèse. La plateforme d’orchestration de la résilience de Kyndryl exécute la bascule automatisée, la détection des anomalies et les tests de reprise d’un simple clic.[source] Voilà pour les outils. Le principe est plus ancien : les équipes bien formées se remettent sur pied en quelques heures. Les équipes non formées passent la première heure à débattre de l’ordre des opérations, ce qui est une très mauvaise façon de découvrir que ton plan comporte des lacunes.
Maîtrise la séquence
La reprise, c'est pas une question d'effort, mais d'organisation. Quels systèmes redémarrent en premier ? Qu'est-ce qui dépend de quoi ? Qui déclenche la bascule et qui vérifie qu'elle a bien marché ? Chaque minute passée à se demander « qui fait quoi » est une minute de moins consacrée à « l'action ».
Kyndryl sauvegarde plus de 3,5 exaoctets par an pour plus de 9 000 clients répartis dans plus de 300 centres de résilience dans 60 pays.[source] Tu n’achètes pas un simple chiffre. Tu achètes la mémoire musculaire acquise en faisant ça des milliers de fois. La mémoire musculaire, elle, ne panique pas à 3 heures du matin.
Opte pour ce qui a fait ses preuves
Des architectures de reprise basées sur Dell, Veritas, Microsoft Azure ou Cohesity, selon ce qui convient, déployées via le cadre de reprise après incident cybernétique de Kyndryl.[source] Le rôle d’ISM , c’est d’adapter ces modèles à ton environnement spécifique. Les outils sont disponibles partout dans le monde. C’est à toi de décider comment les appliquer ici, en fonction de tes opérateurs, de tes exigences de conformité et de ta fenêtre de maintenance prévue le deuxième jeudi de chaque mois à 16 h.
Sache où se trouvent tes données de sauvegarde
Voilà ce qui prend les gens au dépourvu. Si tes sauvegardes sont répliquées dans une infrastructure soumise à une législation étrangère, ton plan de reprise après sinistre pose un problème de juridiction. Tu t'en rendras compte au pire moment possible. La souveraineté en matière de reprise après sinistre n'est pas une simple note de bas de page. C'est un choix architectural qui détermine si ta conformité résiste au même incident que tes systèmes.
Le centre des opérations de sécurité (SOC) de Kyndryl à Barrie, en Ontario, garantit que les personnes qui gèrent ton incident de sécurité opèrent dans le même cadre réglementaire que toi.[source] Cette harmonisation est plus importante lors d’un incident qu’à tout autre moment. Quand il est 2 h du matin et que tout part en vrille, tu veux que l’équipe soit dans le même pays et que les données se trouvent dans la même juridiction. Point final.
Ce qui s'améliore
Quand la résilience est mise à l'épreuve, plutôt que considérée comme acquise :
Les pannes durent moins longtemps, car l'intervention est répétée. Les audits sont simplifiés, car les tests sont documentés. La direction gère des risques prévisibles plutôt que des imprévus. Ton équipe n'a plus à redouter chaque changement, car la reprise est fiable, et pas seulement théorique.
Et voilà l’avantage inattendu : des données de reprise après sinistre propres et bien gérées servent de base à la reconnaissance de formes et aux opérations prédictives. C’est la même rigueur qui rend la reprise après sinistre fiable qui permet l’intégration future de charges de travail en IA. Faire d’une pierre deux coups, sans chichis.
Par quoi commencer ?
Fais l'inventaire de tes actifs. Identifie les services, les dépendances et ce que signifie vraiment « restaurer » pour chaque système. Pas ce qui est écrit dans la documentation technique, mais ce qui se passe un vendredi soir.
Fais de la confidentialité une priorité au quotidien. Les artefacts de restauration contiennent des données sensibles, parfois même des copies intégrales de l'environnement de production. Traite-les en conséquence.
Mets en place une gouvernance claire : qui valide un changement lié à la remise en service ? Qui est responsable des tests ? Où sont conservées les preuves ? Regroupe tout ça dans un seul système.
Protège les données elles-mêmes: crypte-les, contrôle les accès et surveille leurs mouvements. Les sauvegardes et les répliques sont des cibles, pas des éléments secondaires.
ISM conçoit et teste la reprise après sinistre dans des environnements gérés par le Canada, en s’appuyant sur la plateforme de résilience de Kyndryl et sur des équipes locales qui savent parfaitement ce que « restaurer » signifie pour tes systèmes. En cas d’incident, la procédure d’intervention est rodée, les experts sont sur place et les données nécessaires sont déjà enregistrées dans le système.
Pneus d'hiver. Testés sur chaussée sèche. Prêts à affronter les conditions difficiles.
