29 septembre 2026

La protection, ça commence par une cartographie

Séries de données
1

Temps de lecture :

5 min de lecture

5,2 millions de Canadiens ont été exposés à la suite d’une seule faille de sécurité. La cause profonde n’était pas un piratage, mais une défaillance au niveau du catalogage. Découvre le rôle réel d’un catalogue de données et les conséquences de son absence.

Auteur

Dimitri Phalen est le responsable marketing chez ISM , qui préfère un langage clair aux grandes promesses. Depuis des années, il bosse en coulisses pour transformer des problèmes informatiques complexes et confus en solutions concrètes pour les équipes. Si un texte donne l'impression d'avoir été écrit par quelqu'un en manque de caféine qui a passé trop de temps avec l'équipe de livraison, c'est sûrement de sa faute.

5,2 millions de Canadiens. C’est le nombre de personnes dont les données personnelles ont été divulguées lors de la faille de sécurité chez PowerSchool, qui a touché des conseils scolaires dans 8 provinces fin 2024 (CBC News, janvier 2025). Des dossiers d’élèves remontant jusqu’en 1965. Noms, adresses, numéros de carte d’assurance-maladie, numéros de sécurité sociale. Des données accumulées dans les systèmes depuis des décennies, détenues par des organisations incapables de dire ce qu’elles possédaient ni où ces données se trouvaient.

Le commissaire à la protection de la vie privée de l’Ontario a mené une enquête. Celui de l’Alberta aussi. Ils sont tous les deux arrivés à la même conclusion : les conseils scolaires n’avaient pas de plans adaptés pour gérer les fuites de données, n’avaient pas prévu de clauses de confidentialité dans leurs contrats avec les fournisseurs et n’avaient aucune politique pour surveiller les logiciels tiers qui stockaient toutes ces infos (IPC de l’Ontario et OIPC de l’Alberta, novembre 2025). La fuite a commencé par des identifiants piratés sur un compte d’assistance. L’attaquant a franchi une porte dont personne ne soupçonnait l’existence, pour accéder à des salles remplies de données que personne n’avait répertoriées.

C'est un problème de classement. Les demandes de rançon, les menaces de recours collectifs, les décisions des commissaires à la protection de la vie privée : tout ça vient d'un seul problème de départ. Personne ne pouvait répondre à la question « qu'est-ce qu'on a et où est-ce que ça se trouve ? »

Ton catalogue, c'est soit un système dynamique, soit une simple feuille de calcul décorative

Un catalogue de données, c'est un système intégré et dynamique qui recense tes données, leur attribue des métadonnées, évalue leur niveau de confidentialité et leur propriété, et les rend accessibles à toutes les équipes. Ce n'est pas une feuille de calcul créée lors de la dernière migration et intitulée « liste_maître_finale_v2 ».

Quand ça marche, ton équipe d’analyse trouve un ensemble de données, vérifie qu’il est à jour, s’assure qu’il est conforme et s’en sert. Plus besoin d’attendre qu’un collègue d’un autre service te transmette le fichier CSV de l’année dernière. Plus besoin de découvrir, trois semaines après le début d’un projet, que les données n’ont jamais été validées pour cet usage. Quand ça n’existe pas, toutes les autres initiatives s’enlisent face à la même question à laquelle personne ne peut répondre.

Où se trouve quoi (et ce dont personne ne t'a parlé)

Voilà le bilan que personne n'a envie de faire.

Production. C’est là que les données concernées sont censées se trouver. En pratique, c’est là que trois équipes produisent des rapports à partir de trois versions différentes des mêmes données, parce que chacune a extrait ce dont elle avait besoin à un moment différent et que personne n’a synchronisé le tout.

Développement. Quelqu’un avait besoin de données de test réalistes. Il a copié l’environnement de production. Sans rien masquer. De vrais noms, de vraies adresses, de vrais numéros de compte. Ça s’est passé il y a deux RSSI et personne n’a fait le ménage parce que personne ne savait que ces données étaient là.

Analytique. Un extrait de 2021, toujours actif, qui alimente encore un tableau de bord consulté par 6 personnes sans que personne ne pose de questions. La source a changé il y a 18 mois. L’extrait, lui, n’a pas bougé.

Le serveur de fichiers de l'ancienne génération. Il a survécu à deux migrations, une transition vers le cloud, une réorganisation et un hiver à Saskatoon. Il contient des données provenant d'un système mis hors service en 2018. Personne n'en est responsable. Tout le monde est convaincu que c'est le problème de quelqu'un d'autre.

Quatre niveaux. Quatre lacunes dans le catalogage. Quatre raisons pour lesquelles ton projet d'IA stagne dès qu'il essaie d'exploiter des sources qui n'ont pas été classées, organisées ou validées.

Le savoir tribal, c'est un point de défaillance unique qui présente des avantages sociaux

Dans la plupart des organisations, celui qui sait vraiment où se trouvent les données, c’est celui qui a mis en place une solution de contournement en 2017 et qui ne l’a jamais documentée. Appelons-le Gary. Il sait quelle table contient les vrais identifiants clients, quel extrait est à jour et quel système « ne compte pas » parce qu’il était censé être temporaire il y a 4 ans. Ce n’est pas l’architecte. C’est la personne qui avait besoin que quelque chose fonctionne un vendredi après-midi et qui a fait en sorte que ça marche.

Un catalogue reprend ce que Gary a compris et le rend accessible à tout le monde. Pas parce que Gary s’en va (même si c’est possible), mais parce qu’une organisation qui repose sur la mémoire d’une seule personne ne peut pas évoluer, ne peut pas être contrôlée et ne peut pas répondre à un organisme de réglementation dans des délais qui ne nécessitent pas la mise en place d’une cellule de crise.

Conçois-le pour les gens, pas pour le dossier de conformité

Tu ne vas pas tout cataloguer d’un seul coup. Choisis les ensembles de données les plus importants : ceux qui alimentent le projet d’IA, ceux sur lesquels l’auditeur va poser des questions, ceux pour lesquels trois équipes se disputent en ce moment même. Commence par là. La plupart des organisations sont à la merci de la personne qui sait par hasard où se trouvent les choses. Un catalogue remplace le savoir tribal par quelque chose qui survit à une lettre de démission.

Le service informatique pourrait le développer tout seul. Mais si les services opérationnels ne s'en servent pas, ça deviendra un outil inutile en moins d'un trimestre. Le catalogue doit être assez intuitif pour qu'un chef de projet à Winnipeg puisse y faire une recherche sans avoir à envoyer une demande à l'équipe de Regina.

Considère les métadonnées comme une infrastructure. Propriété, droits d’accès, classification, cycle de vie : tout doit être répertorié et mis à jour. La plupart des entreprises créent un catalogue, crient victoire et passent à autre chose. Six mois plus tard, les métadonnées sont obsolètes et l’outil n’est guère plus utile que le tableur qu’il a remplacé.

Microsoft Purview s'occupe du gros du boulot : découverte automatisée, classification, traçabilité et étiquetage de sensibilité, aussi bien dans le cloud qu'en local. Les outils existent. C'est la rigueur nécessaire pour les alimenter qui fait la différence entre un catalogue vivant et un monument inutile.

Ce contre quoi un catalogue te protège

La faille chez PowerSchool fait la une, mais il y a un autre problème, plus discret, qui revient chaque semaine. Une IA entraînée sur des données non validées. Des environnements de test qui utilisent des dossiers de production non anonymisés. Des plans de migration bloqués parce que personne ne peut confirmer ce qu’ils visent exactement. Une équipe juridique qui découvre un problème lors d’un contrôle qui devait être de routine.

Le catalogue répond à la question qui précède toutes les autres : qu'est-ce qu'on a ?

Où ça va nous mener ?

Une fois que tu sais ce que tu possèdes, la question suivante est de savoir qui d'autre y a accès. Ta politique dit une chose, mais ton environnement en fait une autre.

Après la confidentialité, il y a les règles qui garantissent l'intégrité du catalogue. Personne n'est promu pour son travail de gouvernance.

Et si tu veux savoir comment le catalogage influe sur la réussite ou l'échec de tes projets d'IA, c'est justement là-dessus que repose notre service de préparation à l'IA.

Tu veux comprendre comment on bosse ?

Chaque conversation commence par ton environnement. Pas par notre liste de produits.

Contacte-nous
FlècheFlèche

Ce n'est pas une question de technologie ou de processus. C'est une question de clients, d'utilisateurs et de la confiance que tu as mis tant d'efforts à gagner. Chaque membre de notre équipe garde ça à l'esprit.

CTA mobile