Tech.Rocks Summit 2025

Faire de vos métadonnées le GPS de l'industrialisation de l'IA

Tech.Rocks Summit 2025 · 2 décembre 2025 · 17 min · en français

Résumé

Au Tech.Rocks Summit 2025, Céline Thooris s'adresse aux organisations dont les initiatives data, IA et GenAI peinent à se déployer et dont la gouvernance des données est jugée lente. Elle propose de penser la data à l'échelle de l'entreprise et d'utiliser la gouvernance des données pour simplifier la navigation dans le SI, pour les humains comme pour les IA. Sa méthode en quatre étapes : réaligner équipes, SI et données (reverse Conway maneuver), urbaniser les données et modéliser les domaines, appliquer un « shift left » dans les chaînes de delivery, et travailler les métadonnées pour alimenter les outils de gouvernance.

L’essentiel

Structurer les données et leurs métadonnées pour donner à l’IA le contexte de l’entreprise.

Pour discuter de l’organisation des données avant d’industrialiser des usages de l’IA.

Les idées clés

  1. Donner à l’IA le contexte de l’entreprise. Céline Thooris propose de structurer les données pour construire une représentation numérique de l’entreprise : ce contexte doit aider les agents à produire des réponses pertinentes. à 4:47
  2. Commencer par l’organisation des données. Sa méthode consiste à identifier les domaines de données, en évitant les redondances et les zones oubliées, puis à examiner les écarts entre cette représentation et l’organisation existante. à 10:11
  3. Faire vivre ce modèle dès le développement. Elle recommande d’appliquer tôt les conventions, règles de qualité et validations, puis de faire remonter les métadonnées vers les catalogues et dictionnaires de données. à 13:26

Questions pour votre équipe

La conférence propose une démarche d’organisation. Elle ne fournit pas un modèle de données prêt à l’emploi ni une preuve de retour sur investissement applicable à toute entreprise.

Chapitres

  1. Présentation et enjeux
  2. Le jumeau numérique de l’entreprise
  3. Organiser la responsabilité des données
  4. Définir les domaines de données
  5. Faire remonter qualité et métadonnées
  6. Synthèse de la démarche

Summary

At the Tech.Rocks Summit 2025, Céline Thooris addresses organisations whose data, AI and GenAI initiatives struggle to scale and whose data governance is seen as slow. She proposes thinking about data at company level and using data governance to make the information system easier to navigate, for humans and AI alike. Her four-step method: realign teams, systems and data (reverse Conway manoeuvre), map data and model domains, apply a "shift left" in delivery pipelines, and work on metadata to feed governance tools.

Thèmes : Data

Transcript complet

Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.

Maintenant, il y a un événement important qui arrive, c'est le prochain talk. Et ce n'est pas n'importe quel talk, parce que vous savez qu'il y a un rituel depuis l'an dernier, c'est que nous faisons ce qu'on appelle le tremplin, un concours pour donner une place particulière à certains speakers. Et là, en plus, je suis ravie, parce que c'est une femme, c'est Céline Tauris, qui a gagné le concours tremplin des speakers TechRock cette année. Elle est Consulting Director Data chez WinVision. Et Céline, elle va nous rappeler que sans données bien rangées, c'est assez compliqué en termes de gouvernance. Ça donne une IA qui peut être aveugle et un ROI fantôme. Elle va nous proposer une méthode pour réorganiser le système d'information comme un véritable GPS qui va guider les humains que nous sommes dans les labyrinthes de l'entreprise. Voilà 15 minutes pour comprendre comment on remet de l'ordre dans ce chaos. Merci d'applaudir Céline Tauris. Ma chère Céline, ça va ?

Super. En forme? Oui, ça va. Vous n'avez pas soufflé une bougie, Céline, non? Ça va aller? Non, non, moi c'est en janvier, donc on a le temps. Très bien. Vous avez des slides ou pas, Céline? Oui. Alors, vous avez la petite zapette. À tout à l'heure. Bonjour à tous. 95% des entreprises qui se sont lancées dans des initiatives d'IA générative en 2025 avouent n'en tirer aucun retour sur investissement, pas de valeur générée. Ce chiffre, il nous vient de l'Institut Nanda, qui est associé au MIT, et il a fait beaucoup de bruit à la rentrée 2025. Et même si on peut contester la méthodologie, l'échantillon, ce chiffre, en fait, il nous parle, parce qu'il caractérise une réalité que nous sommes nombreux à vivre en entreprise. Cette réalité, c'est que les IA génératives, on arrive tous à faire des POC, on arrive tous à faire des pilotes, mais pour aller au-delà et bénéficier de la révolution, c'est vachement plus compliqué. Cette réalité-là, moi je la vis au quotidien, je suis consultante data et j'accompagne des clients de tout secteur, de toute taille, dans leur déploiement de l'IA générative.

Donc on définit la stratégie, on définit les feuilles de route, et moi personnellement je travaille aussi les fondations data pour accompagner tous ces clients à mettre en place tout ce qu'il faut pour que justement ça puisse se transformer et ça puisse être une révolution dans les entreprises. Je suis personnellement une convaincue. Q de l'IA générative. Je sais que c'est en train de bouleverser nos entreprises, nos modèles économiques, mais aussi nos sociétés. Mais oui, comme tout le monde, chez nos clients et même dans notre entreprise Sphère We Envision, en fait, une fois qu'on a développé tous les cas d'usage classiques, on a du mal à passer le cap d'après. Et le constat que je fais, c'est, quoi qu'on fasse, nos feuilles de route diagénératives, elles sont en silo. On développe les cas d'usage, équipe par équipe, département par département. Donc on va avoir un chatbot client, on va faire un cas d'usage pour la finance, on va réussir à automatiser un process, mais finalement, on va rester dans notre structure organisationnelle. Et c'est assez normal parce que nos données, elles sont encore silotées. Malgré les efforts de centralisation qu'on a pu faire depuis les années 2010, nos données, elles restent les données marketing, les données finance, et elles sont très peu réconciliées, elles sont très peu connues dans l'entreprise.

Le fait que ces données soient silotées comme ça, moi, ça me fait beaucoup penser à la loi de Conway. Et en fait, la data, elle n'échappe pas à la loi de Conway. Les données, elles suivent la même structure que notre organisation. La loi de Conway, vous savez, c'est cette observation de Melvin Conway qui nous dit que, quelle que soit l'architecture du système d'information qu'on dessine sur le papier, Tôt ou tard, le système d'information finira par ressembler à l'organisation de l'entreprise. Il finira par suivre les lignes de communication de l'entreprise. Et ça, quand on essaye de déployer de l'IA générative, quand on pense à un système agentique, quand on pense à des agents qui vont être nos collaborateurs de demain, à côté des collaborateurs humains, ça devient un problème en fait. Alors comment on fait pour dépasser tout ça? C'est ce que je vous propose de voir ensemble aujourd'hui. Et je vous propose qu'on ressorte un concept que vous connaissez probablement tous, en tout cas vous en avez tous entendu parler, c'est le jumeau numérique de l'entreprise. Un jumeau numérique, c'est quoi? C'est la version digitale de votre entreprise. Donc c'est le reflet de toutes les activités qui font votre entreprise.

Et on le connaît parce qu'on en a beaucoup entendu parler avec MySpace, où on se baladait dans un environnement virtuel, on allait dans un magasin, on pouvait discuter avec des collègues de manière virtuelle. Et là, je vous propose qu'on laisse de côté cette question d'interface et qu'on s'intéresse pour le coup à ce qu'est un jumeau numérique. Et un jumeau numérique, finalement, c'est une collection de points de données. C'est même la collection de l'ensemble des données qui font votre entreprise. Et ces données... On les met dans une structure. un peu plus que juste des données tabulaires, des données structurées que vous avez dans vos bases de données. Il faut qu'on se pose la question de savoir comment la GED, par exemple, on la met dans une structure donnée. Il faudra qu'on se pose la question de savoir comment est-ce que tous les échanges que vos collaborateurs ont, tout ce qui se passe dans les réunions, voire tout ce qui se passe à la machine à café, comment on fait pour le mettre dans une structure de données. Si on arrive à construire ce jumeau numérique de l'entreprise, si on arrive à avoir cette représentation digitale de l'entreprise, on arrivera à apporter aux IA génératives tout le contexte de notre entreprise.

Et pour les personnes qui ont un peu manipulé l'IA générative, quand on apporte du contexte à une IA, c'est là qu'on a les réponses pertinentes. C'est là qu'enfin l'agent est efficace et qu'il peut vraiment vous accélérer au quotidien. Et aujourd'hui, la techno, elle est mature. On a tous les outils, ou en tout cas, les outils sont en train d'arriver. Dans quelques mois, ce sera un problème réglé. Maintenant, il faut qu'on se concentre sur la maîtrise de notre patrimoine informationnel pour pouvoir ensuite le mettre au service des agents. Et soi-disant passant, je pense que ça fera du bien aussi aux êtres humains. Alors c'est sympa, mais comment on fait? Et bien moi, quand j'arrive chez mes clients, la première chose que je vais regarder, la première question que je vais poser, c'est qui est chargé de construire cette structure des données à l'échelle de l'entreprise? Oui, parce que c'est un sujet qui est tellement vaste qu'il faut avoir au moins une personne qui va se le prendre, qui va se le chier. Levier, corps et âme. Et donc, je cherche cette personne-là. Et de par mon métier et de par ce que je connais de la data gouvernance, souvent je vais voir les équipes de data gouvernance en leur disant« Bon, alors, la structure des données de l'entreprise, est-ce que vous pouvez me la montrer?

» Et souvent, les équipes de data gouvernance me disent« Ah ben attends, notre boulot, c'est de gérer la donnée de l'entreprise, c'est d'accompagner les équipes et de définir les processus pour savoir comment est-ce qu'ils vont pouvoir gérer leurs données. » OK, mais la donnée, on ne s'en occupe pas forcément en tant que telle. Effectivement, les équipes de data gouvernance se sont beaucoup construites autour des questions d'accessibilité, de sécurité. Elles se sont construites à juste titre sur les réglementations et les réglementations européennes qu'on doit tous respecter. Elles se sont beaucoup intéressées à l'aspect gouvernance, mais peut-être un peu moins à l'aspect données, à l'aspect knowledge management. Alors, quand j'ai fini de discuter avec les équipes de data gouvernance, je vais voir les équipes d'architecture. Oui, un architecte, il est là pour faire les plans, il établit le blueprint, normalement il doit poser les fondations pour que derrière on puisse ensuite construire nos systèmes. Oui, mais quand je discute avec les architectes d'entreprise, ou les data architectes, pour le coup, parce que c'est des fonctions qui existent aussi, on me dit, nous, on s'occupe du SI applicatif.

Donc, si tu veux savoir comment sont connectées les différentes bases de données, pas de souci, on te montre le schéma, on te fait les flux, on t'explique comment c'est connecté. Mais par contre, le contenu, la signification des données, Non, ce n'est pas trop notre boulot, en fait. Et du coup, souvent, dans les entreprises, on n'a personne vraiment qui s'occupe de construire cette structure, ce modèle des données, ce jumeau numérique de l'entreprise à l'échelle de l'entreprise, et pas seulement dans un domaine particulier. Alors je vous propose aujourd'hui qu'on crée un nouveau rôle. Et ce nouveau rôle, moi je l'appelle urbaniste de la donnée. Je sais qu'il y a des rôles d'urbaniste dans les DSI, et là je vous propose que ce rôle soit un peu différent, et ce rôle, c'est celui qui va être responsable de la construction, de la mise en place, de la structure des données. Et si vous me posez la question de savoir, oui, mais alors bon, il faut quand même le mettre dans un département, dans une équipe, est-ce qu'il vaut mieux le mettre à la data gouvernance ou auprès des architectes? Ma réponse préférée, ce serait de dire, juste entre les deux, c'est mon petit côté suisse, mais en fait, je pense qu'il vaut mieux le mettre plus proche de la data gouvernance pour justement le couper de la technologie, le couper du SI, parce qu'on est dans un sujet

qui n'est plus un sujet technologique, mais qui est bien un sujet d'organisation. Bon, on a un urbaniste des données, ok, il est censé nous construire le jumeau numérique de l'entreprise, sympa, mais si lundi prochain cet urbaniste des données arrive chez vous, qu'est-ce qu'il fait, par quoi il commence, comment il va construire ce jumeau numérique de l'entreprise? Ça paraît être un chantier titanesque pour le coup. J'aimerais justement, dans les 10 minutes qui me restent, vous proposer une méthode, ou en tout cas les premières étapes que cet urbaniste doit suivre pour progressivement construire le jumeau numérique de l'entreprise et embarquer toute l'entreprise dans la constitution de ce jumeau numérique et comment est-ce qu'on va faire vivre ce jumeau numérique au fil du temps. Et mon premier chantier, c'est une reverse Conway Manœuvre. Alors, la reverse Conway Manœuvre, c'est... Prendre à bras le corps la loi de Conway, c'est de se dire, de toute façon, on ne peut pas lutter contre la loi de Conway, finalement, elle sera toujours là, c'est comme une force physique qui s'applique. Mais par contre, si on prend au conscient

de la loi de Conway, si on arrive à se l'approprier et justement à mettre en lumière les dissonances liées à la loi de Conway, alors on peut corriger certaines choses et on peut réaligner certaines choses. Et ici, l'urbanisme, son premier travail, ça va être de dessiner les grosses bulles macro de ce qu'est l'entreprise avec ses données. Et ça veut dire, c'est vraiment un travail qu'il faut voir comme un brouillon, quelque part, où on va poser les différents data domaines. Le but du jeu, c'est quand même qu'il n'y ait pas de redondance, et le but du jeu, c'est qu'il n'y ait pas de trou dans la raquette. Une fois que ces domaines de données sont posés, alors on peut aller un peu plus loin et alors on peut avancer. Et déjà, on voit qu'on met en lumière pas mal de dissonances entre le système d'information et l'organisation des activités data de l'autre côté. Et déjà, quand on fait ça dans nos entreprises, il y a des ajustements qui s'opèrent. Quand je propose ça à mes collègues, ils me disent« Ouais, mais attends, ça c'est du data mesh, on a déjà vu, il faut faire les domaines de données, nous on a déjà fait nos domaines de données, et le data mesh c'est sympa parce qu'ensuite, il n'y a plus qu'à faire le lien de communication entre les différents domaines de données.

» Et c'est vrai, le data mesh, la première étape, c'est de définir vos domaines de données. Mais par contre, souvent, je trouve, en tout cas dans les entreprises que je vois, qu'en termes de structure, on s'arrête là. Alors que c'est justement là qu'il faudrait aller un peu plus loin. Et le deuxième chantier que je fais avec l'urbanisme de la donnée, c'est un chantier de modélisation. La modélisation des données, si vous avez des DBA ou des gestionnaires de bases de données dans votre entreprise, ils vous répondront « Ouais, attends, on fait ça depuis la nuit des temps, on connaît ça par cœur. » Et oui, c'est vrai, c'est un domaine qui existe. On a toutes les méthodologies pour faire ça, on connaît ça par cœur. On l'a un peu mis de côté avec l'ère du big data où on nous a dit« Non, mais il suffit de tout dumper dans cet endroit-là et puis ça va bien se passer. » En fait, non, on a besoin d'une structure des données, juste parce qu'on a besoin de connaître et de maîtriser notre patrimoine de données. Donc ce chantier de modélisation, on sait le faire. Par contre, il faut qu'on dépoussière la matière, il faut qu'on dépoussière Kimball, il faut qu'on se le réapproprie et qu'on le pense en dehors du système d'information, qu'on le pense en dehors des bases de données qu'on a actuellement et qu'on se pose la question, attends, mais modéliser à l'échelle de l'entreprise, en fait,

qu'est-ce que ça veut dire? C'est quoi la structure qu'on doit créer derrière? Ici, l'urbaniste de la donnée, ce n'est pas lui qui va faire toute la modélisation, toute la chaîne, avec tout le lien entre le système physique qui hoste vos données et derrière les concepts un peu plus métiers. Ce n'est pas lui qui va faire ça. Par contre, l'urbaniste doit absolument définir la méthodologie. Et cette méthodologie, il doit ensuite aller la faire appliquer. Parce que oui, c'est notre troisième chantier. Si on ne définit pas une méthodologie pour opérationnaliser un peu tout ça, on sera parti dans un exercice de six mois où il y a des mecs qui vont plancher, qui vont écrire des trucs, et au moment où ils vont sortir la tête de l'eau, ils vont dire« c'est bon, j'ai fini». Et bien en fait, ce sera déjà obsolète. Alors comment on fait pour que justement ce jumeau numérique, il arrive à se constituer, il arrive à se renforcer, et que que ce soit quelque chose de progressif qui vive dans l'entreprise. Et dès pour ça, on opère un shift left. Et le shift left, c'est un mouvement qui est super intéressant, qui nous vient du software development. Et je vous invite à lire l'article de Chad Sanderson qui a écrit le shift left data manifesto.

Il l'a publié en avril 2025. C'est un article qui est super intéressant parce qu'il prend ce concept de shift left et justement, il l'applique à la data. Et le shift left, ça consiste à faire remonter dans les chaînes opérationnelles, c'est à mettre au plus tôt dans les chaînes de développement tout le framework, toute la structure. Et pour notre modèle de données, ça veut dire obliger les data ingénieurs et les développeurs à appliquer la nomenclature. Soit dit en passant, on fait remonter aussi toutes les règles de data gouvernance, tout ce qui est règles de qualité, tout ce qui est validation automatique, tout ça doit remonter au plus tôt dans les chaînes de développement. Et ça doit être fait dans un framework standard, dans un framework uniforme. Et quand on a des data ingénieurs qui font ce shift left, qui appliquent tout le cadre que l'urbaniste aura défini, et que justement on est en ligne dans notre structure de la donnée, C'est là qu'on commence à constituer et à faire vivre la structure des données, c'est là qu'on commence à constituer le jumeau numérique.

Et ce jumeau numérique, pour le voir apparaître, on va faire remonter les métadonnées. Tout ce que votre développeur va faire sur ces pipelines de données, toutes les données du framework qu'il va mettre dedans, ce sont des données qui vont être des métadonnées et qu'on va pouvoir faire remonter dans des outils. Et ces outils, en fait, vous les avez déjà. C'est des outils de catalogue de données, c'est des outils de dictionnaire de données. Et cette structure de métadonnées que vous aurez créée avec le shift left, avec l'exercice de modélisation, avec les domaines de données, tout ça, vous allez pouvoir le faire remonter dans votre dictionnaire de données et progressivement, vous allez voir apparaître la structure de votre jumeau numérique. Si le sujet vous intéresse, j'ai que 15 minutes, je n'ai pas le temps de tout... creusé ici, je vous invite à aller lire le livre de Olé Olesen-Bagneux qui s'appelle Fundamentals of Metadata Management. C'est hyper intéressant et justement il propose une méthode très très pratique pour travailler la structure des métadonnées, parce que oui, il y a aussi une structure aux métadonnées, pour justement avoir un standard d'entreprise et ensuite pouvoir le faire remonter dans les outils.

Vous l'avez compris, je suis convaincue que si on veut passer au cap d'après avec l'IA générative et accélérer avec l'agentique, il faut qu'on maîtrise le patrimoine informationnel de notre entreprise. Ça, ça se fait en construisant un jumeau numérique de l'entreprise, en construisant le modèle de données de votre entreprise à grande échelle. Pour ça, ma méthode, c'est d'identifier un urbaniste de la donnée qui va prendre ce sujet à bras-le-corps. Et pour commencer le travail, structurer les domaines de données, travailler une méthode de modélisation pour toute l'entreprise, la faire appliquer avec un shift left. Et travailler la structure de metadata pour les faire remonter dans le dictionnaire de données. J'en ai fini pour aujourd'hui, j'espère que ça vous a plu. C'est un sujet vivant, c'est une matière vivante, donc n'hésitez pas à venir me voir, je serais ravie en tout cas de pouvoir en discuter avec vous. Merci beaucoup. Merci Céline, bravo! Ah, ce tremplin, canon! C'est chouette, hein? J'ai adoré Urbaniste de la donnée. C'est beau, c'est poétique, ça donne envie. Et je suis sûre que tu pourras discuter aussi avec pas mal de personnes dans la salle, parce que malheureusement, tu n'as pas une de session questions-réponses.

En revanche, tu as ton QR code. Fantastique. Tu vas pouvoir avoir les retours en live bientôt de ce public absolument convaincu par ce que tu viens de dire. Génial. Merci beaucoup. Merci beaucoup Céline.