← BibliothèqueToutes les vidéos
Tech.Rocks Summit 2020
Manager des équipes data science
- Michel Lutz (Group Data Officer, Total)
Tech.Rocks Summit 2020 · 10 décembre 2020 · 16 min · en français
Résumé
Talk du Tech.Rocks Summit 2020 consacré au management des équipes de data science.
Summary
Tech.Rocks Summit 2020 talk on managing data science teams.
Thèmes : Management & organisation · Data
Transcript complet
Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.
Notre prochain speaker est titulaire d'un doctorat en génie industriel et d'un MBA. Et depuis 2016, figurez-vous qu'il accompagne la transformation numérique chez Total, appliquée aux géosciences dans l'univers de l'intelligence artificielle. Il va nous expliquer justement comment manager des équipes de data science. Voilà un talk 100% inspiration. Merci Elsa. Bonjour à tous, je suis ravi d'être avec vous aujourd'hui. Donc effectivement, je suis Data Officer du groupe Total et je suis également responsable de l'équipe Data, la Digital Factory Total. Donc avant de vous expliquer un peu plus en détail en quoi ça consiste, je voulais juste vous rappeler que cette vidéo est interactive, donc n'hésitez pas à me solliciter, à me questionner via le chat, ce sera avec plaisir que je vous répondrai. Voilà, donc avant de rentrer dans le détail de mes activités, je souhaitais juste repréciser mes grandes ambitions, qu'est-ce que moi j'ai envie de faire pour le groupe Total.
Alors d'une part, une de mes ambitions c'est vraiment de faciliter l'accès à la donnée en général, donner des outils pour que le plus grand nombre de mes collègues puissent tirer parti de la donnée, donc y accéder et être capable de l'analyser. Je suis vraiment convaincu qu'aujourd'hui la donnée, ce n'est pas qu'une affaire de spécialistes et il faut vraiment que tout le monde dans l'entreprise puisse en bénéficier. Mon deuxième point, Le grand objectif pour Total, c'est de développer un vrai savoir-faire en développement de ce que j'appelle software 2.0, donc en fait du logiciel qui inclut des briques de machine learning, donc qui inclut des capacités d'apprentissage et d'évolution. Pour cela, on s'appuie sur des transformations de fonds qu'on mène maintenant depuis 4 années déjà dans le groupe. Ces transformations s'articulent autour de 3 grands piliers. Le premier, c'est bien sûr l'évolution des systèmes technologiques. On a une chance chez Total, c'est qu'on a une entreprise très riche en données. Donc juste quelques chiffres pour illustration.
La donnée chez Total, c'est 15 pétaoctets d'archives de données sismiques. C'est des millions de capteurs qui remontent des données tous les jours en temps réel, donc de toutes nos installations industrielles, nos plateformes pétrolières, nos raffineries. Mais aussi de toutes les nouvelles activités de Total dans les renouvelables et l'électricité. Donc c'est les données qui remontent des sites solaires, des sites éoliens, de la production de batteries ou des bornes de rechargement. Et bien sûr, Total, c'est aussi énormément de données clients. Donc on a des archives de données pour plus de 10 millions de clients en station, de l'activité B2B ou la distribution d'électricité. Le sujet par contre, c'est que toutes ces données, elles proviennent de systèmes opérationnels, de systèmes de gestion. Et donc, ce qu'il faut, c'est mettre en place des plateformes pour mettre à disposition ces données, la stocker, la cataloguer. pour qu'on puisse la retrouver facilement, et bien sûr avoir des outils pour l'analyser. Donc ça, c'est vraiment des transformations de longue haleine que je mène avec la direction informatique du groupe. Mon deuxième axe de travail, de transformation, c'est l'amélioration continue des pratiques de data management.
Donc mettre la donnée à disposition, effectivement, c'est bien. Par contre, si elle est maîtrisée, c'est mieux. Et donc pour ça, je travaille avec des représentants métiers, donc des représentants des grands domaines de données du groupe. Donc là, les enjeux, les sujets sur lesquels on travaille, c'est la gestion de la qualité de la donnée, la maîtrise des référentiels, la maîtrise des métadonnées, et puis bien sûr la mise en place de rôles et responsabilités pour vraiment opérationnaliser le data management, opérationnaliser la gouvernance de la donnée. Le troisième axe de transformation, c'est bien sûr la diffusion de la culture donnée dans l'ensemble du groupe. Je l'ai dit avant, la donnée aujourd'hui, ça doit être l'affaire de tous. Et donc, on met en place tout un ensemble d'actions pour aider le groupe à progresser, pour diffuser cette connaissance de la donnée auprès de tous les collaborateurs. Donc d'une part, il y a mon équipe qui organise des ateliers d'initiation au code, d'initiation au machine learning, des data challenges pour que tout le monde puisse travailler sur les données du groupe. Puis je travaille aussi avec le service formation de Total.
Donc on a mis en place différents formats, différents contenus en présentiel ou en e-learning. Et pour tous les types de populations. On a mis en place des formations, par exemple, pour les managers du groupe, pour qu'ils puissent prendre des décisions. décision éclairée quand ils veulent intégrer la data, l'intelligence artificielle dans leur processus. On a mis en place des formats qualifiants pour ceux qui veulent vraiment apprendre à coder et qui veulent vraiment s'orienter vers les métiers de la data. Et puis on a mis aussi des formats un peu généralistes pour que tous les curieux puissent comprendre ce qu'il y a réellement derrière ce grand buzz de la donnée et du machine learning. Au-delà de cette diffusion de la culture data, il y a aussi deux états d'esprit que j'essaye de transmettre de façon continue dans le groupe. D'une part, il y a la culture de l'agilité, parce qu'en fait, tous ces sujets, toutes ces transformations, on ne peut plus les piloter aujourd'hui avec des plans à 5 ans. Il faut bien sûr, il faut savoir où on va. Par contre, il faut être assez tactique, pragmatique, flexible, et il faut trouver le bon chemin, le meilleur chemin pour bien avancer.
Deuxième point, je pense, c'est que c'est essentiel aujourd'hui d'accepter l'incertitude. J'ai un peu parlé tout à l'heure de machine learning et de software 2.0. Donc ça, c'est vraiment des briques logicielles probabilistes qui intègrent par nature l'incertitude. Et donc, il faut vraiment apprendre aux métiers, aux collègues à travailler avec ce type d'outils. Puis plus globalement, je pense que cette culture de l'incertitude, il faut qu'on l'intègre de façon générale dans la façon dont on fait nos choix technologiques et dont on construit nos pratiques de data management. Et donc tout ça, ça m'amène à parler de la Digital Factory, qui est un levier d'accélération du groupe Total, et bien sûr pour moi de développement de software 2.0. Donc finalement cette Digital Factory, c'est un peu la suite de l'histoire du digital chez Total. Avant le digital c'était quelque chose de très décentralisé avec beaucoup d'initiatives locales. Donc c'était super parce que ça nous a permis d'apprendre, de tester plein de choses sur le terrain, de voir ce qui marche, de voir ce qui marche moins bien également. Et puis maintenant, le groupe a une vraie volonté d'accélérer et de faire du digital un vrai levier de création de valeur.
Donc pour cela, ce qu'on a fait, c'est qu'on a regroupé les... les expertises du digital, du numérique, et regrouper les moyens pour créer une seule entité. Donc l'objectif derrière, c'est de faciliter le partage des savoirs et aussi de bénéficier d'un effet d'échelle. Donc aujourd'hui, la Digital Factory, c'est déjà presque 250 personnes. Quasiment que des experts en technologie numérique. L'objectif, c'est qu'on soit 300 dès 2021 et avec une mission très centrée sur la valeur. Donc la factory, une fois qu'elle sera en rythme de croisière, on a pour objectif de générer 1,5 milliard d'euros de valeur pour le groupe chaque année. Ce qui est assez passionnant, c'est que cette factory travaille pour tous les métiers du groupe, avec des sujets très variés de l'industrie 4.0, de l'optimisation de la relation client ou des sujets autour de l'électricité et de l'énergie renouvelable. En termes d'organisation, cette factorie est organisée autour de squads. Donc on a 17 squads aujourd'hui, 25 l'année prochaine.
Donc chaque squad, c'est une équipe multidisciplinaire, avec des ingénieurs logiciels, des devops, des data scientists, des data engineers, des UX designers, des product owners. Elle est autonome dans le choix de ses technologies et opérationnellement, elle est 100% dédiée au développement d'un produit sur des cycles relativement courts. Donc en général, il faut à peu près 6 à 8 mois pour finir un produit. Bien sûr, il est construit de façon toujours agile et en intéressant. action constante avec les interactions utilisateurs. Donc moi personnellement, j'ai l'immense honneur de gérer l'équipe data de cette factory. Donc l'équipe data c'est environ 30 personnes aujourd'hui, avec des compétences en data science, en machine learning, en data management et en coaching. Il y a une grosse partie de ces data scientists qui sont directement dans les squads, et puis le reste des personnes sont là en support. Donc c'est encore une équipe qui est en train de se créer. Donc je recrute, je recrute bien sûr à l'externe, donc habillé aux amateurs, s'il y a des gens dans le public qui souhaitent rejoindre mes équipes pour faire de la data science, donc n'hésitez pas, la porte est grande ouverte.
Puis je recrute aussi en interne. Parce qu'on a finalement une grosse communauté donnée chez Total, une grosse communauté data avec des gens passionnés, on se connaît bien, donc on échange depuis plusieurs années, donc on a plein de médiums d'échange, donc les réseaux sociaux internes, on fait des meet-ups internes réguliers, j'en ai parlé avant, on organise des data challenges, donc c'est une communauté qui marche bien, et puis vraiment je suis content d'accueillir aussi toutes ces personnes dans mes équipes, parce que finalement ces data scientists qui sont déjà chez Total, ou ces experts data qui sont déjà chez Total, ils amènent avec eux une très bonne connaissance de nos données et puis de nos problématiques métiers qui sont souvent assez particulières. Voilà, donc c'est assez excitant de monter une telle équipe. C'est un vrai plaisir en ce moment, d'autant qu'on commence maintenant à vraiment être une belle bande de passionnés. Et même si beaucoup sont en squad, donc vraiment opérationnellement, ils travaillent dans leur squad et à la livraison de leurs produits, on a construit quand même une communauté transverse et on travaille tous ensemble un peu sur des sujets de fond.
Donc en fait, ce qui est en train de se passer, c'est qu'avec tous ces data scientists et ces experts data, on construit aujourd'hui finalement nos pratiques, notre vision de comment on veut faire la data science chez Total, comment on veut déployer du machine learning. Et ça, c'est vraiment pas... Donc j'ai vraiment hâte de voir tout ce que ça va donner, comment tout ça va évoluer, parce que c'est vraiment une superbe dynamique. D'autant plus que je trouve qu'aujourd'hui, on est dans une période particulièrement excitante, à la fois pour la gestion du machine learning et à la fois pour l'activité business, on va dire, chez Total. Je m'explique. Donc d'une part, pour le machine learning, aujourd'hui, on est vraiment, je trouve, dans une période géniale parce qu'on a maintenant des outils robustes, des outils industriels pour faire du machine learning en production. Donc par exemple, à la factory, Nous, on travaille beaucoup avec Azure, donc avec des outils comme Databricks, Azure Machine Learning. Donc techniquement, on sait maintenant gérer le machine learning dans un contexte de production.
Et heureusement, j'ai envie de dire, parce que comme je l'ai dit avant, 17 squads en parallèle, 300 personnes qui vont faire du dev, Tout ça, ça va nous amener à déployer des dizaines, des centaines de modèles. Donc, il faut être capable de vraiment gérer ça de façon industrielle. Et voilà, donc on a maintenant les outils pour gérer ça et ça c'est super. Et du coup, ce que ça veut dire, ça nous laisse plus de temps pour travailler vraiment le modèle et vraiment j'ai envie de dire ce qui se passe. Avant et ce qui se passe après l'entraînement initial du modèle. Alors je m'explique, quand je parle de l'avant, je trouve qu'aujourd'hui on prend le temps et on a compris qu'il fallait se prendre le temps de travailler travailler vraiment finement avec le métier pour poser les bases d'un bon apprentissage. Par exemple, bien travailler sur les métriques, quelles sont les métriques qui vont guider efficacement l'apprentissage, quels sont les bons scénarios de modélisation, travailler les données aussi. J'ai parlé avant de qualité, mais une donnée de qualité, ça ne suffit pas à faire un bon apprentissage.
Ce qu'il faut faire, c'est s'assurer que le jeu de données qu'on manipule, il reflète bien la réalité business qu'on veut modéliser, qu'il n'y a pas de biais et tout ça, ça se travaille. Ça demande de l'expertise spécifique et là, les data scientists ont beaucoup de valeur quand ils sont en interaction forte avec le métier. Et après, je veux aussi parler de l'après. Aujourd'hui, comme on sait déployer et qu'on peut déployer vite des modèles, maintenant, ce qu'il faut faire, c'est penser dès le début. Dès qu'on commence à travailler sur le modèle, il faut penser à son futur. Il faut avoir à l'esprit que le premier déploiement du modèle, finalement, c'est que le début. Il faut surtout anticiper ce qui se passe après. Donc il faut être capable de penser rapidement comment on va le contrôler en production et surtout comment on va le faire évoluer. Parce que finalement, le vrai sujet, les vrais enjeux commencent quand on déploie vraiment les modèles en production. Ce qui va se passer en général, c'est que la performance va baisser, mais en même temps, une fois qu'on est en production, qu'on a vraiment la bonne occasion de capter du feedback des systèmes techniques dans lesquels l'algorithme est déployé ou alors des utilisateurs.
Donc il faut vraiment... On va travailler là-dessus. Nous, on s'intéresse beaucoup à la factory, à ces démarches qu'on appelle MLOps. Et moi, ce que je pousse beaucoup à mes équipes, c'est quand on peut, quand c'est possible, je recommande de mettre très vite un modèle en production, même s'il est imparfait, puis de le faire évoluer ensuite en captant les feedbacks des utilisateurs ou des systèmes techniques. Ce qui est vraiment intéressant, c'est que ça, ça va plus loin que de la pure technologie. Parce que c'est réellement une question de design d'application, de design de produit. La question qu'il faut se poser là derrière, c'est comment je construis une application avec un modèle peut-être imparfait, mais qui va m'apporter suffisamment de services pour que l'utilisateur ait envie d'interagir avec et ainsi faire évoluer positivement le modèle. Et ça, c'est vraiment passionnant. Et ça renvoie aussi à des notions de design et aussi un peu à cette idée dont je parlais au début, le sujet de l'incertitude. Finalement, il faut apprendre aux utilisateurs à travailler avec ce type de solution. Et c'est d'autant plus important dans le cadre de la factory, puisque comme je l'ai dit avant, on travaille sur des horizons de temps court, donc on n'a pas un an pour faire un modèle parfait, il faut se dire qu'est-ce qu'on est capable de livrer au bout de six mois et qui va rendre un service à l'utilisateur et qui potentiellement va continuer à évoluer après.
Donc ça c'est vraiment je trouve un des enjeux du machine learning aujourd'hui que je trouve génial. Ensuite, par rapport à Total, on est aussi dans une période qui est particulièrement excitante parce que j'ai un peu parlé tout à l'heure des nouveaux business de Total, de l'électrique. du renouvelable et on est vraiment dans le groupe dans une période de transition. Ces mots-là, ce n'est pas galvaudé, on le sent profondément. Total se transforme, les métiers de Total se transforment et quand on est au quotidien dans le groupe, on le sent vraiment, tous les jours. Et clairement, le digital, la donnée, c'est vraiment un des piliers de cette transformation. Et c'est assez génial de se dire qu'avec notre activité, on contribue vraiment à la transformation. transformation du groupe et puis ça va au delà de la transformation du groupe parce que finalement cette transition c'est une vraie transformation de notre modèle énergétique qui est juste voilà un des enjeux majeurs de notre société et je trouve personnellement et au niveau de l'équipe c'est vraiment cool de se dire qu'on est acteur de cette transformation grâce à nos compétences technologiques.
Voilà ce que j'avais envie de vous dire aujourd'hui. Je vous remercie de m'avoir écouté. Je remercie toute l'équipe de Tech.Rocks de m'avoir invité. Franchement, c'était un grand plaisir. C'était vraiment génial. Pour la suite, je serai ravi de continuer à interagir avec vous. Si vous aussi, vous voulez partager votre vision du MLOps, votre vision des enjeux business du machine learning, n'hésitez pas. Je crois qu'on a un peu de temps pour discuter maintenant. Donc voilà, ce sera avec plaisir. Merci beaucoup et très bonne journée et passez de belles fêtes de fin d'année.
