← BibliothèqueToutes les vidéos
Tech.Rocks Summit 2023
Comment choisir le pipeline de données le plus rentable pour votre entreprise
Tech.Rocks Summit 2023 · 28 mai 2024 · 18 min · en français
Résumé
Atelier du Tech.Rocks Summit 2023 consacré au choix du pipeline de données le plus rentable. Les équipes doivent gérer toujours plus de données, issues de sources toujours plus nombreuses, tout en réduisant le temps nécessaire pour en extraire de l'information, sans budget ni effectifs supplémentaires. La session propose des pistes pour résoudre ce dilemme.
Summary
Workshop from the Tech.Rocks Summit 2023 on choosing the most cost-effective data pipeline. Teams are asked to handle more and more data from an ever-growing number of sources while reducing the time it takes to extract insights, with no extra budget or headcount. The session offers ways to resolve this dilemma.
Thèmes : Data
Transcript complet
Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.
Bonjour à tous, merci d'être venu à ce workshop. Je vais commencer cette présentation par une déclaration qui va paraître évidente à tout le monde, je pense. Toutes les entreprises sont dans le domaine des données, ça veut dire que toutes les entreprises ont besoin de leurs données, ont besoin d'exploiter leurs données, que ce soit des données marketing, supply chain, vente, tout type de données. En fait, comme je disais, c'est une déclaration évidente. On a besoin de nos données, chaque entreprise a besoin de ces données. Mais je l'évoque parce qu'avoir accès à cette donnée, la centraliser dans un seul endroit et l'exploiter n'est toujours pas une tâche évidente. Quels sont les obstacles qui la rendent pas évidente? Quels sont les obstacles et les enjeux? D'abord, les entreprises doivent tirer profit de leurs données afin de rester compétitives dans le marché.
Les budgets se serrent de plus en plus. Du coup, il y a le besoin que les équipes data soient de plus en plus efficaces aussi. Et aussi un obstacle, extraire la donnée s'avère une tâche complexe et chronophage pour certains systèmes connus du marché, des systèmes complexes comme des AS400, comme des SAP, comme des grosses bases de données Oracle, comme des applications CRM, Salesforce. Extraire la donnée à partir de ces systèmes-là de manière fiable et simple n'est pas une tâche simple. Et la priorité a toujours été le business. Donc le business, pour lui, l'extraction de la donnée, c'est du back-office. La priorité pour les business, c'est d'avoir accès à la donnée et commencer à travailler sur la donnée et allouer les talents techniques et business aussi pour exploiter la donnée. Et pour eux, la tâche d'extraction de la donnée, pour eux, c'est quelque chose qui devrait être simple, mais ce n'est pas la réalité des équipes d'ingénierie data aujourd'hui.
Voilà, il y a un autre constat aussi qu'on a constaté chez Fytron, c'est que chaque département aujourd'hui a besoin de ces données, donc chaque département business, chaque équipe business a besoin de ces données, mais elle a besoin aussi de données des autres départements aussi. Donc il y a ce partage entre les départements de leurs données. Et du coup, il y a ce besoin d'avoir des données qui proviennent de différentes sources, mais qui soient synchrones aussi au même niveau de fraîcheur de données. Donc ça multiplie la complexité ou l'enjeu ou le challenge d'avoir des données à jour qui sont exploitables. Et puis, comme je le disais, le business veut allouer le maximum de ses talents aux projets et aux tâches qui sont directement connectés au business. Je parle par exemple des use cases data science, des analytics, de la transformation de données, de l'ABI, mais avoir la donnée déjà devrait être un acquis pour les entreprises.
Voilà, donc si cette idée de ne plus se soucier d'avoir cet accès à la donnée, d'extraire la donnée et de l'avoir à portée de main pour l'exploiter, pour la faire travailler, Fivetran fait exactement ça. Fivetran vous permet d'automatiser la tâche d'extraction de données de vos différentes sources de données, quelles qu'elles soient. Donc ici, c'est un sous-ensemble des sources de données que Fivetran intègre. Fivetrain propose plus de 400 connecteurs. Ce sont des connecteurs clés en main qui sont simples à configurer. Le rôle de ces connecteurs, c'est qu'en moyennant quelques clics, vous avez vos données provenant de vos différentes sources dans votre data lake prêtes à être exploitées.
et être aussi activé pour des use cases plus avancés. Ici, vous voyez les différentes catégories de sources de données, que ce soit des données de type API, comme par exemple les données marketing, des données legacy aussi, comme de la S400, comme du... SAP comme des bases Oracle, et des fichiers, tout type de sources de données. Aujourd'hui, le catalogue compte plus de 400 sources de données prêtes à être intégrées dans votre data lake. Rapidement, Non5Tran fait partie de l'écosystème de la data stack moderne. On est partenaire des acteurs principaux des plateformes data modernes, qui sont GCP, Google, Snowflake et Databricks. On va récupérer la donnée de vos différentes sources et on va les ingérer dans votre data lake, dans votre data warehouse.
En haut, vous avez quelques chiffres. Five Train compte plus de 320 ingénieurs aujourd'hui qui ne font que développer des connecteurs et les faire évoluer et les maintenir pour vous. On a 99,97% de disponibilité de service, donc c'est une plateforme fiable. Et en agrégeant les données qu'on transfère pour nos clients, tous les mois on transfère un peu plus de 2 pétaoctets de données. On compte aujourd'hui plus de 8000 clients dans le monde, un peu plus de 150 en France, des entreprises de toute taille. Et voici un... un diagramme d'architecture au niveau de où se situe Fivetran, où se situerait Fivetran dans votre écosystème. Donc vous avez vos différentes sources de données, vos différents types de données, vous avez les applications, les events, les bases de données, les fichiers, les data lakes aussi peuvent être des sources, et Fivetran
va récupérer ces données-là de manière récurrente. On peut descendre jusqu'au temps réel ou jusqu'au temps quasi réel aussi pour maintenir à jour votre data lake. Donc vous aurez via Fivetran, moyennant Fivetran, un data lake qui est au plus près de votre source de données en termes de fraîcheur de données. Fivetran s'intègre avec d'autres outils aussi. Si on veut, par exemple, monitorer Fivetran ou implémenter des pratiques de gouvernance d'utilisateurs, de données, etc., Fivetran a une intégration native avec pas mal d'outils du marché aussi. Et moi, je m'appelle Mavro, je suis ingénieur solution chez Fivetran et je vais vous présenter un cas d'usage de notre client, qui est leader mondial des technologies médicales, qui s'appelle Philips. Voilà, donc rapidement sur notre client, ils sont dans trois domaines principaux, donc les équipements diagnostiques et de traitement, les appareils
de santé connectés, et puis les appareils aussi de santé pour les particuliers. Je retourne au diagramme précédent. Les données qui intéressent notre client aujourd'hui sont hébergées dans deux types de sources de données. Des applications, c'était Salesforce, leur CRM principal, et leur outil de gestion de tickets qui est ServiceNow. Et puis la deuxième source de données qui est aussi importante aussi, c'est leur système ERP basé sur SAP. Donc F5Tran a été missionné de répliquer ces deux sources-là et maintenir à jour le data lake de Philips. La difficulté que notre client a rencontrée avant l'arrivée de Fivetran, c'est que pour certains use cases, le temps réel était un prérequis.
Sauf que ce n'était pas possible parce que les pipelines existantes étaient faites à la main et extraire la donnée en temps réel n'était pas simple. Donc le fonctionnement était en mode batch. Il y avait des batchs toutes les nuits qui tournaient, donc la donnée n'était pas assez fraîche pour certains use cases. Voilà, donc ça c'est un premier challenge. Voilà, quelques autres challenges aussi. À partir de SAP, la détection des suppressions d'enregistrement, et à partir d'autres systèmes ERP aussi, la suppression d'enregistrement n'était pas capturée de façon simple. Elle n'était pas capturée du tout d'ailleurs. Et puis, la fenêtre de chargement des données était limitée. Ça veut dire que la taille des données à extraire était importante. Et toutes les nuits, il y a un job d'extraction qui se déclenche.
Et pas mal de fois, ça n'arrive pas à synchroniser, à répliquer la donnée dans le data lake à temps. Donc la solution, c'était une collaboration entre Fivetran et Databricks pour reconstruire toute la data platform. Pourquoi Fivetran a été introduit? Alors Fivetran n'a pas remplacé l'entièreté des jobs existants de l'application. Fivetran a remplacé juste les sources de données qui posaient un problème pour extraire la donnée de façon efficace et en temps utile, notamment pour SAP, les deux systèmes SAP là-bas, SAP ERP et SAP MES. Salesforce et ServiceNow. Les autres sources de données ne posaient pas de problème, donc on a conservé la façon originale de faire. Les deux solutions, donc Fivetran a permis d'intégrer en temps réel les données de ces quatre sources que vous voyez en haut là-bas, vers de l'Azure Databricks, qui est le data lake actuel de Philips.
Et puis ça a permis d'activer pas mal de use cases que Databricks aujourd'hui permet de débloquer comme des... comme des workloads d'intelligence artificielle, de l'automatisation de process business pour la supply chain, des décisions opérationnelles automatisées, etc. Petit focus sur le use case SAP. Donc, Chez notre client, on a implémenté l'architecture Medean. Pour ceux qui ne savent pas ce que c'est, c'est différentes couches de données. Vous avez la couche bronze, la couche silver, la couche gold. La couche bronze correspond aux données brutes qui sont représentatives ou qui sont une exacte copie de ce qu'il y a au niveau de la source. Au niveau de la source ici, ça va être exactement les tables qu'on a au niveau des systèmes SAP.
Ensuite, la donnée est transformée ou formatée un petit peu au niveau de la couche silver pour la rendre plus exploitable par les différentes équipes business. Et puis, la couche gold, c'est les use cases finaux. Donc, un des use cases, c'était l'activation du... l'automatisation de certains business process liés à la supply chain en utilisant l'outil Blue Yonder, mais aussi d'avoir accès à des données fraîches dans des dashboards qui sont rafraîchis, qui ont une latence de... d'en dessous d'une minute. Voilà, donc ça a permis d'augmenter la digitalisation des usines, de se baser sur les acteurs, les stakeholders de la supply chain, se basent maintenant sur la donnée pour prendre des décisions stratégiques. Et les décisions opérationnelles, comme par exemple le provisionnement des stocks, ont été automatisées grâce à la réplication en temps réel. Comment FiveTrain fait pour récupérer la donnée en temps réel à partir de SAP, bien que SAP est une source de données importante, donc la taille des données est importante,
On va utiliser l'approche, Faitran utilise l'approche CDC. CDC, c'est un outil complexe. Si on décide de le faire manuellement, ça va être une tâche très complexe et ça va être difficile à maintenir parce que l'approche CDC va récupérer les changements des données à partir des... Pas du système lui-même, mais à partir des logs de transactions de la base de données qui héberge les systèmes SAP. Donc il y a une étape de décodage de ces logs de transactions, il y a une étape d'identification des données qui ont changé, il y a une étape aussi de compression des données avant de les envoyer vers la data platform pour être le plus efficace possible. Donc tout ça est fait par Fivetran, toute cette complexité est simplifiée moyennant quelques clics. Fivetran va faire tout ça et va activer le temps réel à partir de... des systèmes comme SAP. Le use case Salesforce, c'est à peu près la même architecture.
Données brutes, ensuite données reformatées, et puis données dans la couche gold qui correspondent aux différentes... Tables qui vont servir des dashboards pour améliorer par exemple la performance commerciale et puis aussi pour suivre la satisfaction. satisfaction des clients et mieux les servir. Avec Salesforce, je ne sais pas s'il y a des utilisateurs Salesforce ici, mais l'API de Salesforce qui ne permet pas par exemple de facilement de récupérer les données en delta. Il y a des choses à implémenter pour le faire. Ça encore, Fivetran le simplifie, moyennant quelques clics, le chargement en mode incrémental en quasi temps réel est fait par Fivetran. Et voilà le parcours de la plateforme de données de Philips depuis 2020.
Donc avant, enfin en 2020, jusqu'en 2020, il y avait l'existant que je vous ai expliqué tout à l'heure, donc il y avait pas mal de challenges. Donc il y avait de la réplication en utilisant ADF vers un data lake Synapse, donc Microsoft Synapse. À un moment donné, on a voulu fiabiliser l'accès à la donnée SAP. Donc, Philips a fait appel à nous pour leur faciliter l'extraction de leur système SAP et fiabiliser cette extraction et la rendre plus temps réel. Le premier use case était la deuxième plus grosse instance SAP de Philips. Et puis le succès de ce projet-là a conduit au fait que Fytran a été élargi sur le scope de tous les ERP du client. Jusque-là, Synapse était utilisé en tant que destination. À un moment donné, il y a eu la décision de partir vers Databricks comme solution Data Lake ou Lakehouse.
Il fallait être en train de continuer d'alimenter Databricks, donc il n'y a pas eu de problème, on est compatible avec les deux destinations. Et aujourd'hui, on est en train de prendre de plus en plus de use case, comme ce que j'ai montré, Salesforce. et ServiceNow, et il y aura dans le futur d'autres sources de données qui vont être intégrées par Fivetran. Voilà, vous avez quelques chiffres, quelques statistiques. Aujourd'hui, Philips compte plus de 50 sources. Les tables à répliquer dans le Data Lake sont supérieures à 9000. Et le volume transféré, tous les jours, ça s'approche quand même du... Pas tous les jours, pardon, c'est tous les mois. C'est un petabyte par... C'est pas marqué, mais c'est un petabyte par mois environ. Les changements quotidiens, les données qui bougent tous les jours, c'est à peu près 180 millions.
Tout ça, c'est transféré par Fivetrain. Les pipelines de temps réel, aujourd'hui, comptent plus de 80. Voilà, donc c'était tout. Je ne sais pas si vous avez des questions ou vous avez d'autres attentes que je peux répondre aussi si vous avez des...
