← BibliothèqueToutes les vidéos
Tech.Rocks Summit 2022
Data ER - common issues facing the modern data stack
- Natalia Shuliak (COO, DoubleCloud)
Tech.Rocks Summit 2022 · 9 décembre 2022 · 31 min · en français
Résumé
Comment construire une vraie stratégie d'analyse de données pour sa startup, se préparer à la croissance rapide des équipes et des volumes de données, et optimiser coûts et architecture pour la performance des requêtes ? Dans cet atelier, Natalia Shuliak, COO de DoubleCloud, plateforme d'analyse de données fondée sur des technologies open source, présente les principes de la modern data stack pour aider les équipes à renouveler la leur.
L’essentiel
Natalia Shuliak, COO de DoubleCloud, décrit les problèmes de données qui apparaissent avec la croissance d’une entreprise, propose des principes pour construire son analytique et présente la « modern data stack » open source, puis la plateforme de DoubleCloud.
Pour préparer la refonte ou la création d’une chaîne d’analyse de données dans une entreprise en croissance.
Les idées clés
- Les problèmes de données changent avec la taille. Selon Natalia Shuliak, avant 200 personnes tout reste simple ; vers 200, les données débordent les équipes et chaque tableau de bord prend deux semaines ; au-delà de 1 000, on se bat sur la propriété des cas d’usage data, avec du shadow IT et 15 outils pour la même tâche. à 9:33
- Des principes pour l’analytique : partir des résultats business attendus (par exemple relier dépenses marketing et facturation) ou, à défaut, des tableaux de bord les plus utiles ; concevoir un modèle de données d’entreprise dès le début pour éviter de tout refaire à 200 personnes ; garder la main sur les cas d’usage data ; centraliser les données. à 15:28
- L’open source « modern data stack » : pas de dépendance à un éditeur, un délai court avant d’en tirer de la valeur (time to value) et des briques modulaires. Sa limite : il faut intégrer ces briques, tout le monde n’a pas les compétences et il n’y a ni support ni SLA, problème que DoubleCloud dit traiter avec une plateforme d’outils open source managés. à 19:33
Questions pour votre équipe
- À quel stade de croissance en sommes-nous, et quels problèmes de données devons-nous anticiper ?
- Quels résultats business nos projets data doivent-ils servir en priorité ?
- Quel coût d’intégration et de support sommes-nous prêts à assumer pour des briques open source ?
Il s’agit d’un atelier sponsorisé : l’intervenante est COO de DoubleCloud, éditeur d’une plateforme d’analyse de données fondée sur des technologies open source managées, et la seconde partie présente ce produit. Les chiffres (volume de données, performances de ClickHouse) sont cités sans source ; il n’y a pas eu de questions de la salle.
Chapitres
Summary
How do you build a real data analytics strategy for your startup, prepare for fast-growing teams and data volumes, and optimise costs and architecture for query performance? In this workshop, Natalia Shuliak, COO of DoubleCloud, a platform for building data analytics with open source technologies, shares the principles of the modern data stack to help teams renew their own.
Thèmes : Data
Transcript complet
Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.
Bonjour à tous, on va commencer. Déjà, on va commencer par une chose basique. On va un peu comprendre qui sont vos intérêts et ça va vous permettre aussi entre vous de voir ce qui est ici dans l'audience. On va lancer un petit k-out, je ne sais pas si vous connaissez. Alors, allez-y sur QR code, voilà le pin. Et dès que vous êtes là, on va commencer les questions. Ça va nous prendre 5 minutes. Pas plus que ça. Yay, tout le monde arrive. Good night. Ok, je vais commencer, je vais cliquer sur Start.
Up Allez, on y va. C'est la question numéro 1. Qu'est-ce que vous préférez dans votre... Non, ce n'est pas les questions sur le petit déjeuner. Alors, il y a les approches différentes qui existent aujourd'hui. Il y a certaines sociétés qui vont préférer all made in house avec open source. Et là, c'est les sociétés qui font la même chose, mais open source, manager, parce qu'ils ne veulent pas gérer le support ou les problèmes de sécurité. Et il y a les sociétés qui disent, bon, on s'en fout d'open source, c'est trop de dev, donc on va acheter tout chez un éditeur, je ne sais pas, Snowflake, les choses comme ça. Donc, répondez là-dessus. Ah oui, c'est bon endroit à être, bon endroit pour en parler. Parfait. Après, continuons. Next. Le DT Warehouse principal que vous utilisez. Qu'est-ce que c'est? Choisissez. S'il n'y a pas de nom que vous parlez, vous pouvez choisir« other».
Il y aura les questions sur autres technologies de data juste après. Donc, c'est vraiment les questions sur Data Warehouse. Ok, selon le cas route, donc il nous reste 100 secondes, 4. Et voilà, il y a Other, c'est intéressant. Parfait. Maintenant, continuons sur la question sur Data Storage Other. Justement, qu'est-ce qu'il y a d'autre que vous utilisez? Donc, choisissez votre réponse. Ok. Ah, génial. Encore une fois, on voit pas mal d'open source. C'est bien. Et on voit aussi quelqu'un a répondu.
Quelqu'un a utilisé Oracle? Est-ce que quelqu'un a utilisé Oracle? OK. OK, maintenant... Maintenant, stream processing. Kafka, pas Kafka, autre chose, pareil, choisissez si vous l'utilisez. On est presque fini. Visualisation, pareil, qu'est-ce que vous utilisez aujourd'hui? Qu'est-ce qui est le plus populaire pour vous? Et il y a certains outils, pareil, dans la même logique, certains sont third-party proprietary et certains sont open source.
Ah, quand même, il y a pas mal de tableaux, il y a pas mal de... Donc, ça veut dire que dans le monde de visualisation, pas tout le monde utilise Open Source, c'est intéressant. Et la dernière question. Le problème le plus important pour vous aujourd'hui dans Data, je sais qu'il y en a souvent beaucoup, mais je choisissais un problème. On n'a pas ajouté l'option, je n'ai pas de problème, parce qu'on n'y croit pas. Alors, le cool, le performance, les deux en même temps. Et migration. Ok, ça c'est intéressant sur la migration, on va en parler aussi. Bon, super, merci beaucoup à tous. Donc maintenant, on va commencer. Bon, déjà, bonne nouvelle, vous êtes dans le bon endroit. La plupart des sujets, ça me rassure, on n'est pas dans le droit où tout le monde utilise quelque chose qui est écrit il y a 20 ans et ne planifie pas ni migrer ni utiliser Open Source.
Donc maintenant, commençons notre présentation. Donc on va parler sur comment construire un modern data stack. Ça veut dire qu'est-ce que c'est modern data stack, qu'est-ce que c'est important pour vous quand vous rejoignez les sociétés où vous voulez construire votre data pipeline, data analytics, etc. Et déjà, on va commencer sur la présentation vite fait qui je suis. Donc d'origine, je suis biélorussie. Désolée pour mon accent s'il y a des erreurs grammaticales surtout. Je plaisante souvent, je suis adoptée. Ça fait 11 ans que j'habite ici et je considère la France comme ma maison. J'ai passé beaucoup d'années chez Microsoft où les projets les plus intéressants, c'était le lancement d'Azure ici en France il y a 11 ans. C'était l'époque quand personne ne comprenait qu'est-ce que c'est Cloud et pourquoi on a besoin. Et du coup, tout a changé. Aujourd'hui, on vit dans un autre monde. Après, j'étais chez Databricks, troisième personne ici pour développer le South-Emi. Je travaille sur les premiers partenariats, les premiers use cases importants pour le marché.
Suite à ça, j'ai passé le temps dans le monde de l'observabilité. Et après, je rejoins la société qui s'appelle DoubleCloud. C'est une startup qui construit une plateforme pour vous permettre de construire votre data analytics de ETL, data warehouse et visualisation sur les technologies open source managées. Avant tout, je suis la personne business. C'est le but de ce workshop à tous les gens qui travaillent comme CTO, comme data engineer, comme dev. Vous donner la vision plutôt business, comment il faut voir la chose qui apparaît dans votre société, quelque chose que vous créez. C'est quelque chose que, par exemple, votre CEO ou les gens de business ont besoin et investissent plus en plus dans vos projets. On a communiqué énormément avec les clients différents. Et en fait, on a réalisé assez rapidement que même les sujets, je dis plutôt simples et banals dans le monde de data, comme par exemple l'analytics
de comportement des utilisateurs ou final retention analytics ou même les dashboards qui sont les mêmes pour tous les teams de la société, c'est compliqué à faire. Et en fait, quand je vous donne un exemple business banal, marketing, marketing dépense pas mal d'argent sur le monde dans les pubs. Ce qui se passe après, c'est que moi, comme CEO qui arrive à voir notre marketing, je dis, bon, est-ce qu'il peut en voir ton pub dans ce pays-là avec le texte comme ça? Combien d'utilisateurs s'est créé et combien de valeurs ils ont créé ces utilisateurs? Ils sont incapables de me répondre. Et la raison est très simple, parce qu'eux, ils ont les données jusqu'à s'accréer le travail dans notre site. Et après, ils n'ont pas les données, parce que ça, c'est le billing qui prend ces données. Et donc, comme les choses ne sont pas réunies dans le même endroit, en ce cas, ça devient deux dashboards. Et donc, moi, comme gestionnaire de business, je ne peux pas avoir les réponses claires.
OK, est-ce que je dois investir dans ce marché-là, dans les pubs comme ça? Est-ce qu'on a des bons utilisateurs ou pas? Et ça, c'est des vrais problèmes. C'est à peu près normal. Donc, ça dépend de quelle société vous êtes, de quel stade de développement de votre société. Mais vous devez connaître les problèmes comme ça. Si vous êtes une start-up, vous commencez, et souvent ce qu'on entend, on n'a pas trop besoin de data analytics aujourd'hui, on utilise notre super Excel, on voit les graphes, c'est parfait, on sait qui on vend et comment ça marche. C'est simple à gérer avec n'importe quel outil de data, avant 200 personnes, vous êtes souvent assis dans le même endroit, c'est simple de prendre les décisions, donc tout est fluide, tout est facile. En revanche, votre problème, vous n'avez pas assez de manœuvres, pour exécuter sur quelque chose. Quand vous arrivez à peu près à 200 personnes, vous avez le problème qui est comme ça. Il y a d'un coup trop de données, mais d'un coup ça vous déborde, donc vous ne savez pas quoi faire avec.
C'est le moment quand vous commencez à réfléchir que peut-être il faut changer des outils. Vous commencez à regarder les benchmarks différents, vous commencez à chercher dans Google, ok j'ai un problème comme ça, comment faire? Vous aussi commencez à avoir les engineering teams qui sont grandes. Ça veut dire quoi? Ça veut dire que vous ne pouvez plus prendre les décisions faciles ensemble dans la même salle. Donc l'information ne flue pas facilement, donc il y a les problèmes qui commencent à être comme ça. Et les équipes avec qui vous avez parlé avant, comme les finances, les marketing, etc., commencent à être mécontents. Pourquoi? Parce qu'ils veulent les dashboards ou ils voient les résultats de leur activité et vous ne pouvez pas les donner les dashboards rapidement parce que n'importe quel dashboard, ça prend deux semaines. C'est aussi un problème. En plus, ce n'est pas super intéressant de le faire. Quand on passe l'étape, par exemple, de, imaginons, vous rejoignez la société où il y a 1000 personnes, ou plus, ou 5000, ou 10 000, la plupart du temps, vous allez vous battre avec toute l'organisation sur à qui appartient quel data use case.
Marketing va dire, oublie, on veut faire nos dashboards nous-mêmes, notre analytics nous-mêmes. Il y a Shadow ID, plein de gens qui ont investi dans les outils sans parlant. CTO, donc il y a 15 outils pour résoudre la même tâche et personne ne sait comment ça marche. Ça crée plein de problèmes. Et surtout, s'il y a beaucoup de développeurs, vous vous battez pour égaliser les compétences. Les gens viennent des endroits différents, plein d'outils, pas tout le monde sait faire tout, et donc le niveau de compétence baisse, et donc ça commence à être un problème. Mauvaise nouvelle ici, que ça va être cupir. Pourquoi? Parce que la quantité de données, ça augmente. Ça, c'est Statista qui dit qu'en fait, le volume de données va doubler d'ici deux ans. Et en fait, il y a deux ans, juste avant Covid, le PDG de Databricks a dit 90% de données étaient créées pendant les dernières deux ans.
Il s'est trompé, en fait, ça a accéléré. Et donc l'année prochaine, la quantité de données qui va être créée, c'est ce qui a été créé pendant les dernières trois ans. Donc on imagine l'accélération. Donc, il y aura vers 2025, 191 zettabytes. J'ai calculé tous les zéros pour vous donner l'idée de ce que ça veut dire un gigabyte. Ça veut dire quoi en fait? Où est le problème? Ok, les données c'est une chose, mais où est le problème? Le problème c'est qu'il y a trop d'outils, juste sur Amazon, sur AWS, si quelqu'un peut imaginer combien de databases, juste databases existent sur AWS. Une idée? Donnez-moi un chiffre. Beaucoup, je vais féliciter. Et la 16. Il y a 16 databases qui utilisent AWS. Et maintenant, vous pouvez imaginer tout le reste. Maintenant, dans le monde open source, Il existe un site qui s'appelle Modern Data Stack, qui collectionne tous les Modern Data Stack qui existent.
Vous voyez, juste dans ETL, il y a 45 outils. Dans Data Warehousing, sur leur site, il y a 22. Donc, il y a énormément d'outils. Et en même temps, évidemment, pour tous les gens qui créent les outils, tous les éditeurs, c'est une opportunité. Le marché de data, c'est une opportunité. Pour vous, la grande question, OK, il faut que je crée les valeurs de data. Pourquoi? Parce que c'est mon competitive advantage. Si je ne le fais pas, quelqu'un d'autre va être plus intelligent, va utiliser le data pour être plus efficace et pour gagner le part de marché. L'exemple qui se passe aujourd'hui, par exemple, qui est assez banal, qui vient à l'esprit, désolé si quelqu'un dans l'audience de cette société, mais il y a Mythique et il y a Tinder. Donc Tinder, ça utilise le data beaucoup plus qu'il est mythique. Donc, vous êtes obligés, si vous ne répondez pas à les questions comment prendre les valeurs de data, peut-être dans 5 ans, vous êtes sans travail sur le marché.
Trois façons de faire. Data analytics, on va en parler maintenant beaucoup. Automatiser vos process. Vous voulez éviter que justement marketing fait la chose à côté et finance fait la chose à côté. Vous voulez que les choses passent automatisées et tout le monde est efficace. Et développement de produits, en fait, c'est si vous avez les bons process, les bons data analytics, vous pouvez créer le produit de votre data que vous allez vendre à un stakeholder, soit interne, soit externe. J'ai vu le société comme ça, c'était un site product. Pour eux, le data, ils ont commencé à faire le business là-dessus. Data Analytics. Comment, maintenant, les bons principes. Ça, c'est les best practices qu'on a vues dans les sociétés qui ont réussi, en discutant avec les CTO et différents, en discutant avec l'écosystème. Donc, j'ai mis ici, sur la slide, les choses qui viennent à l'esprit le plus souvent à tous ces gens-là. Quand vous avez la tâche devant vous, refaire ou faire du zero data analytics, vous devez déjà commencer par business outcomes.
Pourquoi vous faites ça? Et business outcomes, ce n'est pas parce que quelqu'un a besoin de données, ce n'est pas ça ce que vous cherchez. Vous cherchez la réponse sur, ok, si le business veut être plus rapide pour utiliser moins d'argent pour le marketing, Donc, en ce cas, je dois, par exemple, connecter les deux pipelines ensemble entre dépenses marketing et trial, par exemple, dans le monde des commerces et l'information billing pour lifetime. Donc, ça, c'est le business outcome. Si vous avez du mal, vous n'avez pas un bon dialogue dans la société ou votre CEO n'est pas au niveau, au moins, commencez par les dashboards. Et la liste connue des dashboards les plus utiles pour tout le monde, vous pouvez commencer par ça. Et ça, c'est déjà, si vous déjà créez le dashboard où il y a l'équipe IA et business pour tout le monde, déjà, c'est un bon business outcome. Et là-dessus, vous pouvez construire Data Analytics. Le deuxième, dès que vous avez défini, OK, je veux créer ça, le deuxième principe, c'est à commencer par Enterprise Data Model.
C'est cette erreur de quoi je parlais tout à l'heure. Vous pensez qu'on n'a pas trop besoin de data analytics. Quand vous arrivez à 200 personnes, vous êtes obligé de tout refaire. Et aujourd'hui, j'ai vu 50% de personnes ici, vous avez ce problème de migration. Vous ne savez pas comment faire parce que tout est développé. Peut-être que ce n'était pas créé avec les pensées que vous allez grandir avant, etc. Donc, dès le début, pensez à l'entreprise data model. Dites directement non à DataYuskis, dont les équipes sont différentes. Donc, c'est à vous. DataYuskis appartient à vous. DataYuskis ne peut pas partir à quelqu'un d'autre, parce que si vous faites ça, vous allez retrouver dans 5 ans, tout le monde se bat entre eux. Qui fait quoi? Quelle est l'analytics? L'analytics ne marche pas. Applaudir les données dans un environnement centralisé. ERP, Data Lake, Data Warehouse, Lakehouse, n'importe, mais ça doit être centralisé.
Si toutes les données vont là-bas, il y a beaucoup moins de problèmes directement. Et après, il y a une chose intéressante. Donc, avant, tout le monde a fait le batch analytics. Pourquoi? Parce que les outils n'étaient pas au niveau. Donc, on a eu, je ne sais pas, Spark, Hadoop, n'importe. Ce n'était pas les outils qui étaient faits pour Real-Time. Donc aujourd'hui, le monde a changé. Il y a beaucoup plus d'outils qui sont adoptés à un temps réel. Donc ça veut dire que vos use case batch, vous pouvez les changer. Donc ça veut dire que dans l'avenir, il n'y aura pas de problème. Vous avez un énorme data warehouse. Il y a quelqu'un qui réfléchit, alors est-ce que les données sont arrivées ou pas? Est-ce qu'on peut les analyser ou pas? Donc tous ces problèmes, on peut éviter si directement on pense de temps réel. En ce cas, peut-être le principe de TT Warehouse va changer pour vous parce que vous pouvez utiliser les outils beaucoup plus modernes qu'au courant. Et au final, c'est la chose d'organisation, mais quand même, il faut documenter.
Ça, ce n'est pas nouveau. Mais en fait, vous allez migrer, ça, c'est sûr. Vous allez ajouter les éléments, ça, c'est sûr. Il y a le monde aujourd'hui, j'entends plus en plus le terme qui s'appelle cloud-prem. Il y avait beaucoup d'espoir avec le cloud. Aujourd'hui, le plan de société réalise, OK, bon, le cloud, c'est peut-être un peu trop cher. Si je suis dans le seul cloud provider, ça me crée le problème. Je ne peux plus négocier les prix. Donc, je dois être capable de migrer entre les clouds. Et de temps en temps, les leaders du marché en pensent, de temps en temps, je veux partir vers un on-prem. Et donc la grande question, comment construire votre data analytics dans la façon que c'est possible à faire? Et la réponse est là. La réponse est open source, modern data stack. Ça veut dire quoi? Open source, bon, évidemment, vous en profitez de communautés, de technologies, et vous n'avez pas le vendor lock. Si vous utilisez Vanilla open source, ça veut dire que vous pouvez l'utiliser sur le cloud, mais vous pouvez migrer vers un prem.
C'est déjà beaucoup. Modern, aujourd'hui, c'est tout sur le time to value. Donc, j'ai parlé il n'y a pas longtemps avec une société qui... Le monde de foodtech, cette société a dit, bon, en fait, on est arrivé à un point où on va construire Data Analytics. Donc, on a choisi un éditeur de ETL assez connu sur le marché, je ne vais pas citer. Dans trois mois, on va avoir notre Data Analytics. Je dis, c'est un peu long, non, pour le foodtech, pour le business comme ça. Ils disent, oui, effectivement, mais je n'ai pas trouvé comment faire différemment. Ça, c'est la réalité des choses. On n'en parle pas peut-être assez souvent, mais c'est la réalité des choses. Donc dans le monde moderne, Time to Value, c'est ce que le monde moderne vous promet. Un outil moderne doit vous proposer quelque chose que vous avez déjà, ça fonctionne déjà assez rapidement. Bon, data, il a les briques, je vais vous montrer l'architecture. Et stack, ça veut dire que c'est médulaire. Donc, ce n'est pas bout en bout quand vous êtes obligé d'acheter toute la plateforme et vous allez utiliser qu'il y a 1% de ça.
Donc, c'est vous choisissez un brique par rapport à vos besoins. Donc ça, c'est l'architecture assez connue de Modern Data Stack. Donc ici, vous voyez, il y a les data sources, tout. Donc ça dépend dans quel business vous êtes, mais normalement, toutes les applications, les files, les événements, c'est les data sources pour vous. Après, les connecteurs différents, où il y a les event streams. Il y a le storage warehousing, je parlais que ça doit être centralisé, donc ça marche en ce cas dans cette façon-là. Il y a soit les transformations, soit il n'y a pas de transformation, ça dépend de votre business. Et après, il y a le layer de service, donc vous pouvez analyser, vous pouvez voir qu'est-ce que ça donne, il y a des opérations là-dessus, il y a le brick data science là-dessus aussi. Il y a DataOps, c'est le terme émergent aujourd'hui dans Open Modern Stack, parce qu'en fait tout le monde a compris que Data Observability c'est important, Data Security c'est important, il y a plein de choses qui se passent, le monde évolue, donc
c'est pour ça que ce bris est apparu aussi aujourd'hui dans l'architecture de Data Stack. Donc ça, c'est la théorie. Donc nous, DoubleCloud, en fait, on vit dans ce monde depuis longtemps. Notre équipe de dev, ça fait des années, ils ont de l'expérience de gestion open source database sur... les clouds différents. Et donc, du coup, on s'est dit, voilà, on sait comment faire. On sait choisir les meilleures technologies open source qu'on peut proposer à la communauté. Pour vous, vous pouvez construire les data analytics qui marchent pour votre business sans penser à des choses qui ne sont pas intéressantes. Et donc, du coup, on a commencé à regarder, quand on a commencé à choisir, OK, quels sont les briques que nous choisissons pour notre plateforme, pour le reste, on a regardé ce qui existe comme les outils assez populaires aujourd'hui dans le monde open source au modern data stack. Donc vous voyez, il y a plein d'offres sur chaque étape.
Et donc les étapes les plus importantes, c'est intégration, c'est warehousing, c'est transformation et c'est analytics. Encore une fois, les pros, c'est évidemment un vendor lock. Vous pouvez accéder à SourceCode, il y a les communautés, il y a plein de développement de SourceCode. Le problème de tous ces briques, c'est que vous devez les intégrer. Et vous vous souvenez, je parlais de compétences de développeurs. Ça peut être un problème. Pas tout le monde va avoir les compétences en même temps sur, je ne sais pas, Metabase, DTB et Jitsu, par exemple. Donc, dans Open Source, c'est vraiment un des problèmes. Le problème, c'est qu'il n'y a pas de support, il n'y a pas de SLA, donc ça peut être difficile. Et donc on s'est dit qu'on va adresser ça, on va adresser les problèmes. Donc on a regardé les outils les plus populaires, on a pris Airbyte, on a pris Clickhouse, pas encore Spark,
on est en train d'avoir Airflow aussi, et on a décidé qu'on va changer, on peut être plus efficace que Metabase et Super7, et on va les changer. Comme résultat, l'architecture de DoubleCloud, c'est ça. Donc aujourd'hui, on a quatre éléments et le cinquième arrive. Donc vous pouvez, vous imaginez, ça répète l'architecture de l'Open Modern Data Stack. Il y a les sources de données différentes. Il y a le Double Cloud Transfer, en fait c'est Airbyte, mais il y a quelque chose qu'on a jeté dedans. Ça c'est votre ETL santé. Après il y a le Clickhouse. Clickhouse c'est l'outil. de warehousing, je vais en parler un peu. D'ailleurs, ici, ce que vous ne savez pas, mais ce qui se passe sur le marché, quand vous regardez la collection en gestion Jitsu, Jitsu utilise ClickHouse aujourd'hui. Quand vous regardez dans l'analyse post-hog, PostHog utilise ClickHouse under the hood aussi.
Donc il y a plein de sociétés qui sont dans le Open Source Modern Data Stack qui utilisent eux-mêmes les outils open source. Je vais parler pourquoi. Je vais juste finaliser ici. Donc Kafka, c'est connu, mais c'est très pratique de mettre les données dans ClickHouse. Pour ça, on l'a intégré avec ClickHouse aussi. Et la visualisation, on va open sourcer cette solution d'ici un an. C'est un outil de visualisation qui vous propose, un outil gratuit, qui vous propose juste de visualiser avec les 16 charts préconstruits pour vous. Donc, c'est no code, très facile à faire. Airflow et Airflow arrive. Maintenant, pourquoi on a choisi ces briques, pourquoi on a choisi ces technologies comme ça? ClickHouse, en tout cas, c'est pour la performance. Si vous ne connaissez pas, il y a plus de 3000 sociétés dans le monde qui l'ont adoptée. C'est la base assez ouverte, vous pouvez la regarder vous-même.
ClickHouse est écrit avant tout comme engine sur l'outil de analytics qui est qui était la concurrence de Google Analytics à l'époque. Donc la logique de ClickHouse, c'était si quelque chose nous ralentit, on ne le fait pas. On n'a pas besoin de ce feature, ça nous ralentit. Donc c'est pour ça, c'est avant tout blazing fast, et c'était vraiment l'idée de ClickHouse. Après, c'était open source, il y avait une énorme adoption là-dessus. Donc, sur GitHub, vous pouvez voir, il y a 24 000 ou peut-être 25 000 étoiles. C'est énorme par rapport à plein d'autres technologies open source. Il y a énormément de projets, il y a énormément de sociétés qui commencent à en travailler, etc. Et les noms connus, c'est Uber qui est déjà migré d'Elastik vers ClickHouse, c'est devenu un use case connu. Et la Cloudflare qu'ils utilisent pour leur sécurité, analyse de... Des événements, etc.
Et les raisons qu'ils font ça, ce n'est pas parce que c'est open source, c'est aussi parce que les performances qu'ils gagnent, ce n'est pas juste x2, x3, c'est x10, x3. Donc c'est vraiment impressionnant, cette performance. Et donc, ça gagne le momentum. Et il y a même une pensée aujourd'hui dans la communauté qui dit, pourquoi vous avez besoin de Data Warehouse si vous pouvez tout de suite construire le Scalable Data Analytics? Donc, en gros, c'est... Ce n'est pas nous qui disons ça, c'est quelqu'un de communauté qui dit ça. Donc, en gros, on enlève le data warehousing et on remplace avec les clouds pour directement un temps réel, avoir l'analytics. Donc, c'est ce qui se passe aujourd'hui sur le marché. Après Apache Kafka, je ne vais pas en parler, tout le monde y connaît. Apache Airflow, ça c'est l'outil pour automatiser les data pipelines. Dans nos discussions avec les clients, on a vu énormément de feedbacks, c'est plus que 50% qui disent on a besoin de ça ou on utilise déjà ça.
Pourquoi c'est pratique? Vous vous souvenez, j'ai parlé que dans Data Value, pour capturer les valeurs de data, Data Analytics c'est un, et automatiser les process c'est deux. Donc ça c'est une des choses qui est pratique à faire. Si vous n'avez pas, si personne n'automatise un data pipeline, s'il n'a pas d'orchestrateur, souvent c'est une personne DevOps qui est là, donc ça veut dire c'est une salaire, la gestion, le management de cette personne, etc. Mais c'est l'outil moins cher, donc c'est une des choses qui devient nécessaire. Et donc, comme résultat, par exemple, on prend le sketch classique, le clickstream, j'ai parlé au tout début, donc il y a un clickstream, c'est quoi? Je reviens vers mon exemple d'avant. Marketing dépense beaucoup d'argent, quelqu'un arrive sur le site, vous voulez voir comment la personne convertit dans le trial, qu'est-ce qu'il fait après dans le console de produit, sur quoi elle clique, et qu'est-ce qu'il fait. Qu'est-ce qui se donne ? Tous ces insights, vous comprenez en fait quel persona vous pouvez, votre équipe de marketing peut cibler pour générer les revenus.
C'est hyper compliqué à faire, en fait. Par exemple, avec DoubleCloud, notre vision, c'est comme ça que vous faites. Vous utilisez les sources de données, vous utilisez Kafka comme data streaming, vous utilisez ClickHouse comme data warehouse. Ça peut être basé sur, par exemple, S3 de AWS qui baisse le coût même 3 ou 5 fois plus. Et vous utilisez Visualisation qui vous donne à votre équipe marketing ou à votre PDG, parce que le PDG veut savoir aussi, si on dépense beaucoup d'argent, qu'est-ce que ça nous donne. Et mon super pitch est fini. Maintenant, on a deux minutes pour les questions-réponses. Si vous ne voulez pas poser les questions, venez nous voir sur le boost. Si vous voulez discuter de quelque chose, vous écrivez-nous un email ou contactez par LinkedIn. Donc, toutes les options sont possibles. Et donc, les questions. Est-ce qu'il y a des questions dans l'audience? Je pense qu'il n'y a pas de questions. Bon, en ce cas, merci beaucoup. J'espère que c'était intéressant.
