Podcast Tech.Rocks

IA Without Data : l'intelligence au service de la vie privée

Podcast Tech.Rocks · 14 septembre 2025 · 25 min · en français

Résumé

Épisode de la série consacrée aux speakers du Tech.Rocks Summit 2025. Kaouther Ouenniche et Tina Zhuo racontent l'approche de l'IA chez Dashlane, une entreprise qui protège les données de ses utilisateurs dans une architecture « zero-knowledge ». Elles partagent des expériences concrètes, de la création d'un système de remplissage automatique intelligent à la mise en place d'une détection d'hameçonnage en temps réel. Elles expliquent comment Dashlane a contourné le besoin de données massives en développant des modèles d'IA « frugaux » qui tournent en local, et en optant pour une collecte de données 100 % interne. Toutes deux soulignent l'importance de ne pas céder à la hype de l'IA, mais de l'utiliser comme un outil pour résoudre des problèmes concrets des utilisateurs. Elles abordent aussi la manière d'intégrer l'expertise académique pour créer une valeur réelle, en se concentrant sur les applications qui résolvent des problèmes business plutôt que sur la recherche pour elle-même. Leur session au Summit : « AI Without the Data: Building Privacy-First Intelligence ».

Summary

An episode in the series dedicated to Tech.Rocks Summit 2025 speakers. Kaouther Ouenniche and Tina Zhuo describe the approach to AI at Dashlane, a company that protects its users' data within a zero-knowledge architecture. They share concrete experiences, from building a smart autofill system to setting up real-time phishing detection. They explain how Dashlane got around the need for massive datasets by developing "frugal" AI models that run locally, and by opting for 100% in-house data collection. Both stress the importance of not giving in to the AI hype, but using it as a tool to solve users' concrete problems. They also discuss how academic expertise can be integrated to create real value, focusing on applications that solve business problems rather than research for its own sake. Their Summit session: "AI Without the Data: Building Privacy-First Intelligence".

Thèmes : IA · Sécurité

Tech.Rocks Summit 2025

Transcript complet

Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.

J'ai fait le choix de me tourner plutôt vers l'industrie pour faire un peu le pont entre la recherche fondamentale et des applications concrètes directement intégrées dans des produits tech. Et notre mission, c'est d'aider les gens à stocker et accéder de manière sécurisée, toujours, et pratique, tous les identifiants et données dont ils ont besoin dans leur vie numérique. Bonjour à toutes et bonjour à tous, bienvenue sur ce nouvel épisode du podcast Tech.Rocks dédié à nos speakers de notre prochain Tech.Rocks Summit. Je le rappelle, il se tiendra le 1er et 2 décembre 2025 au Théâtre de Paris. Je suis Romain Kuzniak, CEO d'Ignito, et je suis ravi aujourd'hui d'accueillir deux personnes qui vont parler ensemble à ce summit. C'est Tiené Ajo, Lead Product Manager chez Dashlane. Bonjour Tina. Bonjour. Et Kaouther Ouenniche, Senior AI ML Engineer chez Dashlane aussi.

Bonjour Kaouther. Bonjour. Avant de commencer, pour ceux qui ne vous connaissent pas, je vais vous demander de vous présenter. On peut commencer par toi Tina, est-ce que tu peux te présenter en quelques mots à notre auditoire? Oui, moi c'est Tina, je suis Lead Product Manager chez Dashlane. Je suis américaine et ça fait quatre ans que je vis en France, à Paris. À l'université, j'ai étudié la science politique avant de décider que c'est quelque chose que je ne voulais pas faire. C'est une tendance assez commune aux États-Unis. Puis, je me suis retrouvée dans la tech, dans les startups et actuellement aujourd'hui chez Dashlane. Très bien. Et qu'est-ce que tu fais chez Dashlane? Oui, on est en équipe ensemble, Kauter et moi, dans les départements produits et engineering. On fait pas mal d'air aidé. Ça veut dire trouver des solutions pour les problèmes de nos utilisateurs, nos clients, qui mélangent la technologie intéressante. et l'expérience intuitive pour rendre leur vie numérique plus sécurisée et sans friction.

Ok, super. Il y a aussi Kaouther. Bonjour Kaouther. Est-ce que tu peux te présenter en quelques mots? Kaouther, je suis aujourd'hui Senior Machine Learning Engineer chez Dashlane et j'ai commencé ma carrière par faire de la recherche. Avec un doctorat en intelligence artificielle entre l'Institut Polytechnique de Paris et France Télévisions. Et après ma thèse, j'ai fait le choix de me tourner plutôt vers l'industrie pour faire un peu le pont entre la recherche fondamentale et des applications concrètes directement intégrées dans des produits tech. Et c'est ce que je fais aujourd'hui chez Dashlane. Ok, super. Avant d'aller plus sur les questions qui concernent le Summit et Dashlane, petite question aussi perso comme ça. Quels sont les sujets en ce moment qui vous tiennent particulièrement à cœur, que ce soit dans votre travail ou en dehors, pour voir un petit peu ce qui vous anime en ce moment? Oui, en sujet en particulier, on essaie toujours de rendre les vies en ligne de nos utilisateurs plus sécurisées et plus faciles.

Ça veut dire comment peut-on mieux protéger les utilisateurs en ligne et en particulier, on est en train de lancer notre solution proactive anti-phishing pour d'abord nos clients entreprises et puis nos utilisateurs. utilisateurs particuliers et c'est vraiment intéressant de mieux comprendre et modifier les solutions selon leurs besoins précis. Ok, donc un vrai travail de discovery produit et ainsi de suite. Et toi, Kaouther, tu es dans le machine learning, dans l'AI, tu vois bien que ça bouge tout le temps. Est-ce qu'il y a des sujets particuliers qui t'animent en ce moment? En fait, en tant que femme tunisienne dans la tech, le sujet de Women in Tech, c'est quelque chose qui m'inspire beaucoup. Je cherche toujours des environnements qui sont inclusifs, qui encouragent la variété, que ce soit culturelle ou bien de genre, etc.

Et ce que j'essaie de faire aussi avec ce genre de conférences, pour montrer un peu qu'on est capable de faire un changement en tant que femme dans un domaine qui bouge énormément, qui est le domaine de machine learning, montrer qu'on est capable de s'adapter aux tendances, mais aussi regarder. Pour passer une tendance, est-ce que ça vaut la peine de jump on the hype ou bien est-ce qu'il faut prendre un peu de recul, réfléchir un peu et regarder si ça vaut la peine ou pas? Super intéressant. Merci déjà pour ce partage. J'ai une première question. Moi, Dashlane, je connais bien, je suis abonné depuis de nombreuses années désormais, mais nos auditeurs ne connaissent pas forcément. Est-ce que vous pouvez dire un petit peu ce que fait Dashlane? C'est un gestionnaire de crédentiel qui s'en profite la protection de vos identifiants que vous soyez en particulier une entreprise. Et notre mission, c'est d'aider les gens à stocker et accéder de manière sécurisée toujours et pratique.

Tous les identifiants et données dont ils ont besoin dans l'oeuvre numérique, comme les mots de passe, passkeys, code wifi, mais aussi vos données personnelles, votre adresse, vos infos de carte bancaire. De plus, on essaie de rendre la sécurité plus facile. On vous alerte aussi quand vos données sont potentiellement à risque ou si vous arrivez, petit spoiler, sur une page de fichier. On génère des mots de passe forts et uniques pour tous vos comptes. On fait l'autofile automatique de vos mots de passe et données personnelles. Pour vous faire gagner du temps. L'idée, c'est de créer une sécurité proactive et sans friction dans la vie quotidienne numérique. Et pour qu'on ait un petit peu de contexte de l'entreprise, quand est-ce que ça a été fondé, combien il y a de personnes, et notamment dans les équipes produits et engineering? Oui, bien sûr. Ça fait, je crois, environ 16 ans.

Dashlane est fondée. Il y avait beaucoup de changements et de développements intéressants. Par exemple, le web a beaucoup changé. landscape de sécurité aussi. On a au total environ 300 employés en France, aux États-Unis et au Portugal. Donc, il y a, c'est vrai, peut-être environ 150 du côté product et engineering. Et dans les discussions qu'on a pu avoir avant ce podcast, il y a un sujet qui est vraiment important chez Dashlane, c'est le zéro knowledge. Je crois que c'est au cœur de la stratégie et au cœur du produit, mais tout le monde n'est pas forcément familier avec le zéro knowledge. Peut-être qu'à hauteur, tu pourrais nous dire un petit peu ce que c'est ce zéro knowledge. L'architecture zéro knowledge, c'est le principe fondamental pour protéger la vie privée des utilisateurs en ligne. Si par exemple, vous imaginez le coffre-fort du manque avec deux clés pour s'ouvrir, une qui est détenue par la banque et une qui est détenue par vous.

C'est-à-dire que même si des voleurs s'introduisent dans la banque et ils arrivent à voler la clé, ils ne peuvent toujours pas ouvrir votre coffre-fort sans votre clé personnelle. Et chez Dashlane, on applique exactement ce même principe. On utilise cette architecture zéro knowledge pour garantir que vous seul détenez la clé qui est votre mot de passe maître. Et ça veut dire que ni nous, ni une personne qui essaierait de pirater nos serveurs puisse accéder à vos données parce que vos données restent chiffrées et inaccessibles parce qu'on n'a justement pas l'information pour les déchiffrer. Le sujet... Du Summit et sur l'intelligence artificielle, entre la hype et la réalité. Et je sais que, bien évidemment, vous faites de l'intelligence artificielle chez Dashlane. Quand est-ce que ça a commencé, l'intelligence artificielle chez Dashlane? C'est quoi les premiers cas d'usage? Ça fait plus de cinq ans qu'on utilise l'intelligence artificielle dans le produit. Et notre premier use case, c'était de faire de l'autofile intelligent dans l'extension.

Bien avant, on avait un moteur de règles pour identifier si ce formulaire correspond à un formulaire de login, de paiement, d'enregistrement, etc. Et c'est comme ça qu'on arrive à mettre les bons credentials aux bons endroits. Sauf que le web, ça change tout le temps. Et c'était compliqué de maintenir ce moteur de règles. Donc, on a décidé de passer à l'IA pour que ce soit le modèle qui apprend ses patterns par lui-même et qui se met à jour automatiquement avec les nouvelles données, avec les nouvelles pages qu'on arrive à récolter du web. Après cette année, on a ajouté une deuxième solution d'IA dans le produit qui consiste à faire de la détection de tentatives de phishing en temps réel, toujours en respectant la vie privée de nos utilisateurs dans une architecture zéro knowledge. Et on a remarqué que la plupart des solutions d'anti-phishing sur le marché, ils consistent soit à faire des filtres dans les emails, comme les filtres que vous avez dans Google par exemple, ou bien à faire des...

des blocklists qui ne se mettent pas à jour de manière très fréquente. Sauf qu'avec l'avancement de l'IA, on peut recevoir aujourd'hui des attaques de plusieurs channels. Tu peux les recevoir sur ton email, tu peux aussi les recevoir sur ton Facebook, Instagram, par SMS, etc. Donc, on a décidé de faire l'analyse directement sur la page pour détecter s'il y a des patterns suspicieux ou pas. Et l'IA, elle est très bonne à faire de la... protection de pattern. Donc, en quelque sorte, en fait, on contourne l'IA avec l'IA et on protège nos utilisateurs, peu importe comment ils sont arrivés sur la page de phishing, en temps réel. Et ça s'appelle du zero hour parce qu'on n'attend pas que l'information se propage vers des block lists et à update la block list. Ok, super intéressant. Et justement, si on fait le lien entre l'IA et l'architecture zéro nolet, forcément l'IA marche mieux quand on a un gros volume de données. Là, il y a sans doute un challenge pour vous parce que vous n'avez pas accès aux données de vos utilisateurs et tant mieux.

Pourtant, vous devez peut-être entraîner vos modèles. Tina, quelle parade vous avez trouvée pour ça? Oui, la question est vraiment intéressante. On voit qu'avec l'actuel IA et l'adoption massive, tout le monde partage tout avec IA. Que les fournisseurs qui ont de plus en plus de données pour entraîner leur modèle. Mais chez Dashlane, on a fait le choix inverse, guidé par notre principe de zéro knowledge. Pour l'entraînement du modèle, plutôt que de collecter des données utilisateurs, on a lancé une collecte. 100% en termes. Ça veut dire que nos collègues chez Dachshund nous envoient des pages bien en outils privés qui retirent les emplois sensibles. Ensuite, on labellise automatiquement avec des... Là où au début, on faisait tout à la main. Le résultat, on a plus de données, plus vite.

Mon cher est toujours en respectant le privacy first. Et puis pour le déploiement des modèles, au lieu de construire des modèles géants, des LLM qui aspirent toutes vos données, On développe des modèles frugaux et spécialisés qui tournent en local, toujours. Concrètement, notre modèle IA est intégré dans l'extension de WebFashion et l'analyse des pages Web en temps réel sans jamais transmettre de données personnelles vers nos serveurs ou d'ailleurs. C'est important parce que nos utilisateurs nous font confiance et peuvent utiliser nos solutions sans crainte. C'est un énorme avantage concurrentiel. Et paradoxalement, ces contraintes nous forcent à être plus innovants. Quand on ne peut pas simplement jeter plus de données sur un problème, sur le modèle, on doit trouver des solutions créatives. C'est intéressant. Je pense que c'est un sujet qui peut aborder dans les boîtes tech en ce moment.

C'est que finalement, on donne énormément de données et parfois, même souvent, de la donnée personnelle au LLM. Et donc, c'est un sujet qui n'est pas forcément traité. Kaouther, il y a eu des challenges pour faire ça parce que forcément, il y a peut-être moins de littérature, il y a peut-être moins de retours pratiques. Concrètement, est-ce que tu as eu des challenges autour de ça ? Oui, on n'a pas eu l'idée directement comme ça de faire une récolte 100% interne. En fait, au début, on a commencé par passer par des contracteurs externes. Nous, on s'intéresse surtout sur des formulaires qui sont protégés, comme des formulaires de paiement, etc., où tu as besoin de créer un compte pour pouvoir aspirer ces données. Et du coup, au début, on est passé par des contracteurs qui faisaient ce travail-là pour nous et qui faisaient aussi la labellisation. Sauf que ça coûtait assez cher. C'était autour de 5 dollars par page, il me semble.

Et aussi, vu que le web change tout le temps, on ne peut pas faire du one-shot. Ça veut dire qu'on ne peut pas juste une fois faire la collecte des données et puis basta, on s'arrête ici. Il faut que la source de données soit continue, etc. Donc, avec l'avancement aussi de l'IA, avec des outils comme ChatGPT, etc., on s'est dit... On peut faire de l'IA générative, mais on ne peut pas la faire sur les données de nos clients. Donc, on va la faire sur nos données internes. Et du coup, on a décidé de faire cette campagne de crowdsourcing interne. Et une fois qu'on a les pages, on peut les labelliser avec ChatGPT. Et vu que c'est des pages qui sont internes, on a le droit d'utiliser les LLM, etc. Et aussi, on a rajouté des couches de protection. des données personnelles des dashliners, parce qu'on ne veut pas aussi que nos données personnelles soient directement dans le modèle. Donc, il y a eu beaucoup d'allers-retours, d'essais. On a aussi essayé de faire, par exemple, d'utiliser ChatGPT pour générer automatiquement des pages.

Au lieu d'aller collecter nous-mêmes, on a demandé à ChatGPT, est-ce que tu peux nous faire des pages qui contiennent des formulaires, etc. Et on a dû abandonner cette expérimentation parce qu'il n'y avait pas d'autres. de diversité dans les pages qui est proposée, mais aussi parce qu'on demandait de générer des pages qui étaient mal codées. Et ces pages-là qui nous intéressent le plus, qui ne respectent pas les standards HTML, Ils ne sont pas très bien foutus. Sauf que ChatGPT a été entraîné pour générer du bon code. Donc, on n'arrivait pas à contourner ce problème-là et de générer de la data de qualité. De faible qualité. De faible qualité, c'est ça. Du coup, il y a eu pas mal d'essais pour arriver à avoir une source de données qui est continue. Parce qu'aujourd'hui, l'outil est sur tous les ordinateurs des dashliners. On ne va jamais le retirer. Et à chaque fois qu'ils ont une page qui nous intéresse, on leur demande de nous envoyer la page. Et c'est comme ça qu'on arrive à updater nos modèles d'IA dans Dashlane.

Super malin, super innovant. Un point qui me marque aussi quand on a discuté, c'est que je vais redonner un peu de contexte, mais c'est vrai qu'en ce moment, il y a une grande hype autour de l'intelligence artificielle. Par contre, je ne sais pas si vous avez pu voir, il y a eu une étude récente du MIT qui a dit que 95% des entreprises n'avaient pas le retour sur investissement, des investissements qu'ils ont fait ces derniers mois, dernières années sur la Gen AI. Dans le même temps, on voit beaucoup d'entreprises qui embauchent aussi des gens issus de l'académique. C'est un sujet qui existe et peut aussi arriver à avoir un retour sur investissement. Or là, on a... quand même à faire un produit où justement, Kaouther, tu viens plutôt de l'académique et tu as pu contribuer avec Tina à générer de la valeur. Moi, ça m'intéresse ça parce que je vois beaucoup d'échecs dans ce domaine, mais justement, est-ce que vous avez des choses que vous avez fait en particulier? Qu'est-ce qui explique que vous avez réussi à avoir un retour sur investissement et puis en plus sur intégrer parfaitement quelqu'un qui vient de l'académique?

Est-ce que vous pouvez nous parler un peu de ça? Oui, il y a deux côtés ici, l'usage qu'il y a dans le produit et aussi en long terme pour le rendre plus efficace. Et pour les opportunités d'ajouter plus d'IA dans le produit, on a un réflexe simple parce que cette question arrive assez souvent. On peut ajouter de l'IA ici ou là-bas? Et notre réponse, c'est en général, oui, peut-être, mais pourquoi? Il faut toujours retourner au problème des clients du business. La suggestion d'IA, c'est une solution précise, mais c'est quoi le problème en dessous? Est-ce que ce problème sera vraiment mieux résolu avec l'IA que sans? Est-ce qu'il y a des besoins pour des usages dans lesquels il y a un génial pour une classification intelligente? Où est-ce qu'on peut optimiser?

processus classique avec l'IA. C'est une manière de résoudre un problème, mais pas une vraie solution en soi. On a eu pas mal d'idées pour améliorer quelque chose de précis avec l'usage d'IA, mais souvent on peut attendre le même résultat avec un simple moteur direct. Bref, il faut vérifier que l'IA va ajouter une valeur unique et utile. Avec Kaouther, avec l'équipe, avec nos stakeholders, on pèse l'avantage unique avec l'IA contre le vrai problème et des manières différentes pour le résoudre. Et bien sûr, toujours, est-ce qu'on peut... Facilement ou assez vite implémenter cette solution IA en respectant la vie privée. Et en ce moment-là, ça reste toujours pas facile, pas encore. Ce que tu dis, et on le voit beaucoup, que ce soit sur les publications, les réseaux, c'est que souvent l'IA est la finalité et on oublie le besoin initial.

Et donc, on veut mettre du LLM partout. Ça peut faire le job dans certains cas. Une expression que j'aime bien, c'est que quand notamment tu as un marteau, tout ressemble à un clou. Donc, c'est un petit peu le truc de se dire, bon, j'ai un LLM, je peux faire ce que je veux. Donc, c'est très vrai ce que tu dis. On va venir toujours aux besoins de l'utilisateur. Et sur la partie, justement, intégration des ML engineers, Et puis, ceux qui viennent plus de l'académique, ce n'est pas toujours le cas dans les entreprises. Kaouther, comment toi, tu vis cette expérience chez Dashlane et quelles sont les pratiques qui te permettent d'avoir un impact concret et pas de rester dans l'abstrait? Qui peut arriver parfois. Oui, en fait, avec l'équipe, avec Tina, mais aussi avec d'autres personnes, on fait pas mal l'exercice de brainstorming pour essayer de voir des nouvelles approches. d'IA dans le produit qui sont utiles, comme disait Tina. Et souvent, mes projets commencent par une phase de R&D.

Donc, je vais commencer par faire une lecture de l'état de l'art pour voir ce qui existe aujourd'hui, que ce soit côté recherche ou bien aussi côté dans le marché, pour aussi comprendre qu'est-ce qui est faisable et qu'est-ce qui n'est pas faisable. Et voir quelles sont les contraintes actuelles dans les systèmes qui sont proposés dans la recherche et dans le marché pour pouvoir trouver le sweet spot qu'on peut proposer chez Dashlane. Ce côté de recherche, il m'apporte beaucoup de valeur dans mon quotidien à Dashlane parce qu'il m'aide à trouver des nouvelles idées. Des fois, je ne pense pas à ça et je trouve cette idée dans l'état de l'art. Je me dis que c'est super intéressant. Comment je pourrais adapter ça à nos use cases à Dashlane? Et puis, ça me montre aussi quels sont les contraintes et les faiblesses qui sont dans les systèmes actuels. Comme par exemple, quand j'ai parlé de l'anti-phishing, en regardant, en lisant l'état de l'art, je me suis dit, pourquoi on ne se concentre que sur les e-mails?

Qu'est-ce qui se passe? Qui ouvre ses e-mails encore aujourd'hui? Moi, souvent, je reçois les tentatives de phishing sur SMS avec quelqu'un qui essaie de me faire livrer quelque chose en boîte de lettres, etc. Et ça, j'ai pu le voir en faisant la lecture de l'état de l'art. Donc, c'est quelque chose qui est... qui a beaucoup de valeur, mais aussi quand j'essaye de faire un projet, j'essaye de faire de la R&D qui a une chance d'aller en prod. Donc, on ne fait pas de la recherche pour la beauté de la recherche, mais je regarde avec Tina et avec les stakeholders si cette idée, elle peut... Elle peut ramener des nouveaux utilisateurs, si elle résout des vrais problèmes, si ça a de la valeur de rajouter dans le produit. On réitère ensemble et c'est comme ça qu'on arrive à avoir de la valeur en faisant de la recherche avec une personne qui a plutôt un background académique. Super intéressant. Vous allez parler peut-être de cela au Summit, parce que je le rappelle, vous avez une conférence.

On est très heureux de vous accueillir pour parler de l'IA chez Dashlane, notamment. Mais justement, pour notre auditoire, de quoi vous allez parler au Tech.Rocks Summit? Comme on disait, chez Dashlane, on fait la gestion de mot de passe et de crédit d'achat dans une architecture zéro knowledge. Ça veut dire qu'on ne voit pas les données qu'on protège et ça constitue un peu notre ADN, Privacy First, ce qui veut dire que ça nous met dans une situation un peu paradoxale, comment on peut faire de l'IA. Quand l'IA a besoin de données. Et dans ce talk, on va vous montrer comment on a transformé cette contrainte en opportunité stratégique. On partage notre... tour d'expérience complet, que ce soit les approches qui ont fonctionné, qu'on a adoptées, mais aussi celles qu'on a dû abandonner. Et ce qu'on espère avec ce talk, c'est que les participants repartent avec la conviction qu'on peut faire de l'IA différemment, que les contraintes de privacy ne sont pas un frein à l'innovation, mais qu'elles peuvent vous pousser à être plus créatifs,

plus efficaces et au final plus compétitifs. Super, hâte d'y être. Moi, c'est un talk qui me tient particulièrement à cœur. Je trouve qu'il y a une partie produit, user, il y a une partie plus technologique et les contraintes. Et puis, c'est très pragmatique, c'est-à-dire qu'il y a l'IA, on en entend beaucoup parler sur l'avenir, ce que ça peut faire et tout. Là, c'est dans un produit, c'est concret. Il y a eu des réussites, il y a eu des échecs qui ont permis d'autres réussites. C'est un peu ça aussi le sujet de Tech.Rocks. Et voilà, la transparence, sans langue de bois, expliquer ce qui se passe. Et je pense que ça va être un talk super. J'ai hâte d'y être. Je le rappelle à tous, le Tech.Rocks Summit, c'est du 1er au 2 décembre au Théâtre de Paris. Pour ceux qui ne connaissent pas, l'endroit est juste magnifique. C'est deux jours où il y a plein de speakers aussi bien inspirants que concrets, plein de monde à rencontrer. On se retrouvera, Tina et Kaouther, là-bas. C'est la fin de ce podcast. Merci Tina, merci Kaouther. On espère tous vous retrouver au Tech.Rocks Summit. À bientôt sur les podcasts de Tech.Rocks.

Au revoir. Au revoir. Au revoir.