Tech.Rocks Summit 2020

L'importance des index

Tech.Rocks Summit 2020 · 11 décembre 2020 · 24 min · en français

Résumé

Tour d'horizon du moteur de recherche Qwant, de ses partenaires et des domaines dans lesquels il cherche son indépendance : ce que signifie cette indépendance lorsqu'il s'agit de tenir son propre index, et où en sont les efforts.

Summary

An overview of the Qwant search engine, its partners and the areas where it seeks independence: what that independence means when it comes to maintaining its own index, and where the effort stands.

Thèmes : Architecture & développement · Cloud, infra & ops

Page du Tech.Rocks Summit 2020

Transcript complet

Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.

Bonjour, Hugo Venturini, sitio de Quant. Je vous retrouve tout de suite. Mais dites-moi, il n'y en aurait pas certains d'entre vous qui seraient en train de me quantiser, par exemple? Écoutez, ça tombe plutôt pas mal parce que je suis ravie d'accueillir dès maintenant Hugo Venturini, qui est le CTO de Quant, le fameux moteur de recherche français. Bonjour Hugo. Bonjour Elsa. Alors pour rappeler quelques chiffres quand même concernant Quant, Quant c'est à peu près 5 millions de visiteurs uniques par mois si je ne m'abuse. Et un des enjeux majeurs dont vous allez nous parler, c'est justement qu'est-ce qu'on fait en matière de technologie? Est-ce que parfois il faut acheter une technologie ou est-ce qu'il faut la développer par soi-même? Vaste sujet, vaste question. Et je n'ai que 20 minutes, tristement. Écoutez, je vous les laisse. Je vous remercie. Hugo Venturini, CTO de Quants, le mec hors bail, comment est-ce qu'on aborde ce problème quand on veut construire un moteur de recherche?

Difficile d'y répondre si j'essaye d'aborder ça de manière un peu holistique pour tous les personnes qui nous regardent, que ce soit ingénieurs, CTO, directeurs et hors tech, on ne peut pas aborder ce problème-là. Je vais plutôt vous proposer une approche qui est celle que chez Quant on a pris. Je vais essayer de l'illustrer au travers de notre moteur. On va ouvrir le capot, on va regarder notre index. Je vais commencer par un rappel de ce que c'est qu'un moteur, ce que ça implique, quelles sont les différentes briques. Ensuite, je vais vous raconter le changement d'index de manière à pouvoir répondre à une question simple qui est comment s'affranchir du partenaire historique de Quant et qui est le partenaire historique de beaucoup de moteurs de recherche. J'ai nommé Microsoft Bing. Au démarrage, on commence par faire un moteur et on fait d'abord l'intention qui est la liste des fonctionnalités. On va pouvoir poser des questions. Est-ce que c'est par mots-clés? Est-ce que c'est syntaxique, sémantique?

Est-ce qu'on est spécialisé? Est-ce qu'on descend dans le labyrinthe de la spécialisation qui est, on ne répond qu'à des questions juridiques? Des gens le font très bien. Certains les connaissent peut-être. Je vous encourage à les utiliser. Quand tu as décidé d'être un moteur général, Généraliste, ça veut dire qu'on peut répondre à toutes les questions plus ou moins bien. On n'est jamais aussi fort qu'un expert, mais par contre, on peut aborder plein de domaines. La façon simple, c'est de commencer par faire une interface avec quelqu'un qui sait déjà faire ça. Google et Microsoft Bing proposent des interfaces permettant de répondre à ces questions et de le faire. On connaît des moteurs, dites alternatifs, j'aime pas trop ce mot alternatif, mais néanmoins des moteurs existants, qui permettent de s'appuyer sur ces moteurs existants et qui proposent une surcouche avec certaines valeurs, qui vont être de sécurité, qui vont être de solidarité, qui vont être autres. La première étape est de construire cette façon de proposer un moteur.

Ensuite, on va se demander quels sont les éléments qu'on peut internaliser. Un moteur de recherche. On va d'abord reprendre un peu les fondamentaux du moteur de recherche, qui sont les quatre grandes briques qu'on a. On a d'abord un crawler. On appelle ça crawler, on va appeler ça bot, on va appeler ça robot, on va appeler ça spider, on va appeler ça... Moi, j'appelle ça crawler. Pour le reste de cette présentation, j'ai dit des mots crawler. Un crawler est un programme qui va parcourir Internet à la recherche de l'information brute qui est disponible. Donc on va prendre ce qu'on appelle des URL, donc des adresses que vous tapez dans vos navigateurs. Et ensuite on va avoir une page, dans ces pages-là il y a d'autres liens, on va les extraire, on va les lister, et un par un on va... On va aller en profondeur et on va chercher à lister l'intégralité. On se retrouve donc avec des dizaines de milliards d'adresses. Certaines de ces adresses sont redondantes, elles pointent vers la même chose, donc il faut arriver à le deviner. Certaines disent la même chose, certaines mènent nulle part, ce qu'on appelle des fameuses 404, des fameuses erreurs.

Certaines sont vouées à être obsolètes, certaines contiennent de l'information qu'il faut qu'on peut laisser, elles sont archivées, ne vont que très peu se modifier. Ce qui veut dire que dès le démarrage, dans l'ensemble des URL qu'on récupère, on a deux types d'URL. On a celles qu'on va clairement devoir revisiter fréquemment, exemple les journaux, exemple le programme télé, exemple la front page d'une université par exemple, et d'autres qui sont vouées à moins bouger. Par exemple, certaines pages de blog sont moins vouées à bouger une fois que le billet a été publié. Ça bougera peu. On peut tout de même venir voir au cas où. Mais néanmoins, vous voyez, je fais ça un peu aussi au doigt mouillé. Je raconte, mais il y a des affres, il y a une quantité. pléthorique dans la diversité des URL. Cette donnée brute, on la stocke, on l'a chez nous, et là on se pose la question du maintenant sur lequel on veut de l'information. Donc on a une première passe à faire pour essayer d'extraire déjà les... Les URL qui peuvent être importantes ou non importantes, celles qu'on connaît, qui sont déjà flaggées comme étant malsaines.

Et par malsaines, encore une fois, je vais citer quelques éléments, mais on a la pédopornographie, on a le terrorisme, on a des choses illégales selon les pays. Et là, on commence à rentrer dans un détail qui est un peu intéressant, qui est à savoir la légalité selon le lieu où on se trouve. Le moteur récupère cette donnée brute, on va commencer à la traiter, on va la mettre dans ce qu'on appelle l'index. Et c'est là le cœur, quand on parle d'un index, l'index de Quant, l'index de Google, l'index de Bing, l'index de Yandex, l'index de CockCock, l'index de Naver, citez-les, ils existent, ils sont là. La question c'est cet index, qu'est-ce que c'est? Un index, il a deux caractéristiques. La première, c'est son volume, sa capacité à prendre en volume. On parle de milliards de documents. Un document, c'est un élément qui vient du crawler, souvenez-vous, la fameuse URL, qu'on a enrichi et qu'on a commencé à stocker. Ça veut dire que pour stocker, il faut de la place. Et là, on commence à discuter. Est-ce qu'on meck ou est-ce qu'on buy? Est-ce qu'on va commencer par acheter nos disques durs et à les mettre chez nous? Ou est-ce qu'on va commencer d'abord par déléguer à quelqu'un qui sait stocker et qui sait faire de la redondance et on verra ça après?

Voilà, c'est une question qu'il faut se poser. Donc on a cet index capable de... de stocker en volume. Et après, l'index a une deuxième caractéristique dans le cadre des moteurs de recherche, qui est la capacité à répondre avec ce qu'on appelle du learning to rank, du LTR. Donc ça veut dire qu'on va poser des questions au moteur, il faut qu'on extrait des documents, qu'on les organise et qu'on y réponde. Et cette pertinence est un problème de qualité et on veut une vitesse de réponse. Donc l'index a une deuxième caractéristique au-delà du volume, qui est la capacité à répondre rapidement. Avec un petit prime sur ce rapidement, c'est rapidement de qualité. On va y revenir après sur la qualité. Donc répondre rapidement, ça veut dire répondre en un temps. Chez QWANT, nous avons été basés pendant de longues périodes sur un index construit avec Elasticsearch. Elasticsearch, connu. Utilisé de qualité qui permet de créer des index et des moteurs et des bases de données, des stockages, des requêtes, nous a amené au bout de ce qu'on pouvait faire avec cette technologie qui nous empêche de répondre en temps réel.

La façon dont se passe notre moteur, les gens font une requête, et là d'un coup on a un embranchement. L'embranchement c'est, est-ce qu'on peut y répondre nous? Donc au début on était à 0%. Donc on délègue à notre partenaire et on répond avec Microsoft Bing. Et puis tranquillement, on commence à pouvoir répondre à certaines de ces requêtes. On commence à y répondre et on atteint un certain volume. Au jour d'aujourd'hui, on oscille, c'est jamais un chiffre marqué et fixe, on oscille à 40%. des requêtes qui nous arrivent, nous sommes capables de répondre avec notre index. Et quand nous ne sommes pas capables, nous nous appuyons sur Bing. Alors je fais une aparté sur ce qu'on appelle répondre, c'est qu'en fait votre page, quand vous la regardez bien, à l'intérieur en fait il y a différents éléments. Il va y avoir la barre de recherche avec la courrie que vous avez tapée, Il va y avoir des encarts, par exemple Wikipédia, il va y avoir des news, il va y avoir une réponse proposée, par exemple quand on met une opération, on va avoir le résultat de l'opération, je ne sais pas si j'entends une opération algébrique. Et ensuite on a la fameuse liste des résultats, et cette liste-là qui est donc un sous-ensemble de la page complète de réponse, c'est ce sous-ensemble-là sur lequel on s'appuie sur différents partenaires.

Donc là je parle de Microsoft Bing dans le cas des listes de résultats, mais dans le cas de recherche de shopping, nous avons des partenaires pour le shopping, dans le cas des publicités, d'autres partenaires. Et le but est en fait de déléguer au maximum de partenaires afin de nous concentrer sur le cœur de métier. Et ça, du coup, je vais revenir un peu, j'aurais du mal à dire que je prodigue des conseils à mes pairs, mais... Je pense qu'il y a un point qui est très important si on ne veut pas se perdre, c'est de se focaliser sur le cœur de métier et savoir déléguer ce qui n'est pas le cœur de métier. Je prends un exemple idiot, mais néanmoins, on va dire parlant. On ne démarre pas une boîte en disant« je vais réimplémenter tout le logiciel de compta». Comme ça, j'aurai une contact claire pour mon produit. Non, on délègue, on délègue clairement. Là, c'est évident. Je ne vous vois pas, mais je vous vois sourire, en fait. On est en train de se demander de quoi il parle. Mais effectivement, l'idée est là. qu'à un moment, il faut déléguer. Donc il y a des évidences et d'autres qui sont moins évidentes. Par exemple, sur la publicité. Est-ce qu'il est facile de monter une régie de pub? Est-ce qu'on a vocation à l'internaliser?

Qu'est-ce que ça demande comme compétence? Et est-ce que c'est notre cœur de métier? Le cœur de métier de compte, ça va être d'avoir un moteur de recherche et d'être capable de monétiser ses résultats. Dans l'ordre des choses, donc on ne va pas externaliser la compta, mais on va essayer d'externaliser, pardon, on va justement externaliser la compta, mais pas tout de suite ou pas forcément, ou en tout cas on va essayer de réduire la part d'externalisation du... de l'index. Mais externaliser l'index, quand on commence à l'internaliser, d'un coup on a un deuxième dilemme qui est est-ce qu'on externalise le stockage de l'index? Ou est-ce qu'on l'internalise également? Et puis après on pourrait pousser le vice encore plus loin en se demandant qui est-ce qui va fondre nos processeurs? Ça devient très compliqué. Peu dans le monde sont capables de dire qu'ils sont autonomes technologiquement. Mais ça peut être une direction qu'on veut prendre. Si on revient sur l'index, j'expliquais qu'avec Elasticsearch, on avait un temps de réponse qui a augmenté dû à la technologie elle-même. Et on s'est retrouvé bloqué, une sorte de plafond de verre qui nous empêche de répondre en moins d'une seconde, étant donné la taille de l'index, étant donné la complexité des queries et la qualité qu'on espère obtenir.

Qualité toujours perfectible, toujours. Même dans les plus grands, on constate qu'il faut toujours cet domaine dans lequel on travaille tout le temps. J'aime beaucoup cette citation, je ne pourrais même pas vous retrouver quand c'était, d'un des deux fondateurs de Google, qui expliquait que malheureusement il avait atteint la conviction que jamais il ne pourrait se passer d'humain pour revoir la qualité. De compte. Malgré tous les efforts, tout ce qu'on pouvait faire en intelligence artificielle, on finira toujours par un sous-ensemble qui doit être revu par des humains. Et dans tous les cas, après c'est encore une question de point de vue que j'aime bien débattre avec les gens, moi je pense que l'intelligence artificielle est vouée à aider l'humain et non pas à le remplacer. C'est une question de... peut-être de point de vue, et je suis prêt vraiment à discuter avec plein de gens à ce sujet-là avec grand plaisir. Notre index, donc, du coup, nous a atteint un plafond de verre qui était lié à la seconde en termes de réponse. Or, combien y a-t-il de requêtes possibles dans un moteur de recherche? Une infinité.

Donc vouloir prévoir le nombre de requêtes revient à vouloir énumérer l'infini. On ne va pas s'aventurer dans ce domaine-là. Donc ce qu'on a fait, c'est qu'on a essayé de prévoir une partie des requêtes, de différentes façons, et on a mis en cache, on a prévu, sur notre index, des choses qu'on pouvait répondre, en essayant d'être réactif. Tiens, il s'avère qu'on voit cette requête passer fréquemment dans la dernière heure, est-ce qu'on ne peut pas essayer d'y répondre? Qu'est-ce que ça veut dire de construire une page pour cette requête-là? Est-ce qu'elle est obsolète? A-t-elle une certaine valeur? Comment gérer ce cache? Comment gérer cette façon? Comment réduire le temps de cache? Et on s'est rendu compte qu'en fait, on devait changer de technologie. Donc on a externalisé une partie de la technologie de l'index en termes de base de support chez Elasticsearch. Et on est en train de passer chez Vespa, pour ceux qui connaissent, je vous encourage à vous intéresser à cette technologie, qui nous permet d'avoir un index qui répond en moins d'une seconde, en moins de 100 millisecondes. Et d'un coup, on commence à se dire, hey, là, à ce moment-là, on va pouvoir commencer à répondre en temps réel, ce qui veut dire qu'il est crédible de répondre à toutes les requêtes.

Crédible. Mais attention, répondre ne veut pas dire répondre correctement. Pour toutes les cohérents. Je pourrais toujours répondre quelque chose. Mais si c'est pour que tout utilisateur qui vienne chez QWANT se dise« ils sont tellement à côté de la plaque», Je ne pense pas que ce soit utile. Ce qui veut dire que pour l'instant, on est voué à travailler sur cette qualité, même si on a maintenant la possibilité. Le changement d'index est prévu dans les prochaines semaines, mois. On a bien une série de tests. Pour ceux que ça intéresse, la façon dont on teste ça, on fait du shadow, déjà pour la test de charge sur notre infrastructure, et ensuite pour savoir si en termes de qualité de résultat, on est équivalent ou au moins aussi bon, si ce n'est meilleur. Et ensuite, on a un deuxième angle qui est comment est-ce qu'on travaille sur cette qualité. Donc mettre en place les métriques. C'est quoi une page de qualité? Et là, on touche à l'humain, c'est compliqué. Et là encore, il faut du coup des gens pour revoir ça. On n'a pas les moyens de payer en interne des gens pour revoir l'ensemble des pages qu'on a. Du coup, ce qu'on fait, c'est qu'on travaille sur deux choses. On internalise le développement d'une métrique et on externalise la revue de ces métriques en volume.

Donc on prépare un pipe de revue de qualité des différentes pages et on propose à une entreprise externe de revoir avec nous, capable de nous faire des feedbacks sur un grand nombre de pages. On aspire à être capable un jour, encore une fois, d'être capable d'être plus flexible. Un, réduire le nombre de pages qui ont besoin d'être revues, donc pour ça, travailler en interne, et réduire le nombre de personnes qui ont besoin de le revoir en internisant une partie. Pourquoi pas? Ça se discute. Mais pas tout de suite. Le focus pour l'instant est encore sur la technologie elle-même. Je vais aborder un autre problème qui est du coup la publicité et le shopping et les fameux revenus en fait. Comment est-ce qu'on peut faire rentrer de l'argent dans le cadre d'un moteur de recherche, encore une fois? Ça n'a pas vocation à être équivalent pour toutes les autres plateformes, mais je vous encourage à prendre ce que je vais dire avec une pincée de sel. Selon ce sur quoi vous travaillez. Mais se poser la question du par où rentre l'argent et comment est-ce que je le dépense? Est-ce que je le garde pour moi ou en tout cas est-ce que je le dépense en interne ou est-ce que je vais chercher du coup à l'externaliser parce que c'est une plus-value en fait à ce moment-là en me disant que ça...

que je pourrais en fait le faire plus tard. C'est des questions qui sont lourdes. Dans le cadre du shopping, par exemple, nous avons décidé de ne pas nous appuyer sur une technologie intégralement fournie, mais d'en développer une partie chez nous avec certains partenariats. Le partenariat est à un degré 2, j'ai envie de dire, quand je dis degré 2, sous-entendu degré 1, Microsoft Bing nous fournit, Ads nous fournit la pub directement, on envoie une quantité d'informations leur permettant de nous proposer de la publicité qu'on peut afficher. On n'a pas de retraitement par-dessus, on ne retravaille pas ça. Je vous fais une parenthèse quant à l'incarnation des valeurs qui permet de faire un choix quant à sa forme make or buy. Typiquement, l'information qu'on envoie dans le cadre de nos partenariats. Je vais y revenir dans quelques minutes. Mais par exemple, dans le cadre du shopping, ça nous permet du coup de garder une certaine maîtrise en étant à un degré 2, c'est-à-dire qu'on va avoir une requête qui nous renvoie des choses, et ces choses-là, en fait, qu'on va conserver, on a la possibilité de la retriturer pour répondre de manière un peu plus à notre sauce, à nos utilisateurs. On va travailler sur certains partenariats.

Le problème étant du coup la maîtrise de la façon dont on fait ce bail. Le mec, c'est chez nous, on peut faire toutes les erreurs qu'on veut, c'est nous qui sommes responsables. Dans le cadre du bail, il faut être capable de respecter non seulement une charte fonctionnelle, il faut savoir respecter un certain budget, il faut savoir respecter certaines valeurs. Le respect des valeurs est un point important. C'est un point important, surtout quand c'est aussi quelque chose que vous mettez en avant. Tout le monde, toutes les entreprises ont leurs valeurs et c'est toujours très intéressant quand je rencontre souvent des directeurs, des CTO, des ingénieurs, j'aime bien aller chercher, leur demander comment est-ce qu'ils s'y retrouvent dans les entreprises où ils travaillent, au projet dans lequel ils contribuent. Les valeurs ne sont pas uniquement dans le cadre des entreprises, on a aussi dans le cadre des projets. Un projet, je vais bien dire extrascolaire, dans les projets qu'on a, les projets open source, les projets qu'on a le soir et le week-end, les projets qu'on aime, dans lesquels on s'investit. gratuitement, mais on donne de notre temps. Dans ces projets-là aussi, on y va pour certaines valeurs qui sont défendues. Et c'est important d'arriver à les respecter.

Par exemple, d'un coup, il y a des partenaires avec qui on ne peut pas travailler parce que le respect de nos valeurs ne serait pas là. Je vais prendre un exemple type qui est comment est-ce qu'on peut cibler une publicité en respectant la vie privée de nos utilisateurs. Et pour ça, qu'est-ce qu'on fait? On travaille sur des mécaniques d'obfuscation, sur des mécaniques de pseudo-animisation, anonymisation, pseudo-animisation, le mot est compliqué, un néologisme, de la pseudo-animisation. On est en contact permanent avec nos partenaires pour être sûr de respecter nos utilisateurs tout en garantissant, tout en amenant à la meilleure qualité possible. A tel point que dans les exigences qu'on peut essayer de proposer, Microsoft vient nous voir dans la préparation des nouvelles moutures. Parce qu'ils nous savent exigeants, parce qu'ils savent qu'il y a des choses qu'on ne va pas laisser passer. C'est des points qui sont à la fois valorisants de notre côté, parce que du coup on est capable d'aller des... défendre certaines valeurs, certaines choses, dans les incarner à notre manière, tout en étant capable d'externaliser certaines choses qu'on n'a pas encore les moyens financiers, des moyens humains, en fait, d'internaliser.

Toutes ces caractéristiques, en fait, alors j'ai fait un... Un panel un peu large de la façon dont se passe le moteur. Je suis à peine rentré sur la détection d'intention qu'on avait au niveau de la lecture de query, comment est-ce qu'on se décidait à utiliser par exemple la GODNS pour être en amont et éviter de surcharger une infrastructure pour être sûr de pouvoir forquer et aller directement prendre des requêtes là où on sait qu'on ne pourra pas répondre. La question du choix nous permet de faire certaines économies, si ce n'est d'échelle, en tout cas certaines économies. Dans la création de notre moteur. Je n'ai pas abordé ça, on pourrait largement en parler. Je n'ai pas abordé le fait, du coup, je ne suis pas rentré dans le détail d'internalisation de nos infrastructures. Je ne suis pas rentré dans le détail de certains frameworks. Est-ce qu'on doit réécrire? Est-ce qu'on doit tout réécrire? Par exemple, moi, je suis assez fan de la capacité qu'ont certaines grandes entreprises à se dire, les frameworks de création d'interfaces utilisateurs ne répondent pas à nos demandes, on va les refaire. Et une fois qu'elles sont refaites, on les propose en open source, et d'un coup on a des frameworks incroyables, comme je pense à React, notamment parce que chez QWANT on s'en sert.

Il y en a d'autres, je pense à d'autres choses qui sont comme par exemple Kubernetes, on a plein de choses comme ça que je trouve assez incroyables, et j'aspire, j'aimerais bien, j'ai hâte, et je sais qu'on est tous dans cette situation-là, à être capable de la gratuité, du don au reste de la communauté pour élever les... pour élever les mentalités, élever les technologies. Dans notre cas, et dans le cas qui nous occupe tous finalement, c'est quand est-ce que c'est le bon moment? Qu'est-ce que ça valorise? Et où est-ce que je me trouve? Et les questions que je me pose sont toujours de savoir est-ce que ça répond d'abord à l'incarnation des valeurs de l'entreprise pour laquelle je travaille, Et est-ce que je suis en train de proposer un chemin de sortie vers cette dépendance? Toujours. Peut-être qu'à réduire à une échelle humaine, il y a des dépendances qui sont vouées à toujours exister. Je présentais tout à l'heure sur les processeurs. Je pense que c'est vraiment la dernière chose qu'on va pouvoir essayer d'externaliser. Mais néanmoins, j'ai envie de dire que quand on vise un horizon, ça ne veut pas dire qu'on va l'atteindre, ça veut dire qu'on va essayer d'aller le plus loin possible dans cette ligne-là.

Voilà, on atteint le bout de mon approche du make or buy. J'ai essayé de parcourir à travers l'exemple la façon dont moi j'aborde le problème et ce qu'on essaie de faire chez Quant. J'espère que ça vous aura inspiré. J'espère que ça vous a généré des questions. Venez me les poser, je suis à votre écoute. Et voilà. Merci beaucoup. Mais avant que les autres posent des questions, moi j'en ai quelques-unes quand même, Hugo. Je peux vous les poser, vous n'êtes pas... Je voulais revenir sur un des fondamentaux de Quant, parce que ce qui fait la marque de fabrique de votre moteur de recherche par rapport à d'autres, que je ne citerai pas aujourd'hui, c'est le respect de la vie privée. Qu'est-ce que ça nécessite en termes de développement, justement, ce respect de la vie privée? C'est une gestion quotidienne pour vous? C'est une gestion quotidienne, c'est une question qui se pose par construction. C'est-à-dire que, un peu comme la gestion des erreurs, la gestion de la vie privée, c'est by design. On ne peut pas construire un logiciel et se dire, une fois qu'il est fait, bon, maintenant, comment est-ce que je m'arrange pour qu'il respecte la vie privée? Ça ne marche pas comme ça, en fait. Il faut se poser la question à chacune des étapes.

Dans le cadre de Quant, ça veut dire d'abord être sûr de ce que ça veut dire, comment est-ce qu'on incarne le respect de la vie privée. Respecter la vie privée, nous on décide. de l'incarner en se disant, donc on ne stocke pas. C'est une des façons de le faire. C'est notre façon de le faire, et on encourage les gens à le faire, parce que ça fournit une certaine garantie, mais ça ne veut pas dire que c'est la seule façon de le faire. Et pour ce faire, ça veut dire que toute information qui nous arrive doit être au plus tôt obfusquée, doit être, dans l'ensemble des choses qu'on a, on doit en garder une partie de manière à nous améliorer, tout en extrayant la substantifique moelle de la query, tout en repoussant la capacité de stockage des informations privées. Donc oui, c'est tous les jours que ça se passe, c'est des discussions que j'ai très fréquemment avec Guillaume Champot, par exemple, qui est notre chef de l'éthique, notre responsable de l'éthique chez Quant, et avec l'ensemble des ingénieurs, où on pousse fréquemment à se poser la question, est-ce que ce qu'on est en train de faire nous permet d'avancer en répondant à cette question?

D'autant plus que ce que vous êtes en train de faire vous permet aussi de signer des partenariats avec des institutions. Je pense à l'éducation nationale, par exemple, parce que votre moteur de recherche est répertorié dans certains ordinateurs des écoliers de France par rapport à d'autres. Ça a été un argument, j'imagine, clé, le fait qu'il y ait cette protection des données personnelles. C'est une excellente question, Elsa. Je ne rentrerai pas dans les détails de l'histoire qui a amené Quant à être sur les machines. Qui a dû être bien longue, j'imagine, avec l'éducation nationale. Si ce n'est longue, en tout cas, qui a été précise, je suis en contact fréquent avec l'ANSI. Et avec la DINI, qui sont des organismes de l'État qui sont là pour valider le fait que QWANT incarne de manière respectable, incarne de manière acceptable les valeurs qui sont proposées pour que QWANT puisse être le moteur de recherche par défaut. Éducation nationale compliant, on va dire. Oui, mais pas que. On est aussi dans le reste des administrations. Alors, pas intégralement, et je ne rentrerai pas une fois encore, il y a...

Allez lire la presse, les gens en parlent, des gens en parlent, et c'est assez intéressant de voir où est-ce qu'on en est précisément. Mais effectivement, dans le gros de l'administration française, j'utilise le gros pour ne pas avoir donné de chiffres, on est proposé comme moteur par défaut. Absolument. Ce qui est plutôt une très bonne chose. Merci. Moi, je trouve, à titre personnel, c'est une très bonne chose. Merci beaucoup. Donc, si vous avez, vous aussi, d'énormes questions comme moi, j'en avais à poser à Hugo, sachez que vous animez tout de suite. Un Q&A est disponible pour vous qui nous regardez. Merci infiniment, Hugo, d'avoir été avec nous. A très bientôt. Merci beaucoup. Au revoir.