← BibliothèqueToutes les vidéos
Tech.Rocks Summit 2022
Algorithmes de recommandation chez Dailymotion : entre Produit et Tech
- Cyrille Brun (VP Data Product, Dailymotion)
Tech.Rocks Summit 2022 · 9 décembre 2022 · 34 min · en français
Résumé
Les utilisateurs de plateformes numériques attendent le bon contenu au bon moment et une transparence accrue des algorithmes : la performance des produits de recommandation n'a jamais été aussi importante. Comment combiner de forts besoins produit avec une complexité technique, en particulier en machine learning, toujours plus grande ? Comment les rendre complémentaires, par exemple avec la boucle d'interaction utilisateur-recommandation qui doit aider l'algorithme, ou avec les systèmes de recommandation à deux étapes ? Cyrille Brun explique comment les équipes de Dailymotion, après différents essais, ont choisi depuis un an une organisation data product, en investissant dans des éléments techniques et des expertises spécifiques qui ont permis de résoudre certains de ces enjeux.
L’essentiel
Le VP Data Product de Dailymotion explique pourquoi la recommandation est un enjeu majeur pour la plateforme et comment ses équipes relient design produit, signal utilisateur, mesure et architecture technique en quatre étapes.
Pour concevoir ou améliorer un système de recommandation, et discuter de la collaboration entre produit, data et machine learning.
Les idées clés
- Un levier de valeur incrémentale. Les recommandations après une vidéo d’entrée représentent environ 40 % des vues de Dailymotion ; selon Cyrille Brun, améliorer la recommandation crée de la valeur incrémentale, limite les besoins d’acquisition et n’oblige pas à ajouter des fonctionnalités. Des panels de 18-24 ans attendent une pertinence immédiate, de l’exploration et de la transparence. à 3:20
- Aligner design, signal et métriques. L’objectif de l’algorithme doit correspondre à l’intention du design (rester sur un fil ou convertir vers une autre page) ; Dailymotion a réduit l’écran de fin du lecteur à deux choix pour obtenir un signal plus net. Comme un bug silencieux pollue le modèle via la boucle de feedback, il demande des métriques très sensibles. à 15:11
- Une architecture en quatre étapes et une équipe dédiée. Retrieval, filtrage, scoring et ordering permettent de placer la personnalisation, la transparence ou la diversité à des endroits précis ; réordonner pour diversifier a un coût en engagement, qu’il faut accepter sur certains cas d’usage. Une équipe data produit réunit data product managers, ingénieurs machine learning et même un chercheur en sociologie. à 22:27
Questions pour votre équipe
- Quel objectif nos algorithmes optimisent-ils, et correspond-il à l’intention du design de chaque page ?
- Nos métriques détecteraient-elles rapidement un bug silencieux dans nos modèles ?
- Où pourrions-nous introduire de la diversité, et quel coût en engagement accepterions-nous ?
Il s’agit d’une présentation de Dailymotion sur ses propres produits et son organisation, à l’échelle d’une grande plateforme vidéo. Les chiffres d’audience sont ceux de l’entreprise ; les effets des choix décrits ne sont pas chiffrés, et la mise en œuvre du Digital Services Act n’est qu’évoquée.
Chapitres
Summary
Users of digital platforms expect the right content at the right time and greater transparency from algorithms: the performance of recommendation products has never mattered more. How do you combine strong product needs with ever-growing technical complexity, especially in machine learning? How do you make them complementary, for instance with the user-recommendation feedback loop that should help the algorithm, or with two-stage recommendation systems? Cyrille Brun explains how Dailymotion's teams, after several attempts, chose a data product organisation a year ago, investing in specific technical components and expertise that have helped solve some of these challenges.
Thèmes : IA · Data
Transcript complet
Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.
Alors, Cyrille, tu fais comme tu veux, assis, debout, voilà. Debout. Comme à la maison, mais tu vas être très bien. Debout, très bien. Je me mets là-bas, je reviens pour les questions. Merci beaucoup. Bonjour à toutes et à tous. Moi, comme Elsa l'a mentionné, je vais parler de moteurs de recommandation. Tous ces algos qui commencent à prendre pas mal de place dans nos vies de tous les jours, que ce soit pour consommer du contenu, que ce soit acheter des produits en ligne. Et on va passer le cachet qui commence aussi à poser quelques problèmes à nos sociétés en général. Donc moi, c'est Cyril, ça fait 5 ans que je suis chez Dailymotion et moi je dirige les équipes Data Produits, donc on s'occupe en particulier des moteurs de recommandation, mais pas seulement, aussi des plateformes analytics, des systèmes de détection de fraude et des moteurs de recherche. Et pour que je puisse vous parler un petit peu des moteurs de recommandation chez Dailymotion, il faut d'abord que je vous parle un tout petit peu de Dailymotion.
Donc Dailymotion, qu'est-ce que c'est? C'est une plateforme vidéo qui a été créée en 2005 et qui a principalement deux activités. On connaît bien la partie B2C, la plateforme de destination Dailymotion.com ou les applications natives, en gros, offre aux utilisateurs une expérience vidéo qui est spécifique. a du contenu premium, professionnel et vérifié, donc en source vérifiée, et une partie B2B, donc c'est un produit SaaS, un produit vidéo SaaS, qui permet aux éditeurs comme par exemple Le Monde, qui est un de nos partenaires, le Webedia, l'équipe, de gérer, de distribuer et de monétiser leur contenu via notre player vidéo. Et donc ça, c'est assez important. Ensuite, quelque chose qui va être important pour la recommandation de vidéo, c'est l'échelle. Dailymotion, c'est une plateforme mondiale. On est présent dans 145 pays dans le monde, avec 390 millions d'utilisateurs uniques tous les mois.
C'est assez significatif. En particulier en France, où notre activité B2B est assez présente, on a 9 internautes sur 10 qui consomment du contenu vidéo via un de nos produits vidéo. Que ce soit le player vidéo sur le site de nos publishers ou sur directement Dailymotion.com ou les applications natives. Avant de parler de tous les problèmes, tous les enjeux des algorithmes de recommandation et les différentes solutions que j'aimerais partager avec vous aujourd'hui, j'aimerais aussi expliquer pourquoi c'est un sujet passionnant. Et pourquoi est-ce qu'on devrait tous travailler un petit peu sur les moteurs de recommandation? Donc déjà, Dailymotion, où est-ce qu'on trouve de la recommandation? Donc si moi je suis un utilisateur de Dailymotion, j'arrive sur le site web ou sur la page. Je vais avoir beaucoup de vidéos qui vont apparaître devant moi, qui sont en gros recommandées par un de nos algorithmes. Ensuite, je vais potentiellement cliquer sur une des vidéos. Et ensuite, je vais avoir d'autres vidéos qui vont être recommandées en lien ou pas avec la vidéo sur laquelle j'ai cliqué.
J'ai exactement le même cas d'usage sur les sites de nos publishers, où typiquement, quelqu'un, un utilisateur qui regarde une vidéo sur le monde, on va lui proposer d'autres vidéos après la vidéo d'entrée. Et ça, pour vous donner un ordre d'idée, le deuxième use case dont j'ai parlé, quand on rentre sur une vidéo et il y a des vidéos qui sont affichées derrière, c'est à peu près 40% des vues au global chez Dailymotion. Donc c'est très significatif et c'est pour ça que c'est un enjeu de taille pour nous. L'autre point qui est important, c'est comment est-ce qu'on arrive à convaincre un petit peu nos stakeholders, les CPO, les CTO, les CEO, à travailler et à investir dans la recommandation. Le premier point que je trouve très intéressant, c'est qu'en fait, c'est... De l'optimisation sur de l'existant. On va générer de la valeur incrémentale, soit de l'audience, soit des revenus, soit les deux si on a de la chance. Et donc ça limite nos besoins d'acquisition. Et quand on sait combien c'est difficile d'acquérir des nouveaux utilisateurs, de faire venir des gens sur nos sites ou sur nos applications, C'est très important de travailler sur l'incrémental.
L'autre élément que je mentionne assez souvent pour recommander le travail sur la recommandation, c'est la simplicité produit. En effet, quand on travaille sur avoir de meilleures recommandations, on n'est pas obligé d'ajouter des fonctionnalités, on n'est pas obligé d'ajouter des boutons dans le parcours utilisateur, ce qui en fait simplifie énormément le produit et diminue la charge cognitive qu'on impose aux utilisateurs. Et étant donné que nos temps d'attention sont de plus en plus limités, limiter la charge cognitive qu'on a. On impose aux utilisateurs. C'est vraiment une valeur ajoutée importante pour un produit. L'autre point que j'aimerais mentionner, c'est, et ça vous allez pouvoir le voir peut-être chez moi ou chez des ingénieurs qui travaillent en fait sur les recommandations de vidéos, c'est quelque chose qui fait quand même briller les yeux des ingénieurs parce qu'en fait c'est un sujet de choix. C'est en particulier un sujet unique dans le machine learning parce que c'est le sujet dans lequel on a un contact direct avec les utilisateurs.
Les algorithmes montrent des vidéos, l'utilisateur choisit ou pas de les regarder, via en cliquant, en visionnant, en likant, en faisant ce qu'on veut. Et ça crée une boucle de feedback immédiate. Donc le contact direct avec l'utilisateur plus la boucle de feedback immédiate, ça en crée un sujet vraiment de choix, très exposé, mais en même temps très intéressant et très stimulant intellectuellement, qui permet souvent de faire en sorte que les équipes soient très motivées à travailler dessus. Les autres points qui sont importants, c'est un peu en lien avec l'échelle de Dailymotion, c'est que la compréhension du contenu vidéo et la compréhension de nos 390 millions d'utilisateurs, c'est un sujet complexe en tant que tel. Et donc ça, c'est déjà intéressant pour les gens qui travaillent dessus. L'autre point qui est un peu plus détaillé, c'est un point paradigme d'expérimentation. Je vais rentrer un petit peu dans le détail. C'est ce que j'appelle, c'est ce que l'industrie appelle offline versus online.
Pour vous donner du détail, on appelle online un algorithme qui vit, qui est en production et qui reçoit du feedback instantané des utilisateurs. Offline, c'est quand on, pour par exemple créer un nouvel algorithme, essayer une nouvelle chose, on va d'abord simuler ces données, ces algorithmes, ces nouveaux algorithmes, sur des données historiques, un peu dans notre laboratoire, et on appelle ça offline. Et en fait, il y a un paradigme très intéressant où... Quand je vais passer de l'offline à l'online, il peut se passer plein de choses désagréables. On peut avoir un algorithme qui performe extrêmement bien dans nos laboratoires. Et une fois qu'on le passe face à la vindicte des utilisateurs, on se retrouve avec un modèle qui peut avoir des performances vraiment très basses. C'est unique parce que par exemple, si j'ai plutôt un use case de catégorisation de vidéos, où je dois prédire si une vidéo parle de chat ou pas, en fait l'interaction avec les utilisateurs ne va pas très peu impacter la qualité de la prédiction.
Alors qu'ici, la qualité de la prédiction est tout de suite impactée par le feedback direct de l'utilisateur. Et c'est pour ça que le paradigme offline versus online est très important et un vecteur de vélocité très important pour les équipes. Le dernier point, et c'est plus un point de détail, je vais passer assez rapidement dessus, c'est le côté spécifique au monde de l'entreprise des algorithmes de recommandation. En effet, c'est très difficile d'avoir des bases de données de recommandations vivantes, qui sont face aux utilisateurs, dans le monde académique, parce que ces données n'existent que chez les groupes digitaux. Et donc, pour les nouveaux ingénieurs, c'est un sujet de choix, parce que ce n'est pas quelque chose qu'ils ont vu dans le passé. Donc ça, c'est toujours intéressant pour les nouveaux ingénieurs. Maintenant qu'on a vu un petit peu pourquoi cette recommandation était un sujet passionnant, je veux aborder un petit peu les enjeux de la recommandation sous différents prismes, en particulier le prisme sociétal qu'on va voir un petit peu plus tard.
Donc la première chose qu'on regarde quand on regarde un algorithme de recommandation de vidéo, c'est comment est-ce que l'utilisateur interagit avec. Et pour comprendre un petit peu les attentes des utilisateurs, ce qu'on fait souvent, c'est qu'on va les voir directement. On fait partie de focus group, de panel. Et récemment, en début d'année, on est allé voir des générations assez jeunes, des 18-24 ans. Et on les a regardés un petit peu en train d'utiliser Dailymotion, en train d'utiliser d'autres applications. Et on a vu un petit peu comment est-ce qu'ils réagissaient. Et il y a trois gros points qui ont émergé de ça et qui, personnellement, m'ont frappé. C'est qu'ils attendent une pertinence immédiate. S'il y a deux recommandations qui ne sont pas pertinentes, on perd l'engagement et on perd toute considération du produit. C'est important. Le deuxième point qui m'a personnellement frappé, c'est... Que cette génération comprend extrêmement bien de façon intuitive comment les algorithmes de recommandation fonctionnent. Et ils attendent de ça que ça leur fasse un peu explorer et ils attendent de la qualité.
Par exemple, si j'ai cliqué sur une vidéo de chat, je n'ai pas envie d'être recommandé des vidéos de chat toute ma vie. ce qu'on appelle de la sérendipité et de l'exploration dans le monde de la recommandation. Et dernière chose qui est en lien avec leur compréhension des algorithmes, c'est qu'ils attendent une forme de transparence, de encore mieux comprendre comment les algorithmes fonctionnent, en particulier ceux qui créent du contenu et qui veulent comprendre comment leur contenu va être mis en avant par les différents algorithmes de recommandation. Donc comme je le disais en préambule, Comme les algorithmes de recommandation commencent à prendre beaucoup de place dans nos vies, dans nos sociétés, Il y a des risques systémiques qui ont été mis en avant par différents organismes, en particulier les bulles de filtres, qu'on appelle, qui fait que les utilisateurs ne sont soumis qu'à leurs propres opinions et ne sont jamais soumis à des opinions un petit peu différentes.
Il y a aussi des risques de reproduire des biais systémiques qui sont présents dans les données et que l'algorithme va retranscrire dans les recommandations. Et pour ça, la société a commencé un petit peu à s'organiser, et en particulier en Europe, où il y a une nouvelle régulation qu'on appelle le Digital Service Act, qui va rentrer en œuvre début d'année prochaine pour les plus grosses plateformes, et qui demande plusieurs choses aux plateformes. La première chose, c'est la transparence pour les utilisateurs. Les plateformes sont censées beaucoup mieux expliquer aux utilisateurs comment est-ce que leurs données sont utilisées pour leur recommander des vidéos. Ou d'autres choses d'ailleurs. L'autre choix, l'autre demande de cette régulation, c'est que les plateformes sont censées offrir aux utilisateurs des recommandations non personnalisées. Donc ça c'est un prolongement un petit peu de GDPR. Et la dernière chose, et ça c'est une des choses que moi je trouve le plus intéressante, c'est les plateformes sont censées mesurer l'impact de leurs algorithmes sur les risques systémiques et potentiellement avoir des mesures pour réduire ces impacts systémiques.
Donc on verra en fait comment est-ce que ça se traduit dans les faits, mais ce qu'on attend en particulier, c'est beaucoup plus de collaboration entre les chercheurs du monde académique qui travaillent sur ces sujets-là, donc des sociologues en particulier, et le monde de l'entreprise et les grandes plateformes. Dernière chose qui est importante, bien sûr, et qui est un peu le pendant du fait que ces sujets-là ont beaucoup d'attrait récemment, c'est que la complexité technique a explosé. Tout simplement, on est passé à des techniques assez simples, on va dire, il y a une dizaine d'années, pour créer des modèles de recommandation, à des choses extrêmement complexes, donc utilisant du deep learning avec des modèles à l'état de l'art. C'est d'ailleurs un sujet de recherche très intense parce qu'il y a des dizaines de papiers qui sont publiés toutes les semaines sur la recommandation en particulier et qui repoussent encore plus l'état de l'art. Et bien sûr, ces deux phénomènes augmentent aussi les coûts pour les entreprises parce qu'il y a des coûts.
Plus le modèle, plus les données sont importantes, plus les coûts d'entraînement des modèles, de GPU, de compute sont importants. Et ça crée aussi potentiellement des coûts opérationnels. Moi, j'ai une petite anecdote sur, par exemple, c'était, je pense, il y a quelques mois, où on a eu une baisse de performance d'un algorithme de recommandation, d'un certain algorithme. Et donc, je suis allé voir l'équipe pour leur demander qu'est-ce qui s'était passé, qu'est-ce qui se passe, comment est-ce qu'on peut résoudre le problème. Et donc ils m'ont répondu, après une petite réflexion, que c'était probablement lié à un biais dans la façon dont on calculait la fonction de perte de recommandeur et qui s'auto-entretenait dans le temps et qui polluait les recommandations. Je me suis dit que c'était potentiellement un peu... compliqué à résoudre et en fait une heure plus tard on a appris que la base de données qui alimentait l'algorithme en fait était juste HS et c'est ça qui créait le problème. Donc ce que je veux dire c'est que ça crée une complexité opérationnelle parce que vu que le problème est complexe de base on a tendance à penser que les problèmes et les solutions sont aussi complexes alors que c'est pas tout le temps le cas.
Dernier point, parce que je veux aussi passer du temps sur les solutions qu'on met en place chez Dailymotion. Je voulais juste insister, j'ai déjà parlé de la taille de nos données, de la diversité de nos use cases, etc. Il y a un point important, je pense qu'il est important à partager, c'est la taille de nos équipes. Donc aujourd'hui, on a une quinzaine. Une grosse quinzaine de personnes qui travaillent à plein temps sur la recommandation, entre des machine learning engineers, des data engineers, des product managers, des devops, des data analysts. Ce qui, en même temps, nous permet de travailler sur différents cas d'usage en même temps, mais aussi d'avoir une taille humaine. à l'équipe. Donc quels sont les investissements qu'on a fait pour adresser un petit peu tous ces enjeux à la fois des utilisateurs et de la société? Je vais commencer par quelque chose qui me tient particulièrement à cœur, c'est le lien fort qu'on doit créer entre l'expérience utilisateur et les algorithmes de machine learning.
Et en particulier, pour augmenter la performance et la pertinence des algorithmes de recommandation, il faut un alignement entre les métriques d'optimisation et la façon dont on les met en avant dans l'intention du design. Je précise, vous voyez TikTok, Donc c'est facile, quand on est sur le home feed, il y a des vidéos, on défile. Le but de l'algorithme, c'est de faire en sorte que les utilisateurs restent sur le home feed. C'est assez simple, une fonction d'objectif assez simple. Sur Netflix par exemple, On a une home qui est un catalogue et on doit choisir un petit peu la vidéo qu'on veut regarder et qu'on va regarder sur une autre page. On va la visionner sur une autre page. Et donc l'objectif de l'algorithme dans ce cas-là, c'est de faire en sorte de convertir l'utilisateur du home feed à une autre page. Et ça forcément, si par exemple on met l'algorithme de TikTok sur la page de Netflix, ou vice versa, ça ne va pas marcher du tout. Et donc ça c'est quelque chose qu'on met en place depuis peu chez Dailymotion, où on fait en sorte d'avoir en tête vraiment ces contraintes, et en particulier...
On a récemment refait le home feed pour justement essayer d'inciter les gens à rester sur le home feed. Et on a accompagné le changement de design vers des cartes plus verticales avec justement une optimisation des algorithmes vers l'objectif de garder les gens sur le home feed. Le deuxième point qui est important et qui n'est pas du tout en détail, c'est faire en sorte que le signal soit le plus débruté possible quand on le collecte. Dans le détail, je reprends l'exemple de TikTok. Le feedback que l'algorithme reçoit est très simple. La personne a regardé ou pas, il a scrollé ou pas après quelques secondes. Ça, ça permet d'avoir un choix binaire, oui ou non, sur le fait que l'utilisateur a aimé ou pas la vidéo. Je prends par exemple l'autre exemple des applications de rencontre, c'est pareil, oui ou non, et ça aide énormément l'algorithme à prendre de meilleures décisions dans le futur. Nous, on a implémenté ça à notre façon, en particulier sur le lecteur qui est disponible sur les sites de nos publishers, en limitant par exemple le nombre de choix qu'on donnait aux utilisateurs quand la vidéo d'entrée était terminée.
Donc quand on a l'écran de fin, on n'a plus que deux choix versus quatre, cinq, ce qui pourrait augmenter le CTR, mais à terme perturber les performances de l'algorithme. Et au-delà de ça, on a des discussions au préalable dans toute nouvelle fonctionnalité pour bien aligner le design, le signal. Et l'algorithme. Deuxième chose qui est très importante pour nous, souvent on dit qu'on ne peut pas améliorer quelque chose qu'on ne mesure pas ou qu'on mesure mal. Donc on arrive en fait à la qualité des données, à la qualité de notre monitoring. Mais c'est quelque chose qu'on met particulièrement en place pour la recommandation. Pourquoi? Parce qu'il y a un risque quand il y a un bug silencieux dans la reco, que les données polluent le modèle au fur et à mesure avec la boucle de feedback. Et que si on a un problème pendant un jour, on va mettre une semaine, voire deux semaines à récupérer la performance qu'on aurait eue s'il n'y avait pas eu le bug.
D'où une demande qu'on fait aux ingénieurs d'avoir des métriques extrêmement sensibles sur la recommandation. C'est-à-dire qu'en fait, si j'ai un petit bug, je veux que la métrique s'effondre. Si je fais un changement positif, je veux que la métrique explose. C'est plus facile à dire qu'à faire, mais on met beaucoup d'investissement à affiner nos métriques pour qu'elles soient le plus sensibles possible. Ce qui va avec un petit peu, c'est de faire en sorte de se construire une intuition sur le retour qualitatif de l'algorithme. Je veux savoir est-ce que cet algorithme que l'utilisateur voit, il est un petit peu pollué. Et pour ça, on a mis en place un système de tracking qui permet aux ingénieurs et à tout le monde de voir quel algorithme spécifique est servi à quel utilisateur. à quel moment, en live, en fait, en testant le produit. Donc ça, c'est très important. Et le dernier point que je voulais mentionner, c'est la connaissance des biais qui sera utile sur la partie sociétale de mon propos, qui est qu'aujourd'hui, avec nos années d'expérience,
on sait que, par exemple, quand on optimise pour les clics ou les vues, on va faire ressortir beaucoup de vidéos qui vont être courtes potentiellement, avec des titres ou des thumbnails qui vont être courts. soit un petit peu racoleuse. Alors que quand on utilise le watch time, par exemple, le temps de visionnage de la vidéo, ça va lisser beaucoup plus ce type de biais. Donc ça, c'est quelque chose qu'on met beaucoup en place et sur lequel on insiste énormément. Maintenant, j'aimerais aborder un petit peu la partie technique de la recommandation et quels sont les systèmes techniques qu'on met en place pour résoudre certains problèmes. Et avant que je fasse ça, il faut que je prenne un peu de recul et je vous explique un petit peu qu'est-ce qu'un système de recommandation. Donc assez simplement, en fait... La tâche d'un système de recommandation, c'est à partir d'une liste, d'order d'une liste et de la montrer en partie à un utilisateur. C'est ça, c'est facile quand on a une petite liste, quand la fonction d'optimisation est assez simple.
Mais plus on a d'éléments dans la liste, plus on a d'utilisateurs, plus on a une fonction d'objectif qui est compliquée, plus scorer chaque élément de la liste devient compliqué. Pour des problèmes de performance, pour des problèmes de pertinence. Et donc, dans l'industrie, il y a eu un shift il y a quelques années pour en fait décomposer les différentes étapes de cette optimisation. Maintenant, ce qui est fait principalement, c'est qu'il y a une première étape qui est, au lieu d'avoir des millions de candidats, j'ai un système très rapide qui permet de réduire le problème à une centaine ou des milliers de candidats. C'est quelque chose qui peut prendre, donne-moi les mille vidéos qui sont les plus proches de ma vidéo d'entrée, et ça réduit déjà le problème à des millions, jusqu'à une centaine ou des milliers. Et ensuite, d'avoir un modèle, donc une deuxième étape, qui est beaucoup plus, on va dire, complexe de scoring, où en fait, là, on va prendre des données utilisateurs, on va fine-tuner le modèle et avoir un scoring qui est extrêmement précis
pour montrer vraiment les meilleurs éléments au final à l'utilisateur. Donc ça, ça a été un petit peu théorisé par YouTube, avec un papier en 2007, ça fait déjà un petit temps, et ça a été remis en fait... pas remis, mais contextualisé et conceptualisé par Nvidia avec deux étapes en plus via un framework qui s'appelle Merlin, qui est sorti en 2022. Et pour revenir vers ça, j'ai quatre étapes. Rétribal, c'est l'étape où je pars de millions de candidats et je réduis à une centaine des milliers de candidats. Ensuite, j'ai une étape de filtering où je vais mettre une logique métier, par exemple enlever les vidéos qui sont géobloquées dans certains pays. J'ai ensuite la partie scoring dont je viens de vous parler, qui est un modèle très fine-tuné en fonction de l'utilisateur, en fonction du contexte, en fonction de la fonction d'optimisation. Et final, une étape d'ordering qui permet de mettre en place une diversité, de mixer certains inputs en fonction de différentes variables d'optimisation.
Et ensuite, pourquoi on utilise ce framework un petit peu chez Dailymotion? C'est parce que ce concept permet d'ouvrir plein de perspectives produits et de pouvoir traiter plein de sujets derrière. Je prends l'exemple par exemple de la personnalisation. J'ai en fait deux endroits où je peux l'ajouter. Une partie retrieval, par exemple, où je peux rajouter dans les candidats des vidéos de chaînes qui ont déjà été visionnées par l'utilisateur. Et ensuite, je peux mettre de la personnalisation dans le centre. au moment où je vais rajouter par exemple les dernières vidéos vues par l'utilisateur, l'endroit du site dans lequel il est, etc. Pour rajouter de la personnalisation. Et ça c'est vrai pour énormément de cas d'usage produits. Donc je ne vais pas tous les faire parce qu'il y en a vraiment beaucoup. Je vais juste défiler un petit peu la liste. Et en particulier pour des sujets de transparence, qui nous intéressent particulièrement pour des sujets sociétaux, ça permet en fait le tout de savoir d'où viennent nos candidats à partir du retrieval, de savoir quelle fonction d'optimisation a été utilisée dans la partie scoring et savoir en fait quelle...
Partie en fait quelle diversité j'ai mis sur la partie ordering donc ça c'est très intéressant d'un point de vue conceptuel et ça nous permet en fait de prioriser énormément de sujets d'un point de vue produit en collaboration avec les équipes techniques et je vais finir rapidement avec Ah, tranquille. OK. C'est un faux compteur, alors. Ça marche très bien. Et je vais finir donc pas rapidement avec l'organisation qu'on a mis en place. Ok, très bien. On a mis en place pour essayer d'adresser ces enjeux. En particulier, on a mis une équipe dédiée data produit qui contient des data product managers dont le rôle est vraiment de faire le lien entre les équipes techniques et les équipes produits pour faire en sorte que nos modèles soient le mieux possible intégrés dans les produits finaux. Et avec des machine learning engineers qui travaillent aussi dans cette équipe, des gens qui font de l'analyse de données.
Et on a gardé par contre une proximité très forte entre les machine learning engineers et les data engineers, avec une roadmap commune qui permet à la fois de mettre en parcimonie les investissements techniques de fondation avec des éléments produits plus court-termistes. Et finalement, ce qui est le plus important, c'est sur quoi je veux finir, c'est la diversité de profils qu'on a réussi à constituer chez Dailymotion avec des talents d'âges très différents, de genres différents, et même un chercheur en sociologie qui travaille avec nous pour mieux comprendre les biais liés à la conception des algorithmes. Donc ça, c'est quelque chose qu'on met beaucoup en avant. Et il y a beaucoup de choses qu'on fait aussi et sur lesquelles je n'ai pas eu beaucoup de temps pour discuter, en particulier sur la partie Digital Service Act. Mais il faut savoir que c'est un sujet passionnant qui évolue beaucoup.
Ravi de prendre vos questions maintenant. Ça marche plus? Ça marche plus le micro? On s'assoit? Qu'est-ce que t'en penses? Moi j'adore ce canapé, pour les questions-réponses. Ouais il est beau, et puis c'est des conforts, c'est chouette. Merci beaucoup, Cyrille. Et tu sais quoi? Ça m'a fait plaisir. Écoute, nous aussi, beaucoup. On a appris beaucoup. En tout cas, moi, j'ai appris beaucoup de choses. Et surtout, je voulais te dire que j'ai une question de Tristan. Ah oui, bien sûr, on lui a mis un petit défi, donc il nous a envoyé une question qui est la suivante. Après, on prendra évidemment celle dans la salle. Dans la pratique, c'est quoi ta recommandation pour qu'une startup se lance dans la recommandation, justement? Recruter des spécialistes ou utiliser une solution sur l'étagère? Alors c'est une bonne question. C'est une question de Tristan. Personnellement, moi je ne me suis pas forcément posé, parce qu'en fait c'est notre cœur de métier, la recommandation.
Donc en fait, on n'a pas vraiment le choix. Par contre, ce que je soulignerais, c'est qu'il y a plein d'étapes intermédiaires entre utiliser une solution sur l'étagère et des spécialistes qui ne font que ça toute la journée avec des équipes de 15 personnes. Il y a des modèles qui existent, qui sont pré-entraînés, qui permettent de réduire le temps de développement, qui sont développés, qui sont... open source en fait, et qui je pense que n'importe quelle startup peut utiliser. Donc désolé si je ne réponds pas exactement à la question, mais ce qui est important à comprendre, c'est que si c'est le cœur de métier, c'est important d'investir. Si ce n'est pas le cœur de métier, il y a aussi plein d'intermédiaires avant de décider une solution du marché. Ok, merci beaucoup. Est-ce que nous avons des questions dans la salle, s'il vous plaît? Des mains qui se lèvent. Ah, une main. Comment ça va? Ça va bien? Non, non, on attend le micro qui ne saurait tarder.
On a encore un sosie de Nicolas Silberman qui va t'apporter tout de suite le micro. Merci beaucoup. Merci beaucoup pour cette conf, elle était vraiment excellente. Je ne sais pas qui l'a sélectionnée, elle est vraiment bien. J'ai deux questions. Tu parlais d'indicateurs qu'il faut qu'ils soient très sensibles, donc il faut qu'ils explosent quand ça va bien. Est-ce que tu peux nous donner un petit exemple? Parce que je trouve ça vraiment intéressant. Et la deuxième question, c'était, est-ce que tu penses que cette réglementation européenne peut faire un différenciant fort pour une solution comme Dailymotion par rapport à d'autres concurrents américains à tout hasard? Avec un Y et un T. Merci beaucoup. Deux excellentes questions. La première, si je peux donner quelques exemples. Ça va dépendre de ce qu'on veut optimiser. Mais par exemple, si je veux optimiser pour le CTR, le click-through rate, est-ce que les gens vont cliquer sur mes vidéos quand je leur recommande?
Ce que je recommande, c'est d'utiliser un CTR, mais spécifique à certains cas d'usage qui sont extrêmement spécifiques. Par exemple, après certaines vidéos, d'essayer de structurer le problème pour l'avoir le plus sensible possible. Donc nous, typiquement, Le CTR sur certaines vidéos, ça va être des excellents indicateurs, ou des CTR sur certains types de comportements, des excellents indicateurs de savoir si le modèle fonctionne bien ou ne fonctionne pas. Et la deuxième question sur le Digital Service Act. Nous, on pense que c'est un différenciant très important parce que dans nos applications et sur le site web, et dans la façon dont aujourd'hui on crée les algorithmes, on a une taille humaine qui permet de mettre en place les valeurs qui sont portées par le DSA, donc de transparence, etc., directement dans le produit, sans trop...
Heurter nos performances, nos métriques, etc. Versus d'autres plateformes qui sont peut-être un peu trop prises dans cet engagement et ce besoin de création de l'audience pour pouvoir mettre plus de transparence et mieux communiquer avec leurs utilisateurs. J'ai une question de Lénie, aussi en remote. Comme tu l'as expliqué, la recommandation induit un biais qui enferme l'utilisateur dans sa bulle. Le documentaire, l'excellent documentaire, The Social Dilemma, a mis en lumière ce problème auprès du grand public. Comment adressez-vous l'exploration dans ce processus de recommandation? C'est aussi une excellente question. Dans un des slides, il y avait en effet, quand on voit l'architecture, un endroit où je parle un petit peu d'exploration, qui est en fait la façon dont génèrent les candidats qui vont être propices pour un utilisateur donné. Et on peut imaginer, pour optimiser les performances idéalement, on ne fait que prendre des candidats qui sont proches de ce que l'utilisateur aime bien.
Mais on peut complètement imaginer, et nous on le fait déjà un petit peu, prendre par exemple des... C'est l'effet Tommy. Sur un petit, oui. Non, pas que tu n'as pas de potentiel comique, pas du tout. Très bon. J'ai perdu ce que je voulais dire. C'est l'effet Tommy. C'est l'effet Tommy. Non, ce que je vais dire, on peut très bien, en fait, dans la phase d'exploration, mettre à l'intérieur des vidéos candidates quelque chose qui est beaucoup plus, on va dire, stable et pas forcément lié directement aux intérêts de l'utilisateur. L'autre façon de le faire, c'est dans la dernière partie de l'architecture que j'ai montré un petit peu, c'est sur la partie ordering à la fin, où en fait j'ai finalement, allez, sans vidéos qui vont parler d'un sujet qui est lié à la vidéo d'entrée, ce que je peux faire, c'est réordonner ces vidéos pour rajouter de la diversité, pour faire en sorte qu'à la fin, j'ai plusieurs opinions sur le même sujet qui soient représentées dans ma recommandation finale. Donc forcément, il ne faut pas se leurrer non plus, ça c'est un impact sur l'engagement.
C'est-à-dire qu'on va contre ce que veut vraiment l'utilisateur, Et donc, il faut être capable d'aller un petit peu sur certains use cases, en fait, contre notre volonté d'optimiser à tout prix l'engagement et donc de pouvoir proposer des choses plus diverses. Et qui n'enferme pas justement dans la bulle la polarisation après de l'opinion. Une autre question dans la salle pour Cyrille? On a encore trois petites minutes, si vous le voulez. Non, pas de frustration? Ok. Merci infiniment, Cyrille. Merci à vous. C'est excellent. Bravo. Il y a des fans, hein? Il y a des fans, il y a des fans. T'es venue avec la famille, hein? C'est bien.
