Meetup Tech.Rocks

Passer de l'AI au Générative AI

Meetup Tech.Rocks · 14 novembre 2023 · 63 min · en français

Résumé

Replay d'un meetup Tech.Rocks en présentiel, organisé avec le soutien de Google Cloud, consacré au passage de l'IA à l'IA générative. Des intervenants de Criteo, Google Cloud et MWM y partagent leurs retours d'expérience.

Summary

Replay of an in-person Tech.Rocks meetup, held with the support of Google Cloud, on moving from AI to generative AI. Speakers from Criteo, Google Cloud and MWM share their experience.

Thèmes : IA

Transcript complet

Transcription automatique, à relire : les noms propres peuvent être mal orthographiés.

Moi, c'est Farid, je travaille en tant que spécialiste machine learning chez Google Cloud et je suis accompagné de Mathilde. Et on va vous parler de notre trajectoire à trajectoire de Google sur le sujet de l'IA en 20 minutes. Et surtout, on va vous donner un peu quelques détails sur notre dernier modèle de langage, Palm, comment on a fait pour l'entraîner, qu'est-ce qu'il apporte. Et c'est vraiment le leitmotiv de ce talk. C'est de votre sens? C'est l'effet des mots. C'est encore nous? Voilà. C'est parti. Donc, une introduction sur le parcours de Google en ce qui concerne l'intelligence artificielle, le machine learning. Comme je disais tout à l'heure, entraîner un réseau de neurones aussi titanesque qu'est Palm requiert pas mal de prérequis, on va revenir dessus. Quels sont les insights à tirer de notre dernier modèle de langage, Palm? Et ensuite, comment tout ça se retrouve dans les produits, notamment dans les produits entreprises?

C'est bien ce bouton, Mathilde, que je ne me rate pas. Le gros. Parfait. Alors, vous n'êtes pas sans savoir que le machine learning, l'IA, infuse vraiment les applications de Google. Vous avez tous manipulé, que ce soit la recommandation dans YouTube, que ce soit... soit la complétion automatique de vos phrases dans Gmail, la catégorisation des photos dans Google Photos. Avec un changement de paradigme dans les applicatifs, la dernière en particulier qui s'appelle Bard, qui est notre dernier chatbot, dans le sens où on avait une intégration du machine learning dans les applications qui était plutôt transparente, c'est-à-dire l'IA vient suggérer, l'IA vient recommander, mais en termes d'usage, il n'y a pas d'interaction directe avec un modèle. Le changement de paradigme qu'il y a eu avec l'avènement de ces gros modèles de langage conversationnel, puis même un petit peu avant aussi au niveau recherche sur la capacité à générer de l'image, c'est qu'il y a une interaction directe avec le modèle. L'utilisateur sait qu'il interagit avec une IA, l'IA lui génère du contenu. Et de ce point de vue-là, c'est différent d'une intégration plutôt, comment dire en anglais, seamless du machine learning dans les applicatifs de Google.

Pardon, c'est le gros bouton, tu m'as dit Mathilde. Et donc, la trajectoire de Google sur le machine learning commence en 2001. Et en fait, en préparant ce talk, moi je découvre qu'en fait, le premier modèle de ML que Google met à disposition de ses clients via le search, c'est un modèle qui vient faire de la correction d'erreurs orthographiques. Alors, les praticiens du NLP aujourd'hui me diront qu'on le ferait autrement que par du machine learning probablement aujourd'hui. Néanmoins... C'est moi qui fais le bruit? C'est flippant. Néanmoins, premier modèle en 2001 qu'on intègre dans notre barre de search pour corriger les... les erreurs d'écriture. Alors, on a illustré ici avec Mathilde quelques éléments, quelques étapes qu'on a trouvées intéressantes. Il y en aurait beaucoup plus en réalité. Quand on se penche franchement sur la littérature que produisent les chercheurs de Google sur le machine learning, c'est dense. Il faudrait additionner, en termes de publication, il faudrait additionner Stanford et le MIT pour produire plus de filtres de recherche que Google sur le domaine. Donc c'est hyper dense. Et donc quelques papiers qui sont fondateurs, il y en a un qui nous a assez intéressé avec Mathilde en préparant, c'est en 2012, un papier qu'on appelle le CATS paper, où en fait on va entraîner un très gros réseau de neurones.

Ludovic va définir peut-être plus précisément la notion tout à l'heure, mais les réseaux de neurones sont une capacité à créer des fonctions mathématiquement parlant qui vont venir nous permettre de prédire, de catégoriser. Et puis, il y a ce papier, le CATS paper, où est-ce qu'on crée un très gros réseau de neurones pour l'époque. Aujourd'hui, il serait ridicule. Où est-ce qu'on va réussir sans labelliser la donnée? Vous savez, quand vous créez un algorithme, puis à venir vous discriminer des photos, vous êtes obligé de labelliser le dataset en disant ça ce sont des photos de chat, ça ce sont des photos de chien et puis maintenant je vais t'entraîner à distinguer. Ici on part sur une approche non supervisée, à savoir sans label et on découvre en fait en donnant énormément d'images à ce réseau de neurones qu'il arrive sans label à vraiment reconnaître le chat de l'humain avec une précision qui est à un niveau sans précédent. Dans le domaine... du texte en 2013, en fait on continue sur cette vague des réseaux de neurones chez Google et en fait on a besoin de représenter le texte sous une forme d'un vecteur mathématiquement parlant et donc il y avait

différentes stratégies pour ce faire, les réseaux de neurones y participent également mais en 2013 avec des réseaux de neurones particuliers, une architecture particulière d'algorithmes, Word2Vec, on parvient à avoir une représentation mathématiques des mots, des termes, des tokens, avec une précision assez incroyable. En 2017, je pense que vous l'avez assez entendu, arrive un papier qui s'appelle « Attaching is all you need ». Ces modèles de langage, ce sont des modèles qui traitent la donnée en séquence, pareillement à des séries temporelles ou à du son. Et dans une séquence, dans une phrase, la difficulté, quelque part, c'est de réussir à obtenir une espèce de pondération entre les mots, pour réussir à retranscrire le plus fidèlement possible la phrase ou la modéliser le plus fidèlement possible. Et donc, on sort ce papier fondateur, qui aujourd'hui, je crois, est l'article de recherche en machine learning le plus cité, et qui va opérer un shift quelque part, ou en tout cas qui va être fondateur pour toutes les architectures de réseaux de neurones, de langage et même de vision et autres, et qui s'appelle les transformers.

Suite à ça, on sort un gros modèle de langage qui s'appelle BERT, le premier, qui lui est non génératif, donc non génératif au sens où il ne génère pas de la donnée. Et BERT, on a beaucoup parlé cette année de l'intégration des LLM dans le search. En fait, en 2018-2019, on intègre BERT dans le search pour avoir une compréhension sémantique plus fine des queries des utilisateurs. Donc en 2001, on est sur la correction orthographique. En 2018, on est sur la compréhension sémantique fine de ce que demande un utilisateur. Et si vous regardez sur YouTube, vous trouvez des vidéos où est-ce qu'on vous explique l'amélioration qu'il y a eu sur le search suite à l'intégration de BERT pour la compréhension des queries des utilisateurs. Bon, ensuite... Il y a, j'ai envie de dire, une escalade ou en tout cas une surenchère sur la taille de ces mots. de langage. En 2021, on sort un modèle qui s'appelle Lambda, où est-ce qu'on teste beaucoup en interne ce modèle, justement pour des expériences de chatbot, comme on a aujourd'hui. Et donc, ça reste à l'étape du projet en interne. Puis, 2022 arrive Palm, dont on va parler aujourd'hui dans cette présentation, avec les enjeux les difficultés qu'il y a à entraîner un modèle titanesque qui est composé de 540 milliards de paramètres.

Ces réseaux de neurones, mathématiquement, sont des fonctions qui contiennent dans leur sein énormément de paramètres. Et la version la plus grosse de Palm en contient 540 milliards. C'est titanesque. Et donc, entraîner un modèle comme ça, il faut faire preuve d'ingéniosité et avoir une infrastructure scalable. Et Mathilde va le détailler. Enfin, en 2023, arrive Palm 2. Qui est une version améliorée de la première version de Palm. Et donc, ce que je disais tout à l'heure, effectivement, ici, c'est pour faire la transition avec ce que va vous présenter Mathilde. Ces modèles de langage ont dit qu'ils bénéficient de capacités émergentes, à savoir que plus ils sont gros, plus ils sont, entre guillemets, généralistes, plus ils sont capables d'effectuer des tâches. Diverses sur lesquelles à la base on ne pensait même pas qu'ils seraient pertinents dessus. Et puis du coup pour entraîner ce modèle à 540 milliards de paramètres, on met en place une infrastructure et une architecture dédiée qui s'appelle Pathways et que Mathilde va vous détailler. Merci Farid.

Du coup, deuxième partie de cette présentation, l'idée, c'est de vous donner des insights sur comment on a entraîné ces larges language models chez Google. Et le premier élément de la secret sauce, c'est l'infrastructure. Farid, vous parlez de l'escalade sur la taille des modèles qui a eu lieu depuis les années 2020-2021 avec l'ONDA. Voilà, on y est. C'est de l'innovation sur l'infrastructure qu'on est capable de mettre pour entraîner ces larges modèles. C'est titanesque. Et pour Palm, on s'est servi de 6144, un microprocesseur TPU version 4. Alors un petit point de vocabulaire, qu'est-ce que c'est qu'une TPU V4? C'est un microprocesseur qui a été conçu maison par Google, spécifiquement pour le deep learning depuis 2015, et qui sont ultra performantes. On s'est servi de deux pods de ces TPU V4. Un pod, c'est un ensemble de ces microprocesseurs qui sont reliés par un réseau qui est ultra rapide. Donc voilà, l'architecture, elle est colossale. Je me suis amusée hier soir à faire le calcul de combien ça coûterait sur un prix on-demand public.

Ça fait un peu plus de 15 millions de dollars pour l'entraînement. Donc on est sur quelque chose d'assez titanesque. Un passage à l'échelle pour entraîner des larges modèles comme ça, ça ne vient pas sans ces challenges, évidemment. Et le plus gros challenge qu'on a eu pour l'entraînement de Palm réside au niveau de la rapidité du réseau. Parce qu'en connectant deux pods de TPU, on passe par le réseau privé de Google à travers nos data centers. Et c'est un réseau qui est moins performant que le réseau qui se trouve entre deux. Et donc pour survenir à ce challenge, notamment au niveau de la rapidité du réseau, parce qu'il y en a d'autres, le challenge sur la mémoire d'un microprocesseur, le challenge sur la rapidité du microprocesseur en lui-même, mais là le bottleneck était vraiment au niveau du réseau. On a mis en place des techniques de parallélisme. Alors il y en a eu plusieurs, je ne rentrerai pas dans les détails, mais la plus importante et qui nous a permis de résoudre ce challenge au niveau du réseau, c'est le parallélisme au niveau de la donnée. Avec du parallélisme au niveau de la donnée, On a permis de réduire la quantité de données de communication entre les deux pods.

Pourquoi? Parce qu'à chaque étape de l'entraînement, on a divisé en deux le jeu de données d'entraînement. On a donné la moitié au pod numéro 1, on a donné la moitié au pod numéro 2. Les deux pods ont fait leur calcul sur les paramètres, les poids, la descente de gradient. Je ne rentre pas trop dans les détails techniques, mais de manière indépendante. Et on a développé notre propre mécanisme en interne pour mettre en commun ces paramètres à travers les deux pods, pour permettre aux deux pods de s'aligner pour la prochaine étape d'entraînement. Et donc ça, ça a permis de résoudre en partie ce problème de réseau, d'accélérer l'entraînement du modèle et d'avoir des modèles plus gros. J'ai oublié que j'avais... Le deuxième élément de la secret sauce sur l'entraînement de Palme, il réside dans la manière dont on a géré programmatiquement l'entraînement. Vous n'êtes pas sans savoir que pour entraîner, en fait, ce qu'on fait pendant un entraînement, c'est qu'on apprend au modèle à moins se tromper. Ça, ça se concrétise par la minimisation d'une fonction mathématique qui représente l'erreur du modèle.

Donc là, sur le graphique ici, vous avez l'erreur du modèle au cours du temps, c'est-à-dire au cours de l'entraînement. Donc, plus l'erreur est faible, moins le modèle se trompe et plus on est content. Sauf que, ça serait trop facile, l'apprentissage du modèle, il n'est pas lisse. Et en fait, on constate des anomalies. C'est les pics que vous voyez ici sur l'erreur que fait le modèle au cours du temps. Et ces anomalies, elles posent problème pour deux raisons. Parce que, un, elles ralentissent l'entraînement. Et deux, elles induisent beaucoup d'erreurs dans le modèle. Et avec Palm, les ingénieurs ont décidé de rendre l'entraînement complètement déterministe. Et ça, ça veut dire quoi? Ça veut dire qu'il a été possible pour eux d'identifier ces anomalies, de stopper l'entraînement, de pouvoir rétro-ingénier pour faire du debugging, mais surtout d'identifier les parties du jeu de données qui causaient ces anomalies-là. Et donc, on était capable de dégager ces parties du jeu de données qui posaient problème et qui causaient ces anomalies, de revenir en arrière et de rejouer l'entraînement.

Et c'est comme ça qu'on est... qu'on a pu éviter ces anomalies-là et accélérer l'entraînement et avoir des modèles qui sont plus performants. Le troisième élément de la secret sauce Google sur l'entraînement, mais on aurait pu en citer bien plus, elle réside dans le choix de la taille du modèle. Les ingénieurs de Palm ont fait des expérimentations et ils se sont rendus compte qu'en fait, pour minimiser cette erreur du modèle en sortie de l'entraînement, il était en fait plus intéressant de faire grossir la taille du jeu de données d'entraînement proportionnellement à la taille du modèle. Avant, les benchmarks montraient du 3 pour 1. On faisait grandir le modèle plus vite que la taille du jeu de données d'entraînement. Là, aujourd'hui, on commence à comprendre qu'il y a des facteurs externes, que la taille du modèle n'est pas forcément ce qu'il faut aller chercher à tout prix. Donc ça, c'est intéressant, parce que là où on était à la course au plus gros modèle, on comprend qu'il y a d'autres facteurs qui rentrent en jeu.

Et cette intuition, elle a été confirmée avec Palm 2, qui est un plus petit modèle que Palm. Et je vais passer la main à Farid pour vous en dire un peu plus. Merci Mathilde. Alors oui, un an après Palm 1 arrive Palm 2. Et donc, on tire aussi les enseignements de Palm 1 pour proposer un modèle 30-40% plus petit, tout en étant meilleur. Alors comment? En améliorant l'architecture sous-jacente du réseau de neurones. Et surtout, également, ça c'est public, si vous tapez Technical Report Palm 2, vous allez avoir pas mal de détails là-dessus, sur la gestion du corpus pour le dataset. Donc un corpus plus gros, mais en même temps plus divers. C'est-à-dire que dans ces corpus, l'anglais est évidemment surreprésenté, mais dans le scoring, en tout cas dans les benchmarks, Palm 2 est meilleur en anglais que Palm 1, tout en étant plus multilingue et en contenant un peu moins d'anglais. Et donc de ce point de vue-là, la gestion du dataset, ce qu'il contient et comment faire en sorte d'avoir un meilleur modèle en étant plus fin sur le jeu de données est un enjeu.

Le troisième élément qui est intéressant à la sortie de Palm 1, aujourd'hui tout le monde est à peu près au courant de ça, mais on note que par simple instruction, on peut demander au modèle de détailler un raisonnement. Au même titre que nous, on nous apprend à l'école d'un problème mathématique, quand il est compliqué, tu le découpes en sous-problèmes et puis tout de suite la résolution devient plus simple. Faire un prompt au modèle en lui demandant de fonctionner par step by step amène une résolution un peu... plus correct, plus circonstancié. Cette capacité émergente, on la découvre à l'entraînement de Palme 1 et elle s'améliore notamment avec Palme 2. Alors aujourd'hui, tous les LLM ont fait du chain of thought de ce point de vue-là. Et donc ça, c'est les améliorations de Palm 2 par rapport à Palm 1, plus petit, plus multilingue, et encore des capacités améliorées sur ces capacités émergentes, dont le chain of thought. Et donc, du coup, sur la partie de l'offre, tu prends Mathilde?

La bonne nouvelle, c'est que tout ce travail de recherche, Google ne l'a pas gardé pour lui. Et on la met à disposition de nos clients à travers deux typologies d'offres aujourd'hui. L'offre grand public avec Bard, qui est notre agent conversationnel, dont vous avez peut-être déjà entendu parler, qui repose sur nos LLM. Donc c'était Lambda à l'époque. Après, ça a été Palme 1 et aujourd'hui, c'est Palme 2. Et MakerSuite, qui est un ensemble d'outils développeurs pour la mise en production de LLM. Mais voilà, donc il y a l'offre grand public et il y a l'offre entreprise. L'offre entreprise est spécifique et ce sont des produits différents pour la simple et bonne raison que les besoins d'une entreprise sont différents de ceux du grand public, que ce soit en termes de contrôle de la donnée, de sécurité, de confidentialité, même de contrôle des coûts, parce que c'est aussi un sujet. Donc, l'offre, les produits qu'on a mis côté entreprise, eux, sont spécifiques et permettent à nos clients d'utiliser, de bénéficier des capacités d'IA générative en toutes ses derénités. J'insiste. là-dessus parce qu'on a tous vu au début de la vague d'IA générative ces grandes headlines sur les fuites de données, l'interdiction de chat GPT en Italie à ses débuts.

Ici, on a mis tous les guardrails pour les entreprises pour l'utilisation de l'IA générative. Je fais un zoom sur Vertex AI, qui est notre plateforme de bout en bout pour l'expérimentation, l'entraînement, la mise en production, l'évaluation de modèles de machine learning sur Google Cloud. Et elle repose aussi sur une infrastructure qui est best-in-class. Ces deux éléments ont été utilisés par Criteo et MWN pour développer leur cas de usage. Donc je fais un petit focus là-dessus. Vertex, ça repose sur l'infrastructure de Google qui est best-in-class. En fin août, on comptait, il me semble que c'est plus de 70% des licornes d'IA génératives qui tournaient sur Google Cloud, dont Midjourney. Elle repose sur une offre à deux jambes, GPU et TPU, parce que les TPU, on ne les garde pas que nous pour l'entraînement de nos modèles, mais aussi à disposition de nos clients. Et Vertex se compose de plusieurs couches qui vont aller des plus custom aux plus managées pour vous permettre l'intégration de capacités diagénératives sur étagère.

La couche du bas contient tous les modèles fondationnels que Google va mettre à disposition de ses clients. Et ce qu'on appelle le Model Garden, un jardin de modèles qui centralise pas seulement les modèles fondationnels de Google, mais aussi des modèles open source et des modèles third party de nos partenaires. Au-dessus de ça, Google Cloud met à disposition tout un ensemble d'outils qui sont spécifiques à l'opérationnalisation et la mise en production de cas d'usage d'IA générative, avec des choses très spécifiques comme le tuning, le distilling, l'évaluation de vos modèles d'IA générative au sein de l'AI Platform. Au-dessus de ça, on retrouve deux briques destinées aux développeurs autour du search et de la conversation qui permettent à n'importe quel développeur dans n'importe quelle entreprise qui n'a pas forcément des connaissances très deep en machine learning d'infuser une expérience d'IA générative autour de la recherche et du chatbot dans vos produits. La dernière brique, c'est l'ensemble de nos solutions d'IA sur l'étagère, dans lesquelles on a fait infuser des fonctionnalités d'IA générative pour accélérer la recherche documentaire ou même le traitement dans les call centers.

Je termine sur les modèles fondationnels parce qu'on vous a parlé de Palm, qui est en fait la plus grosse version du modèle fondationnel que vous trouverez chez Google. Le parti pris que Google Cloud a pris, c'est de mettre à disposition de nos clients des versions plus petites de Palm, mais qui sont focus sur les usages. Et ça, ça vous permet d'avoir une expérience qui est plus efficiente, plus rapide. Je vous donne un exemple. On a distingué Palm pour le texte et Palm pour le chat. Palm pour le chat, par exemple, vous rendra souvent des réponses moins verbeuses, mais plus conversationnelles. Donc typiquement, ça, c'est un ajout qui a été fait parce qu'on focus nos modèles fondationnels sur les usages qui en sont faits. Je vois qu'on n'a plus beaucoup. Je pense qu'on a même passé le temps. Donc, je n'irai pas plus loin. Mais voilà, vous retrouvez aussi des modèles fondationnels sur d'autres modalités. Ici, aujourd'hui, on s'est focus sur Palm. Merci à tous. Merci Mathilde, merci Farid.

Je pensais faire la présentation tech, mais en fait c'était encore plus tech que ce que je vais faire, donc je ne sais pas s'il y aura plus de détails sur toute la partie machine learning. Moi c'est Ludovic, je travaille chez Criteo, je suis chercheur là-bas. Et je vais vous présenter un peu comment c'est passé, comment se passe, parce que c'est en cours, la transition entre l'IA et l'IA générative. Alors, dans un premier temps, je vais présenter rapidement Criteo pour ceux qui ne connaissent pas, puis la recherche en machine learning, apprentissage statistique en français, et des projets, trois projets sur lesquels on a joué au niveau de la recherche chez Criteo, avec pour but, bien sûr, toujours en tête, l'application sur des produits internes ou externes. Donc Criteo et iLab. Donc qu'est-ce que fait Criteo? Criteo, c'est de la publicité en ligne. Mais c'est de la publicité en ligne pour laquelle on essaye d'être le plus pertinent possible.

Et ça veut dire... Prendre beaucoup beaucoup de choses en considération le contexte de la page parce qu'on n'a pas envie d'être un utilisateur qui arrive sur je sais pas l'équipe et d'avoir des recommandations des pubs sur des fers à repasser on essaye de faire des choses relativement bien pour d'une part que nos clients aient le plus à... C'est pas mon téléphone, non... Que nos clients y trouvent leur compte et que les utilisateurs y trouvent aussi une expérience riche. Et personnalisé. Donc quand je dis qu'il faut prendre en compte le contexte, il faut prendre en compte le contexte à différents niveaux et donc ça veut dire différents algos de machine learning derrière. Donc ça peut être l'URL, la catégorie de la page sur laquelle vous êtes, les images, s'il y a des images, certains mots qui sont importants dans le texte. Et le texte en général. Bien sûr, le site sur lequel vous êtes, etc.

Donc ça, ça veut dire beaucoup d'utilisateurs, beaucoup de données à traiter en peu de temps. Parce que par jour, on génère 600 terabits de données. Qui correspondent à 6 millions de requests, enfin de queries par seconde, pour lesquels il faut répondre en moins de 100 millisecondes. Donc ce n'est pas moi qui réponds à ces queries à chaque fois, je n'ai pas le temps. Et donc on a besoin d'algos, de machine learning, qui répondent très vite et de façon pertinente. Pour vous donner une idée, si on imprimait les 600 terabits de données, ça correspondrait à 162 milliards de pages A4, donc presque autant que le premier palme. 80 millions de kilos de pages et ça fait un gros troupeau d'éléphants. 13 500 éléphants. Donc ça fait énormément de données à traiter. Et c'est pour ça qu'on a besoin de machine learning un peu partout.

Parce qu'on veut être le plus pertinent possible et on veut répondre rapidement. Donc il y a du machine learning un peu partout chez Criteo. C'est un peu dans l'ADN de la boîte. On l'a au niveau du pricing, on l'a au niveau des enchères, on l'a au niveau de la recommandation, des bannières, quand il faut essayer de rapprocher des utilisateurs qui seraient similaires, quand il faut extraire du contexte d'une image ou générer des images. C'est vraiment quelque chose qui est présent partout, tout le temps, chez Criteo, dans la pipeline. Donc il faut que ça scale. Et c'est pour ça qu'on a créé en 2018 l'AI Lab, qui est présent physiquement à Paris et à Grenoble. Il y a une super remote policy. Donc on a des gens un peu partout en France qui travaillent. Ça représente plus de 110 ingénieurs et plus de 30 chercheurs. Donc je vais rentrer un peu plus dans le détail dans la partie recherche et dans un premier temps nos objectifs.

Donc bien sûr, en tant que chercheur, nous ce qu'on cherche à faire, c'est pousser, aller plus loin, se poser plus de questions et pour aller plus loin que l'état de l'art actuel. Bien sûr, partager nos connaissances en interne et en externe. Des discussions avec produits parce que bon, Criteo c'est pas encore une ONG et donc on est payé pour aussi faire avancer le produit Criteo et bien sûr participer à l'éco-système AI en faisant des présentations à Tech.Rocks. Donc, on a cinq équipes différentes chez Criteo. Une qui s'intéresse plus à la partie, disons, contrôle. Donc c'est du bandit manchot en français, je crois. Donc comment on explore, comment on exploite les données. Une autre sur spécifiquement la recommandation, qui est très importante chez Criteo. La causalité, le traitement du texte et des données structurées et les images.

Donc on a quand même une variété d'équipes qui travaillent sur différentes thématiques et c'est ce qui fait un peu la richesse de cette équipe de recherche, de laboratoire de recherche chez Criteo. Donc quand je dis on essaye d'aller plus loin que l'état de l'art et d'être ouvert, ça se traduit principalement par des publications dans des top conférences. Donc pas mal de publications, pas au niveau de Google, mais on est pas loin, mais on est quand même très loin. Mais des très bons papiers et pour une équipe de 30 chercheurs, personnellement, moi je suis particulièrement fier de travailler avec ces gens-là parce que c'est des gens très très compétents et qui font un super travail. Et pour le côté ouverture vers l'extérieur, on est aussi, je crois, les seuls à avoir publié un dataset sur de la reco d'un terabyte.

Donc là, je crois que c'est le plus gros jeu de données qui existe. Donc si vous êtes intéressé par la reco, et que vous voulez vous amuser à faire des gros algos de reco sur du... Là, c'est pas mal de big data. Vous avez un jeu de données d'un terabit de clics. Donc je pense que là, vous pouvez y passer deux, trois nuits tranquillement pour traiter ces deux. Rentrons un peu plus dans le vif du sujet sur ce qu'est l'IA et ce qu'est l'IA générative. Donc l'IA, c'est un contexte très générique où ça prend en compte tous les systèmes qui sont capables de, disons, raisonner. Ensuite, on a l'apprentissage statistique, donc le machine learning. Et là, on rentre sur ce que nous, on sait faire, à savoir traiter de la donnée. Donc la vraie différence, c'est que ça, c'est un terme qui existe depuis les années 70 au moins. Et le machine learning, c'est plutôt récent. Donc l'apprentissage statistique en français. Et là, la vraie différence, c'est la donnée.

On a des algos qui apprennent à partir de la donnée. C'est vraiment la grosse différence. Ensuite, ces dernières années, on a eu l'émergence du deep learning. Et donc là, on a juste une paramétrisation de réseau profond. Donc ça veut dire qu'on a des réseaux de neurones avec des couches, enfin plusieurs couches. Et on essaye d'aller de plus en plus profondément pour faire des choses. Donc là-dedans, vous avez les feedforward neural network, les convenettes, des choses qui sont plutôt connues aujourd'hui. Et ces derniers temps, on parle beaucoup d'IA générative. Alors, générative AI, enfin, faire de la génération en... En machine learning, c'est quelque chose qu'on fait depuis longtemps. La grosse différence aujourd'hui, c'est qu'on est capable d'entraîner des modèles d'une taille qu'on n'a jamais vue avant, comme on dit Farid et Mathilde, sur une quantité de données énorme. Donc à cette échelle-là, c'est pour ça aujourd'hui qu'on parle de Gen AI, c'est parce qu'à cette échelle-là, ça n'avait jamais été fait. Et donc là, on a vraiment un changement. Dans tout l'écosystème du machine learning parce qu'on a des modèles qui sont capables de générer des images très réalistes et du texte de très très bonne qualité.

Donc ça c'était la grosse grosse différence qu'il y a eu aujourd'hui. Je vous conseille un article que j'ai lu ce matin, je l'ai mis ce matin, sur le Financial Times, sur Generative AI. Ce n'est pas hyper technique, vous n'avez pas besoin d'être technique, mais ça vous donne une vision assez globale de ce qui s'est passé en 2017, comme l'a dit Farid, avec l'avènement des Transformers et pourquoi ça a changé l'écosystème actuel. Donc, OK, on a des super modèles qui font... À peu près tout et vous avez dû avoir votre neveu, votre fils qui est arrivé, qui a dû vous dire des trucs du style c'est bon papa j'ai plus besoin de faire papa, maman, j'ai plus besoin de faire mes devoirs, chat GPT, j'ai pas d'image avec Bard, j'aurais dû le faire sur Bard hier, chat GPT, peut-être que Bard le fait ceci dire, chat GPT peut tout faire pour moi. Effectivement, Ça fait beaucoup de choses. Ce dont on est sûr aujourd'hui à propos de ces modèles, c'est qu'on a des modèles très très larges et donc ça coûte énormément à entraîner.

Donc tout le monde ne peut pas se permettre d'entraîner des modèles génératifs comme celui-là. Alors je crois que Farid a dit que c'était 15 millions d'entraînements de palme. Moi j'avais des chiffres sur l'AMA, donc c'était le premier modèle de méta qui arrivait après BERT, après... Après, Palm aussi. Et la totalité, donc tous les entraînements sur un modèle Lama, c'est 22 millions. Donc ça, c'est quelque chose que toutes les entreprises ne peuvent pas se permettre, se dire, tiens, moi aussi, je vais apprendre mon modèle de langage. Il faut avoir un peu de cash. Ce qu'on sait, c'est que ces modèles sont très bons en anglais, un peu meilleurs que moi en anglais, mais qui sont très forts là-dessus. Si vous demandez à réécrire un texte, drafter un roman ou que sais-je, ils sont effectivement très très bons là-dessus. Et ils écrivent un peu plus de code que moi à la seconde aussi, si vous voulez, écris-moi un HTML, je ne sais pas quel code, il va le faire très rapidement.

Après, est-ce que ça fonctionne ou pas, je pense qu'il faut quand même quelques experts tech, et donc je pense qu'on a encore du taf pendant quelques temps pour corriger cette chose. Ceci dit, ça ne fait pas tout. Parce que comme on le voit sur cet exemple, en termes de maths, il n'est pas au point. J'ai mis la calculette, c'est pour moi. Moi, je sais que vous faites les racines carrées de tête. Mais visiblement, ça ne matche pas trop. Il n'est pas trop loin, donc c'est pas mal. Il arrive à interpeller un peu, mais il ne donne pas la réponse. Et quand on fait des maths, on a envie d'avoir la vraie réponse. Il n'y a pas deux réponses à racine carrée de je ne sais pas combien. J'ai mis là-dessus. Mais il n'y a pas de réponse. Donc, on veut des choses qui soient justes. Et pour le coup, c'est quelque chose avec lesquels ils ont encore des problèmes. Les hallucinations aussi. Et une chose dont on parle beaucoup en machine learning, c'est est-ce qu'ils ont un modèle du monde?

A savoir, est-ce qu'on a une représentation latente? Là, c'est peut-être un peu trop technique, mais est-ce qu'on arrive à capturer dans un vecteur la sémantique de la phrase pour pouvoir faire des opérations dessus? Parce que là, ce que font ces modèles-là, c'est typiquement, ils apprennent à prédire le mot suivant, le token suivant, à partir du passé. Mais on n'a pas de représentation de cette phrase pour pouvoir faire des choses. Après, BERT, c'était un modèle qui le faisait, mais c'était un autre type de modèle. Donc on n'est pas encore là et c'est pourquoi on a besoin de plus de recherches dans ce domaine. Et je dis open investigation parce que seul on avance beaucoup moins vite qu'à plusieurs. Et c'est pour ça aussi que Google, je pense, publie la plupart de ses papiers. C'est parce que c'est important. Ça attire des talents, mais ça fait avancer beaucoup plus vite les choses.

Alors maintenant, je vais vous parler de trois projets. autour de l'IA générative, pas tout autour du texte, sur lesquels on s'est un peu amusé dans le labo de recherche chez Criteo. Les deux premières sont focus sur la personnalisation des créatifs, donc des images de pub que vous pouvez avoir. Donc ce qu'on essaye de faire, c'est d'avoir des creatives qui soient encore plus personnalisées pour l'utilisateur. Pourquoi? Là, le premier exemple, ça va être pour avoir des mises en scène plus pertinentes des produits que l'on essaye de vendre et grâce à la génération d'images. Donc c'est customer centric, on ne fait pas ça juste pour s'amuser. On a toujours en tête les potentiels produits Criteo et les potentielles applications chez Criteo.

Donc la première application, c'est ce qu'on appelle du virtual try-on. Donc typiquement, vous avez une image d'un mannequin et vous avez de l'autre côté des images de vêtements. Et ce que vous voulez, c'est pour réduire les coûts et éviter de prendre un mannequin avec différentes images ou parce que vous avez un utilisateur qui s'est pris en photo et qui a envie d'acheter un débardeur. Vous avez envie de pouvoir le... Mettre en scène directement pour qu'il puisse se projeter directement là-dessus. Alors, si j'appuie là-dessus, est-ce que ça lance la vidéo? Pas du tout. Pas du tout. OK. Donc là, ce qu'on va faire, c'est qu'on va passer sur chacun des modèles et on va changer les vêtements. Et voilà, c'est magique. Alors non, ce n'est pas magique. Ce n'est jamais magique. Il faut beaucoup de données, il faut des modèles, il faut réfléchir à ce qu'on essaye de faire et formaliser ça mathématiquement.

Mais au final, quand on a une petite démo comme ça, même si on est ceux qui ont développé, implémenté le modèle, moi je trouve toujours ça un peu satisfaisant. Voilà, un autre projet sur lequel on travaille, où là, vous avez dû entendre parler de Stable Diffusion, DALI, Imagine, dont Farid et Mathilde ont parlé, de Google. Donc, c'est des modèles qui sont capables de générer des images, soit à partir du texte, soit juste de générer des images contextualisées avec d'autres choses. Le point, c'est vraiment à partir du texte, généralement, c'est ce qui est mis en avant. Et donc nous ce qu'on essaye de faire ici dans le labo de recherche c'est d'avoir des générations d'images de produits qui sont encore plus proches de l'information qu'on peut avoir de l'utilisateur ou du contexte.

Donc là encore on a des produits qui sont plutôt classiques et on essaye de... Créer une mise en scène de ces objets en fonction d'un prompt qui peut être augmenté par des préférences utilisateurs, d'autres données. Ces deux projets ont donné lieu à des publications à chaque fois dans des confs internationales. Un autre projet qui me tient à cœur, parce que c'était une collaboration qu'on a eue avec Google et les équipes de GCP, sur construire en interne un chatbot. Pour nos clients internes. Donc on a une base de données et on veut être capable de query cette base de données et d'avoir des réponses sous format textuel. Donc si vous avez des ingénieurs ou même des chercheurs chez vous, ils vont vous dire, ok d'accord, moi j'ai vu ça, on va faire un truc à la maison, vous allez voir, ça va très bien se passer.

Et donc généralement, il va venir avec un... Une sorte de schéma comme ça. Et il va dire, voilà, on a nos data sources, on va télécharger sur Hugging Face un modèle d'embedding de langage, on va stocker tout ça chez nous, et ensuite on va avoir une question, on va l'embêter, on va chercher le vecteur le plus proche, on va donner ça au LLM, ça va être magique, ça va trop bien marcher, et effectivement, ça marche pas mal. Sauf que ça a un coût. Et encore une fois, tout le monde ne peut pas s'amuser à apprendre des modèles de langage aussi performants que ce qu'a Google. Donc voilà, ce qu'on cherche à faire, c'est query une knowledge base. Pourquoi? Parce qu'on n'a pas envie d'avoir des clients internes qui... du temps à chercher la donnée sur notre base de connaissances. Et on veut l'augmenter avec des LLM parce qu'ils sont très bons là-dessus. Étant donné un contexte textuel, leur poser une question sur ce contexte, ça c'est quelque chose qu'ils savent faire. Donc on a collaboré autour d'un Jumpstart avec Google, c'est les équipes PSO Teams, on appelle ça un Jumpstart, ça dure deux semaines.

On a eu des product managers chez Criteo qui étaient impliqués, la R&D, l'Infra, les équipes de Google, donc c'était vraiment une collaboration multi-équipe. Google nous a fourni une démo en une semaine, une première démo. Donc moi, personnellement, ça m'a pris un peu plus de temps à faire ça dans mon coin avec le petit schéma que j'avais. Au final, après ces deux semaines, on avait cinq prototypes différents qui utilisaient des outils dont Farid et Mathilde nous ont parlé. Donc Vertex et AI, Longchain, qui n'appartient pas à Google, mais qui est quand même une librairie assez importante là-dedans. Et en termes de KPIs, on a quand même des LLM sur ces cinq prototypes différents qui performent très bien. Donc au départ, pour l'instant, on est encore sur la phase d'évaluation humaine. Donc là, on a une auto-évaluation. Vous avez déjà dû voir ça, mais c'est le modèle de langage qui s'évalue lui-même.

En gros, on lui donne la question, la réponse et on lui demande est-ce qu'elle est correcte ou pas. Et là, on va passer sur une deuxième phase où on va faire valider par nos... Nos customers internals le modèle. Je vous montre juste la vidéo et après j'arrête, ça dure une minute sur comment ça fonctionne. Donc voilà, on a une interface directe. Donc ça, c'est une semaine après le John's Art. On a une interface directement chez Google qui peut être intégrée à votre site. Donc là, vous devez me croire, mais en fait, c'est des bonnes réponses. Et donc, c'était assez impressionnant. Et bon, vous n'avez pas à faire toute l'interface, c'est quand même pas mal parce que c'est assez clean. Donc voilà.

Ça répond relativement vite, ça va chercher les informations. Impressionnant. Donc là, ça fait peut-être un peu le café. Voilà, c'est tout pour moi. Merci beaucoup. Vous allez voir beaucoup d'oranges ce soir, donc je vous prépare un petit peu avec cette première slide. Déjà, enchanté, je m'appelle Damien, je travaille chez MWM, c'est la première fois que j'interagis avec la communauté Tech.Rocks, donc merci de m'accueillir. Je vais vous dé... Je vais vous décrire un petit peu ce qu'on fait chez MWM. Le but, ça va être de comprendre pour vous pourquoi est-ce qu'on se retrouve ici à parler de Gen AI. MWM fait du mobile. Je vous ai remis une slide orange pour vraiment imprimer la rétine. On fait du mobile, on fait des apps mobiles. Notre domaine, c'est tout ce qui va être le média, musique, audio, vidéo, photo. Ça va jusqu'à la méditation, le chat audio, etc. On fait beaucoup de choses dans ce domaine-là.

Notre but, je vais récupérer celui-là. Parfait. Notre but concrètement, c'est de proposer des apps qui encouragent les gens à être créatifs. Donc le but de nos apps, ça va être créativité toujours le plus. Donc là, vous avez des exemples. Vous avez notre app Farid DJing en bas à droite. Vous avez du coloriage. Vous avez du tuning automatique pour... Accordeur automatique pour la guitare, d'un karaoké aussi qui a du lay-out, on va en parler tout à l'heure, de la séparation de sources, des chats assistés audio. Notre but c'est concrètement de pousser au maximum l'innovation, de pousser au maximum la créativité des gens et surtout d'avoir un maximum d'engagement. Pour des raisons business, oui, mais surtout parce que sinon nos produits n'ont pas de sens. Un petit mot sur la stack. On a une stack complètement standard, surtout sur la partie mobile. Côté back front du Go, pas très standard, mais en tout cas, nous, on adore ça. React, plutôt standard, vous connaissez.

On fait beaucoup de R&D en interne. On est à peu près 100. Il y a 50 1G à peu près, 50 non 1G. Et parmi les 1G, on a vraiment toutes les compétences qui sont... inclus, y compris les équipes de R&D. On adore tout faire en interne. C'est notamment là-dessus que je vais faire le retour d'expérience parce qu'on s'est un peu cassé les dents sur pas mal de choses. Et on bosse pas mal depuis longtemps avec Google Cloud. Depuis 10 ans, on a des grosses apps sur Android, donc ça fait très longtemps qu'on a de très bonnes relations. Et on a aussi utilisé le Triton Inferno Server de Nvidia justement pour faire toute l'inférence sur nos modèles. On va en parler un petit peu après. J'en profite, je vous ai mis les noms des gens chez nous que vous pouvez contacter si vous voulez parler avec nous de n'importe quel sujet. Je les ai remis à la fin, comme ça vous les aurez. On fait des apps, on fait beaucoup d'apps, on fait nos propres apps. C'est-à-dire qu'on... On ne fait pas d'app pour des clients, on ne fait que des apps pour nous, pour faire grandir notre écosystème créatif, pour que les gens potentiellement à la fin créent des choses dans une app, les partagent dans d'autres apps, les fassent consommer dans une troisième app, etc.

On a plus de 600 millions de téléchargements, tout confondu sur les deux plateformes majeures Android et iOS. Ce qui fait de nous un des plus gros publishers de France. Mais généralement, on n'est pas énormément connu. Pourquoi? Parce que dans le mobile, on ne market pas beaucoup une marque, on market les apps. Et donc forcément, vous ne connaissez pas la marque. On est dans plus de 180 pays. On a été récompensé il y a à peine deux semaines au France Digital Days parce qu'on a eu un petit award bleu, blanc, rouge qui récompense justement le fait de faire rayonner à l'international. Les scale-up françaises. On fait partie du FT120, donc ça a participé un petit peu à ça. On fait surtout des apps, je vous ai dit, mass market, on parle au grand public, et ça c'est quelque chose qui était intéressant aujourd'hui aussi d'aborder, parce qu'on a parlé beaucoup de cloud très profond, des grosses choses à mettre en place, pour le grand public c'est différent, avec Riteo c'est aussi beaucoup de B2C. B2B, pardon, là le B2C, ça va être un autre genre de problème. On va aussi beaucoup parler tout à l'heure de notre app de dessin. Il peut ressembler un peu à un chat GPT comme ça au niveau de l'interface, mais vous allez voir, c'est quelque chose qui a beaucoup changé notre vision du produit et du business en interne.

L'IA, là on dit AI, tout Gen AI. Bon, alors l'IA, qu'est-ce qu'on faisait nous avec ça? Concrètement, on en a parlé un petit peu tout à l'heure, des outils internes. On va essayer d'assister les gens dans leurs analyses de data. On va essayer de faire générer des choses, de faire des tâches analytiques concrètement. Et ça, en fait, pour nous, c'est de l'IA qu'on va appeler un peu faible. Je ne veux choquer personne dans le domaine, c'est un terme que j'invente, donc ne m'en voulez pas. Mais concrètement, c'est vrai que quand on parlait d'IA il y a quelques années, les gens, il y avait eu AlphaGo avec toute cette trame qui a un peu animé la communauté à ce moment-là. C'est des choses comme le clustering, c'est des choses comme du labeling dans des photos. Mais c'est des choses qui, pour nous, en termes de B2C, ne permettent pas de faire des produits. C'est assez compliqué de faire ça. Là, ce qui change récemment, c'est que c'est devenu assez mainstream. Ça fait même pas un an qu'on a eu un peu une révolution, que des gens ont mis l'IA, la Gen AI, dans les mains du grand public, avec ChatGPT notamment. Ça, c'est quelque chose que nous, on a vu, parce que c'est le moment où ça commence à en parler dans les médias, dans les médias très mainstream.

Et donc, le moment où, pour nous, ça commence à avoir du sens. Dire, OK, ça y est, le grand public, on peut lui mettre ça dans les mains. On peut lui faire faire des choses avec parce qu'il comprend ce que c'est. Avant, c'était compliqué. Un autre exemple aussi, c'est que nous qui bossons dans l'audio, la photo, la vidéo, toutes ces choses-là, maintenant, les technologies, on l'a décrit dans les présentations d'avant, sont capables de comprendre le contexte qu'il y a dans de l'audio ou de la photo ou de la vidéo. Là où je l'ai mis à la slide avant, c'était avant juste du labeling, de l'assistan. Là, vous avez quelque chose, par exemple, vous avez un modèle, vous allez lui mettre une photo, vous allez lui demander, je ne vous ai pas mis le prompt, mais je lui ai dit, invente-moi une histoire à propos de ce lama, il s'appelle Dave. En fait, il m'a sorti toute une histoire à propos de ça. Donc, il est capable de comprendre, de voir qu'il y a un skateboard, de m'en reparler, de voir qu'il sourit, de m'en reparler. Et ça, pour nous, ça change tout parce que si le grand public, il comprend ce que c'est qu'il y a ou en tout cas, il sait maintenant ce que c'est et qu'il y a des applications hyper concrètes comme l'audio et la vidéo, pour nous, du mobile grand public, ça nous parle complètement. C'est pour ça que je lui ai parlé de Strong AI un petit peu là-dessus, c'est-à-dire que c'est quelque chose sur lequel on peut construire un produit.

Et voilà, donc ça, j'en ai parlé un petit peu là. Maintenant, on est capable aussi de... générer des choses. On est capable de générer des choses et ça, ça va changer beaucoup de choses. Nous, dans nos apps, je vais en reparler juste après. Là, je vous ai mis, par exemple, on a une app qui fait la première à gauche, c'est une app de montage automatique. C'est-à-dire qu'on s'est dit, ça serait trop bien, vous avez tous vos films de vacances, vous êtes dans le retour, dans le train, dans la voiture, vous sélectionnez tout, vous lui mettez, il va faire un montage automatique avec... Une musique qui va bien en fonction des sentiments, par exemple, que vous pouvez extraire d'une vidéo, il va essayer de faire un montage automatique, de faire les bons cuts, etc. Donc ça, on ne veut pas révolutionner le montage, on n'a pas cette prétention, mais par contre, c'est des choses qui nous permettent à nous de faire progresser notre compréhension un peu du sujet et de montrer au grand public qu'on peut aller trouver des applications qui sont... Assez cool là dans sa main. Ça c'est cool. Et on a aussi à droite, je vous ai mis, karaoké. Ça un karaoké, Jenea il est où? Il est dans la génération des lyrics. Ça vous allez peut-être un peu tiquer, vous allez dire ok les lyrics, l'industrie de la musique, les ayants droit, d'habitude c'est protégé, c'est compliqué de s'y attaquer.

Oui, mais quand vous avez un modèle où vous lui donnez la musique et qu'il vous génère les paroles, vous savez quelque chose, c'est une rupture pour ce genre d'industrie. Bon, nous, des choses, la rupture, on adore ça. C'est le but des startups, des scale-up. Et c'est le bon moment pour le faire. Et enfin, comme je le disais aussi, c'est un bon match avec notre objectif, faire des choses créatives. L'IA peut générer des choses, nous on va faire de la créativité. C'est parfait. From AI to Gen AI. Donc, je vais appeler. sur deux de nos produits pour vous présenter un petit peu la rupture qu'il y a eu chez nous en termes de produits. Le premier c'est Stems à gauche, c'est concrètement quelque chose, vous allez dropper un MP3, ça va vous séparer les différentes sources. Vous allez avoir la voix, les guitares, les instruments, etc. Concrètement, c'est un produit qui, je vous ai mis l'interface web par exemple à gauche, ressemble beaucoup à de l'assistanat, un peu de l'analytique comme tout à l'heure, c'est on va dire de l'AI qui était de l'audio engineering, on va dire du traitement du signal plus plus.

Mais c'est dur de faire un produit grand public avec ça, vous avez touché une niche, un utilitaire. Donc nous on s'était dit ok ça ça va aller dans notre app de DJ, ça va être un petit peu des smart EQ, des nouveaux EQ. Les EQ c'est ce que vous parlez, vous avez les... les fréquences basses, les fréquences médium, les fréquences high exactement. Et là on s'est dit on va faire le même principe sauf qu'on va aller venir permettre aux gens d'enlever certaines pistes ou pas en live quand ils sont en train de mixer. Ok top. Mais du coup finalement là on avait avant de l'EI qu'on avait du mal à marketer au sein d'un produit qu'on était obligé d'intégrer en tant que feature dans un produit. Là avec Gen AI en fait on a notre application de dessin ColorPop à droite et en fait on est maintenant capable de proposer, vous avez le C'est une à droite. Finalement, ce que le grand public connaît. Interface ChatGPT, j'arrive, j'ai mon écran, j'ai mon input, je mets mon prompt et j'y vais. Et concrètement, pour nous, ça change tout. Parce qu'on passe d'une feature à un produit. On est capable de mettre en frontal Gen AI dans nos produits et les gens comprennent ce que c'est et sont intéressés pour s'en servir.

Donc voilà déjà la principale différence au niveau produit. C'est ce que je vous ai remis dans le premier, donc je ne vais pas le repasser. Par contre, si on creuse un petit peu, si ça change votre produit dans votre boîte, ça change votre business. Et derrière, ça va changer la tech, ça va être les sites d'après. Ça change le business parce que ça change votre proposition de valeur. Ça change votre business model. Alors je vous l'ai mis un petit peu à droite, nous on fonctionne en freemium, donc beaucoup d'ads ou avec des abonnements ensuite. Mais du coup, quand vous commencez à mettre des features comme ça, qui comme on l'a dit, coûtent cher à la fois l'entraînement mais aussi l'inférence, on va y revenir, compliqué donc voilà ça va il va falloir réfléchir d'autres choses c'est concrètement aussi quand vous avez maintenant vous avez plein d'apps qui vous mettent des paywalls ben avant on va dire que c'était un bullet point votre petite feature et a dans votre proposition de valeur maintenant c'est votre application c'est ce sur quoi vous allez vouloir que les gens arrivent et captent comme proposition de valeur Au niveau business model aussi, au sein de votre boîte, nous concrètement, on va être obligé en tant qu'équipe technique qui dépense beaucoup d'argent pour faire ces choses-là, de faire rentrer ce que va nous coûter l'instant.

d'une application par une personne et l'usage des features en freemium, dans le coût global d'acquisition de cet utilisateur. Et ça, ça commence à faire grincer des dents aussi, parce que dans un business comme le nôtre, on travaille au centime près, dans des pays où c'est compliqué d'aller avoir des revenus avec les pubs assez hauts, ou avec des abonnements avec des faibles taux de rendement, on va dire. là, vous pouvez directement exploser votre produit. Votre produit n'est pas viable directement dans plein de pays. Et enfin, un dernier point, par contre, ça c'est assez intéressant, c'est que vous l'avez vu dans l'exemple juste avant, on passe du coup sur notre application de dessin, on avait une home, on arrivait à un catalogue, les apps à catalogue on connaît, on s'abonne pour avoir toutes les semaines du nouveau contenu, Là, vous arrivez dans une app où moi, je n'ai plus besoin de catalogue. C'est les utilisateurs eux-mêmes qui vont générer le contenu, qui vont le partager au sein de la communauté, qui vont le réutiliser, qui vont s'inspirer, etc. Donc ça, en fait, ça renverse complètement la manière dont on a construit les produits et le business chez MWM.

Au niveau tech, donc là, pas mal de petits bullet points à voir. Alors, au niveau infrastructure, il y a des petits smileys qui ne sont pas très contents, parce que concrètement, vous l'avez vu dans les... Surtout dans la présentation de Mathilde et Farid. Bon, alors nous, on vient de l'EI, donc on avait notre petit cluster cube avec notre triton qui tourne dessus. Le triton, c'est le serveur d'inférence. Les apps mobiles qui appellent un backend, qui transfèrent au serveur d'inférence, qui renvoient tout ça. Les ops sont super contents, ils ont leurs charts qui sont déployés, etc. Leurs petits potes. qui tourne. Et puis là, nous, l'équipe Machine Learning, ils disent« Ok, on va vous fournir une image. » Et puis là, les ops, quand ils voient débarquer la première image de 10 gigas, tout de suite, ils ne sont pas bien. Concrètement, ça fait bizarre la première fois. Et concrètement, ça rend tout beaucoup plus lent. Le scaling, parce qu'il faut télécharger 10 gigas, il y a toutes les libs, c'est hyper compliqué. Vous avez en plus dans le Gen AI le provisioning de GPU qui est actuellement un peu le nerf de la guerre quand on veut faire les choses nous-mêmes. Et aussi les choses sont plus compliquées parce que vous faites avec du GPU, vous avez besoin d'avoir le bon OS qui va bien, les bonnes libs et ça devient tout de suite compliqué.

De scaler tout ça, il faut s'en occuper beaucoup. Pour des gens comme nous, on avait une équipe SRE où il y avait une personne, une belle équipe. Tout de suite, on se dit, OK, il me faut 10 personnes pour s'occuper de ça toute la journée, c'est compliqué. C'est la main feature d'une de mes plus grosses apps. Ok, je fais comment? Il faut que je fasse un choix. Donc concrètement, les solutions qu'on a trouvées pour y parvenir dans un premier temps, c'est de faire rentrer au chausse-pied Gen AI dans l'infrastructure AI. Donc on va sur-scaler potentiellement en avance de phase si on a une opération commerciale, si on a des choses comme ça. On a aussi des techniques pour... Préchauffer les GPU, donc ça c'est un peu comme concrètement le GPU vous lui faites faire quelques cycles et en fait il va mettre en cache pas mal d'instructions puisque comme c'est tout le temps la même chose au niveau de la génération ça va vous permettre d'être prêt aussi tout de suite Et j'ai mis en troisième point, j'ai rajouté tout à l'heure, en fait, vous priez que ça va tenir. Concrètement, vous êtes là, j'ai mes images de 10 gigas, s'il y a un autre qui doit popper, il va mettre 10 minutes, 15 minutes à venir se synchroniser, et puis peut-être qu'on va attendre un GPU.

Donc c'est compliqué. Du coup, qu'est-ce que vous faites? Est-ce que vous descendez toutes vos métriques de scaling? À ce moment-là, vous avez 50% de votre AFRAC qui est toujours à vide. Bon, ça commence à poser des questions comme ça. Deuxième point, au niveau latence. Nous, on est sur mobile, là où en plus les gens ont tant d'attention. de plus en plus réduit, surtout sur des apps un peu comme les nôtres, où on veut consommer, créer, etc. On a besoin d'une latence qui soit assez rapide. Donc au niveau inférence, c'est assez compliqué. On l'a vu en plus tout à l'heure, on a beaucoup parlé des modèles qui étaient disponibles. Je vais en reparler ensuite après. Les modèles qui sont disponibles sont énormes. Nous, qu'est-ce qu'on fait? On est obligé de les optimiser, de les compresser, de les spécialiser. Concrètement, ce que fait l'équipe de Machine Learning, c'est justement ça. C'est d'aller essayer de spécialiser des modèles, de couper un peu au couteau, couper dans le gras, on va dire, et d'essayer d'avoir quelque chose qui va être plus léger, qui va être plus directement au résultat, quitte à sacrifier des fois aussi un petit peu la qualité, parce qu'en fait, la latence et le temps de réponse pour quelqu'un sur le mobile, c'est hyper, hyper important.

Et pareil aussi, les modèles peuvent être compressés. Encore, on les re-spécialise, c'est-à-dire qu'on va essayer de faire en sorte d'aller de sa lignée sur l'OS, sur le GPU spécifiquement, qu'on va utiliser. Et sur le modèle spécifiquement aussi, on va essayer de couper tout ce qui dépasse de toutes les livres. Ça concrètement, je vous ai mis un petit smiley content. Pourquoi? Parce que là, on peut gagner quand même du 30, du 40% sur la taille des modèles. Donc ça va aussi nous permettre de faire les choses plus vite. Et un point qui est important aussi, c'est qu'on commence, je le dirai tout à l'heure, à pouvoir mettre des modèles dans des chips sur les téléphones. Ça, en parlant en ouverture, c'est quelque chose qui peut être hyper intéressant. Et d'un point de vue responsabilité, donc plutôt au niveau exécutif justement, un peu reality check. Le cloud, c'était magique. le manager, vous poppez des dizaines de serveurs, les ressources illimitées, on y va, on y va, on y va. Là, vous avez quelque chose qui vous remet quand même bien face contre terre. Non, le cloud, ce n'est pas magique. Il y a quelque chose de physique quelque part. S'il n'y a pas de GPU, il n'y a pas de GPU. 10 gigas, c'est lourd, etc.

Et c'est dur pour nous. De scaler très vite, très fort, ou de rescaler tout zéro, parce que dans des petites apps comme les notes, où on veut faire des tests, c'est dur de lancer une infra rapidement et de la shutdown derrière. On a besoin de réserver les ressources. Donc ça, très simplement, il faut refaire attention quand vous êtes au niveau exécutif, vous signez des contrats à vos SLA, vos SLO, parce que si votre main produit, vous n'êtes pas capable de scaler, c'est compliqué. Organiser aussi des disaster recovery, juste pour comprendre en combien de temps vous pouvez être capable de remonter une infra. Si c'est 15 heures, il faut que tout le monde soit au courant, parce qu'il faut faire quelque chose. Et être bien sûr prêt à pivoter, à changer un petit peu la manière dont vous fonctionnez. C'est pour ça d'ailleurs que je vous fais ce retour d'expérience. Alors, justement, le titre de cette slide est un peu là pour vous montrer là où on en est. Concrètement, on l'a compris avec les présentations de Google notamment, les challenges ML Ops, c'est globalement plus... On ne peut plus, on ne peut plus.

C'est trop gros, c'est trop large, c'est trop compliqué. Et il faut beaucoup d'argent. Je n'ai pas 15 millions à sortir. C'est compliqué. Surtout pour une app mobile où je fais un test. Donc là, je vous ai mis... Rapidement, pas mal de petits points sur les challenges ML Ops. Au niveau des modèles, concrètement, nous, nos équipes de machine learning sur GNI, elles prennent les modèles qui sont réalisés un peu en open source par Meta, par Google. Elles sont obligées de les découper, elles sont obligées de les adapter. Mais en fait, nous, comme on n'est pas capable d'entraîner nos modèles, on n'a pas l'argent, on n'a pas les compétences, on n'a pas le temps, on n'a pas les ressources. Et bien en fait, concrètement, vous avez des équipes qui se retrouvent à adapter des modèles pour vos apps, pour vos use cases et à le fine-tuner. Au lieu d'innover. Ça, ça nous gêne aussi un petit peu des fois dans notre manière de faire. Concrètement, au niveau de l'infrage, on ne revient pas énormément dessus, vous êtes une goutte d'eau dans l'océan, ce n'est pas vous qui allez inventer le prochain modèle d'OpenAI. Et vous avez même, on l'a vu avec Mistral AI, qui a levé des centaines de millions cette année pour faire de l'entraînement. En fait, ça coûte énormément d'argent, on l'a vu tout à l'heure.

Un point qui est hyper important, je pense qu'il faut aborder, c'est que quand vous voulez évaluer la qualité de vos modèles, ça c'est souvent une phase qui revient beaucoup, et bien maintenant avec Gen AI, pour nous c'est beaucoup plus compliqué. Quand vous devez juger si vous avez mis un prompt, je veux un lama sur un skateboard, vous avez des photos qui arrivent, comment juger de la qualité? C'est mieux, c'est moins bien. Avant, en fait, on avait un espace très discret de... C'est bien, c'est pas bien, j'ai la réponse, j'ai pas la réponse, le calcul il est bon, il est pas bon. Là vous avez quelque chose qui devient très subjectif et c'est difficile de benchmarker de goût. Vos équipes, elles ont du mal aussi, les PM compris, les devs compris, à se dire c'est bon, c'est pas bon. Et concrètement on en revient à des anciens... Dans l'ancienne méthode, un peu min opinion score, on fait un sondage. Est-ce que plutôt vous êtes satisfait ou pas? Puis on voit un petit peu au final ce que ça donne. Et enfin, vous marchez sur des œufs. Concrètement pour le testing parce que si vous réservez des GPU sur votre cluster de test, ils ne seront pas disponibles pour la prod. Donc si vous avez réussi à en choper un, attention. Il y a beaucoup de choses qui font un reality check là-dessus. Slide raté.

Non. What's next? Donc, je n'ai pas pour prétention de vous dire ce qui va. Par la suite, pas du tout. Par contre, je peux vous dire un petit peu ce que nous, on attend. Donc concrètement, tout ce dont je vous ai parlé là, c'est des learnings de cette année. Comme je vous l'ai dit, ça ne fait même pas un an que le grand public comprend, ou en tout cas sait ce que c'est que Generai. Et ça a évolué, mais d'une manière absolument démentielle cette année. Là maintenant vous avez du coup les tech giants qui depuis on va dire en gros six mois arrivent avec des choses qui sont enterprise ready, il y a ce qu'on appelle des profanity filters par exemple dans les promptes qui peuvent empêcher vos utilisateurs, moi dans mon appli de dessin j'ai pas envie qu'il y ait des gens qui commencent à publier sur la communauté, des dessins un peu tendancieux ou qui peuvent être même légalement répréhensibles. Vous avez beaucoup de choses qui arrivent de la part de ces acteurs là. Ils arrivent avec des produits scalables, des produits managés. J'ai vu un petit screenshot de Vertex AI dont je parle beaucoup avec Mathilde. Et justement, vous avez des choses maintenant qui arrivent et qui sont là pour faire le travail à votre place parce qu'en fait, il y a des choses que vous ne pouvez plus faire. Et on retrouve même dans Vertex AI le principe de découpage des énormes modèles Foundation dont on a parlé avec les fameuses 4 classes.

Et ça, on en avait beaucoup parlé avec Farid quand il était venu chez nous, où vraiment vous pouvez avoir soit les méga modèles, soit des modèles très spécialisés. Donc Google met à disposition beaucoup de choses. Et on va voir un petit peu ce qui nous attend en 2024. Ça ne fait même pas un an que c'est dans les mains du grand public. Nous, on a besoin de voir un petit peu ce qui va arriver après. Bon, petit avocat ici pour le mobile. Concrètement, nous, on attend de voir un petit peu ce qui va arriver sur le mobile. On est dans une position où ça fait 10 ans à peu près, un peu plus de 10 ans qu'on est dans ce monde-là, le mobile, on est né là-dessus. Et on l'a tous vécu, je pense que maintenant on le voit tout le monde avec vos téléphones dans les mains. Ça a été une vraie révolution, une vraie rupture, à la fois dans la tech et dans la manière dont les gens interagissent avec cette technologie. En plus, au début, on rentrait au chausse-pied les anciennes applications qu'on avait sur le mobile. Au début, quand vous avez eu le début de l'App Store, le début du Play Store, chacun faisait des anciennes applications. Vous avez des applications de savon laser, de boire une bière. On n'avait pas de vraies applications pour ces apps-là, pour une app mobile. Alors que maintenant, vous avez le concept de mobile first, même de only mobile, de choses qui n'existent que sur mobile parce que c'est une expérience spéciale.

Et bien potentiellement, il va y avoir des choses comme ça qui vont arriver avec Gen AI. Là, on essaie de faire d'anciennes choses avec de nouvelles technologies. En fait, vous avez des nouvelles choses qui vont se développer, voire peut-être même du hardware, des choses comme ça. Donc il y a beaucoup, beaucoup de choses qui vont arriver. Nous, on espère que ça va arriver dans les mains des gens rapidement, dans les téléphones. Vous avez déjà sur Apple les devices qui nous permettent de faire ça, de faire en temps réel de l'AI, à voir ce que ça peut donner d'ici 5-6 ans. Gen AI dans les mains des gens, ça peut être vraiment fou. Donc voilà, je mets une petite phrase à la fin pour dire que ce n'est pas courant de vivre une telle rupture, mais on le vit vraiment comme ça. C'est un peu comme la rupture du mobilier il y a 10 ans. Là, il y a vraiment quelque chose de fou qui se passe. Voilà, il faut profiter, il faut regarder ce qu'il y a, il faut parler avec un maximum de gens, comme ce soir. Petit slide bleu pour vous remercier de votre attention quand même, parce que j'ai eu du coup d'orange.