00:00:00 Introduction
00:02:49 Claude peut-il vraiment prevoir ?
00:07:49 Les LLM traitent-ils vraiment les nombres ?
00:09:12 Comment l’IA affectera-t-elle les vendeurs de prevision ?
00:14:38 Quelle est la difference entre prevision et planification ?
00:18:03 Les LLM peuvent-ils soutenir les decisions supply chain ?
00:22:31 Des previsions de chiffre d’affaires aux decisions operationnelles quotidiennes
00:27:11 Pourquoi les previsions nues sont-elles inutilisables ?
00:30:12 Prevoir les decisions supply chain granulaires
00:34:57 Une IA peut-elle generer seule des commandes d’achat ?
00:42:24 Quelles industries adopteront l’IA le plus vite ?
00:44:25 Ce qui devient plus ou moins precieux
00:52:48 Comment les entreprises devraient evaluer les vendeurs d’IA
00:55:51 Utiliser ChatGPT pour la recherche fournisseur
00:56:19 Pourquoi le prompting adversarial compte
01:00:36 Lokad peut-il passer le meme stress test ?
Resume
Conor Doherty interviewe Joannes Vermorel, CEO et fondateur de Lokad, au sujet de Claude Fable 5.1 et de ses capacites de prevision mises en avant. Joannes soutient que la vraie rupture tient a la capacite des agents a automatiser les taches d’analyse et de code. Ils examinent pourquoi les previsions en series temporelles ne sont pas des plans supply chain, comment les LLM peuvent soutenir l’automatisation des decisions, et quelles industries pourraient les adopter le plus vite. La discussion se termine par un cadre pratique pour challenger les vendeurs d’IA, evaluer leur technologie, exiger des gains de productivite mesurables et utiliser des prompts adversariaux pour verifier les promesses marketing.
Transcription complete
Conor Doherty: Joannes et moi venons de terminer notre discussion sur la sortie de Claude Fable 5.1 par Anthropic, en particulier sur ses capacites de prevision, du moins celles qui ont ete mises en avant publiquement. Ce qui a declenche cette conversation, c’est une video que nous avons recue d’un ami de la chaine. Il voulait notre avis, notre reaction aux implications de cette possible avancee en prevision, qui repose bien sur sur un modele LLM. Joannes et moi en avons donc discute, et cela nous a menes a une conversation plus large sur la facon dont il faut vraiment evaluer les vendeurs dans cet espace, y compris Lokad. A la fin, Joannes a donne, je crois, un guide tres pratique, ou un test diagnostique, si jamais vous etes confronte a une proposition d’un vendeur qui dit: “Oui, mon IA peut prevoir, planifier et executer votre supply chain de facon completement autonome, de bout en bout.” Comme je l’ai dit, Joannes a donne des indications tres concretes et utiles sur la facon de mettre ces affirmations a l’epreuve.
Donc, si vous ne retenez rien d’autre de cet episode, restez jusqu’a la fin, ou sautez meme directement a la fin si vous preferez, pour repartir avec ces informations pratiques. Et sur ce, voici la conversation du jour. Joannes, je t’ai fait venir pour discuter d’une video qui nous a ete envoyee par un ami de la chaine. Je te l’ai transmise.
Nous en avons discute en prive, et maintenant nous allons nous asseoir ici et enregistrer un podcast a ce sujet. Il s’agit de la video publiee par Anthropic, qui decrivait, ou disons faisait la promotion, des capacites de prevision de Claude Fable 5.1. Pour le reste de la video, je vais simplement dire Fable, parce que je ne veux pas dire Claude Fable 5.1 a chaque phrase, mais a partir de maintenant, nous parlons de Claude Fable 5.1. Dans cette demo, on le voit ingerer des donnees B2B brutes, puis lancer pendant la nuit des previsions de chiffre d’affaires sans supervision, en produisant des rapports pour les analystes.
Ensuite, les analystes peuvent les passer en revue. Il peut effectuer ses propres backtests via une interface simple de type ChatGPT. Tout cela est fantastique. L’abonne de Lokad me l’a envoye en disant qu’il serait interessant d’avoir notre avis la-dessus, pour des raisons evidentes, parce que si vous avez une IA disponible commercialement qui execute essentiellement des previsions sans supervision pendant la nuit, le terme employe etait “produit des resultats”.
Nous reviendrons sur ce que signifie “resultat”, prevision contre decision, et ce que cela implique, mais une IA commerciale qui produit des previsions pendant la nuit: il voulait connaitre notre avis, surtout le tien evidemment, sur ce que cela signifie pour le marche. Donc, Joannes, tu as vu la video, tu as le contexte. Est-ce que tu as ete impressionne ?
Joannes Vermorel: Effectivement, un peu, oui. Et pour etre juste, c’est impressionnant. C’est tres impressionnant. Mais ce qui est beaucoup plus impressionnant que ce que ce cas d’usage laisse entendre, c’est que la prevision n’est qu’un exemple. Depuis septembre dernier, je dirais, donc depuis environ un an, ces agents de code ont acquis un degre d’autonomie, pour des taches relativement simples, qui est absolument tres impressionnant. Donc je dirais que depuis environ un an, et c’etait meme avant Claude Fable 5.1, le vrai saut a eu lieu vers l’ete dernier.
Pas celui-ci, celui d’avant. Vous pouvez demander des taches relativement simples, du genre de celles que vous demanderiez a un business analyst. L’une d’elles serait: “Construis-moi un modele de prevision, assure-toi qu’il colle aux donnees historiques avec un backtest, puis revisite ce systeme tous les jours pour verifier qu’il reste pertinent.” Et oui, cela va fonctionner. Ce qu’il va faire, en pratique, c’est construire le connecteur pour se brancher aux sources de donnees, en supposant qu’il puisse ecrire quelques requetes SQL.
Il va exporter les donnees dans quelques fichiers texte plats. Il va composer un script Python. Il va executer le script Python. Ensuite, il va composer une mini interface web et vous presenter les resultats sous une forme bien empaquetee.
Et a cote de cela, il va aussi construire l’utilitaire de backtest pour s’assurer que l’ajustement du modele est raisonnablement bon sur les donnees disponibles. Puis, avec quelque chose de separe qui n’est pas exactement clarifie dans la video, vous pouvez faire appeler votre LLM selon un planning quotidien pour revisiter tout l’assemblage et rafraichir la prevision. Mais ne nous trompons pas: le type de prevision qui sera construit sera simplement un vieux modele de prevision classique. Il n’y a rien dans cette video qui suggere que Fable faisait quelque chose de particulier ici. Il va simplement composer une sorte de modele regressif avec quelques parametres pour prendre en compte les cyclicites, business as usual. Ils mentionnent un processus Monte Carlo, 1000, oui c’est ce qu’il a dit, ce qui est probablement juste la constante de boucle utilisee en Python pour lancer quelques iterations.
Encore une fois, rien de tres sophistique. Mais ce qui est vraiment impressionnant, ce ne sont pas les resultats de prevision, qui me semblent extremement ordinaires, mais le fait qu’avec ces agents vous pouvez leur confier a peu pres tout ce que vous confieriez a un business analyst et obtenir, en quasi-autonomie, un resultat assez correct pour ces taches relativement simples, a condition que vous disposiez deja d’un environnement configure. Parce que l’environnement de configuration sera tres probablement la partie la plus compliquee: avez-vous un acces en lecture seule a votre base de donnees ? Vous ne voulez pas donner a votre agent un acces lecture-ecriture a la production.
Donc, a-t-il un acces en lecture seule ? Python est-il installe ? Node est-il installe ? Avez-vous tout ceci, tout cela, toutes les dependances et tous les accessoires ? Et si vous voulez partager le resultat avec vos collegues, il vous faut un moyen de deployer cette application web, sinon elle restera simplement sur votre poste de travail. Si vous voulez la partager, vos collegues devront installer je ne sais quoi, faire un git checkout, avoir exactement les memes permissions. Le principal probleme sera donc la plomberie, l’infrastructure, la configuration. Mais oui, avec les agents modernes et les LLM modernes, les LLM de l’etat de l’art, ces choses se font litteralement en un coup.
Conor Doherty: Oui. Tu as mentionne l’expression “taches simples”. Et je veux faire reference a quelque chose dont nous avons parle il y a quelques annees. Je me souviens de la sortie de ChatGPT 3.5.
C’etait fin 2022, debut 2023. Nous discutions des LLM, des grands modeles de langage, et tu disais qu’ils excellaient dans les taches fondees sur du texte. Et maintenant nous parlons de LLM qui, en gros, manipulent des nombres. Est-ce cela que tu affirmes ?
Joannes Vermorel: Non, il ne touche quasiment aucun nombre. Presque aucun. Il touche du Python.
Conor Doherty: D’accord.
Joannes Vermorel: Tu vois, avec cette approche, le modele ne touchera presque jamais aux nombres. Il composera une requete SQL, c’est du texte. Il composera un script Python, c’est du texte.
Il executera, il composera un script Python pour le backtest, la encore c’est du texte. Puis il recevra un mini resume de l’ajustement, qui sera juste une petite poignee de nombres. Et cela, un LLM peut le traiter. Meme a l’epoque de GPT 3.5, il pouvait traiter une demi-douzaine de nombres dans une conversation. Ce qu’il ne pouvait pas faire, c’etait traiter des milliers de nombres. Mais ici, ce n’est pas ce qui est fait, et Fable n’essaie meme pas de traiter des milliers de nombres. C’est un script Python avec une execution classique qui le fait.
Conor Doherty: D’accord. Cela nous ramene alors a la question de cadrage du debut. Quand la video nous a ete envoyee, la question explicite etait: comment cette avancee, meme si elle reste encore naissante, cette percee generale des LLM dans la prevision, affecte-t-elle les vendeurs du secteur, par exemple les gens qui vendent des services de prevision ? Pourquoi quelqu’un continuerait-il a payer un abonnement a un vendeur s’il peut simplement prendre un abonnement chez Anthropic ?
Joannes Vermorel: Oui. D’abord, il faut constater que ces vendeurs etaient deja obsoletes il y a 20 ans, bien avant les LLM. C’est la que cela peut paraitre etrange, mais imaginez des gens qui utilisent encore des machines a ecrire, et Apple annonce le nouvel iPhone. Est-ce que le fait d’avoir un iPhone encore meilleur va decourager les gens qui utilisent toujours des machines a ecrire de continuer a les utiliser ? Non.
La grande majorite des logiciels autour de la planification, dans le domaine de la supply chain, sont conceptuellement completement depasses, et ils le sont depuis litteralement deux decennies. Ce qui est tres interessant, c’est qu’il y a meme de nouvelles entreprises qui continuent d’emarger dans ce domaine, et des le premier jour elles sont obsoletes de 20 ans. C’est ahurissant. Nous avons encore des concurrents qui demarrent litteralement en 2025 ou 2026 avec des concepts qui auraient ete obsoletes il y a 20 ans.
Donc la premiere chose, c’est un rappel de realite: ces vendeurs, je dirais, ne sont pas du tout affectes, parce que si leurs clients avaient malheureusement un minimum de bon sens, ils auraient compris qu’ils etaient completement obsoletes bien avant les LLM. C’est la que je dis: oui, c’est tres bien, mais cela ne change pas grand-chose. Ensuite, il y a autre chose, que nous avons discute de nombreuses fois: la prevision nue est un anti-pattern. Chercher la prevision avec une perspective de series temporelles est casse. Nous en avons longuement parle sur cette chaine. Cela ne fonctionne tout simplement pas. Et le probleme, c’est que pour beaucoup d’entreprises et de gens, si vous leur dites que le probleme est la serie temporelle en tant que concept, et que c’est cela dont il faut se debarrasser…
Donc, le probleme est: un LLM peut-il fabriquer le meilleur modele possible de prevision de series temporelles ? Absolument. Absolument. Et je ne serais pas surpris si l’on donnait a Fable le temps de participer a une competition Kaggle et qu’il obtenait un score assez eleve. Peut-etre pas l’etat de l’art, peut-etre pas le tout premier, mais je ne serais pas surpris que, dans une competition classique de prevision, quelque chose qui serait entierement assemble par ce type de modele obtienne un score assez eleve.
Mais le probleme est que la perspective des series temporelles est defectueuse. Donc si vous demandez, et c’est un probleme que les LLM ne corrigent pas, les LLM sont tres dociles. Si vous leur demandez: “Trouve-moi un cheval plus rapide”, l’outil vous trouvera un cheval plus rapide. Il peut suggerer que les chevaux ne sont pas tres appropries, mais au final ces LLM, et c’est une bonne propriete, sont extremement obeissants.
Ils font ce qu’on leur dit. Cela fait partie de l’alignement, et c’est tres bien, cela les rend extremement utiles. Mais cela signifie aussi que si vous demandez quelque chose qui est essentiellement une impasse technologique, le LLM sera parfaitement heureux de vous le livrer. Donc la question devient: le LLM, un modele de l’etat de l’art, est-il capable de faire les approches alternatives ? Absolument. Absolument. Je ne dis pas que Fable 5.1 n’est pas capable de faire l’alternative.
Il en est tout a fait capable. Le fera-t-il ? Pas a moins que vous le lui demandiez. Le probleme devient alors une affaire de competence de prompting, mais pas au sens de techniques de prompting sophistiquess.
C’est plutot la perspective de haut niveau sur ce que vous demandez. Donc, pour revenir a la prevision nue: c’est un anti-pattern. Vous ne voulez pas generer des previsions de series temporelles. C’est completement inutile.
Et oui, le LLM peut completement automatiser cela, mais c’est simplement la mauvaise chose a automatiser.
Conor Doherty: La facon dont tu l’as formule, avec quelques phrases que tu as utilisees, prepare tres bien la question suivante: qu’est-ce que tu demandes a cet outil de faire ? Et cela renvoie a quelque chose que tu as dit au tout debut. Je paraphrase: disons qu’il peut prevoir, ce n’est pas la meme chose que dire qu’il peut planifier. Je pense que la difference entre prevision et planification merite qu’on y consacre un peu de temps. Par exemple, si tu disais a… En fait non, je vais te laisser exposer, si tu veux bien, la difference fonctionnelle entre un outil qui produit une prevision et un outil qui produit un plan, qui est vraisemblablement une serie de decisions a prendre.
Joannes Vermorel: Malheureusement pour le marche, le paradigme est: la prevision est le plan. Et nous revenons au fait que les series temporelles sont defectueuses, et que la plupart des vendeurs operent avec un paradigme obsolete. Le probleme est si repandu que meme des entreprises comme Anthropic, lorsqu’elles veulent promouvoir la capacite de leur modele, que font-elles ? Elles reviennent a un modele de series temporelles, qui est completement casse et defectueux, parce que c’est…
Conor Doherty: C’est ce que le marche veut, ou ce que le marche connait, ou ce a quoi il est habitue.
Joannes Vermorel: Exactement. C’est ce que le marche connait. Mais c’est simplement un paradigme defectueux. Je pense que cela fait partie du probleme. Je rejetterais meme entierement la notion classique de planification, parce que la notion classique de planification est un processus en deux etapes: etape un, vous connaissez le futur; etape deux, vous orchestrez l’allocation des ressources pour correspondre a ce futur et garantir la conformite avec lui.
La planification, dans ce sens, c’est essentiellement prevision plus orchestration. Et ce que je dis, c’est que cette perspective est cassee. Donc oui, la planification au sens classique est plus que la simple prevision, mais l’agent peut tres facilement faire l’orchestration. C’est tres facile, et ce sera tout aussi casse, parce qu’encore une fois le probleme est que le paradigme est casse. Si vous demandez a un agent d’operer dans un paradigme casse, il obeira volontiers, mais le paradigme reste casse. Peu importe donc a quel point l’agent est intelligent et capable: il ne livrera pas le retour sur investissement attendu.
Conor Doherty: Je vais te demander de speculer un peu, parce que la video qui a declenche cette discussion portait explicitement sur la prevision du chiffre d’affaires. Ce n’etait pas une prevision de demande a proprement parler.
Joannes Vermorel: Oui.
Conor Doherty: Et evidemment, lorsqu’on parle de prise de decision dans un contexte supply chain, nous sommes une entreprise de supply chain, c’est une chaine supply chain. La demande serait une partie tres importante de ce processus de prevision. Quand on aborde la difference entre prevision et planification, ou ce que nous appellerions prendre des decisions, je suis curieux de savoir comment tu vois, et tu peux speculer, Fable ou des produits similaires intervenir dans le processus de decision en supply chain.
Par exemple, si vous etes directeur supply chain, vous voulez bien sur savoir si l’entreprise fera un bon chiffre d’affaires, si l’annee sera profitable. Mais n’importe quel jour, si vous avez 10 000 produits et 10 emplacements, cela fait beaucoup de combinaisons SKU-emplacement possibles a considerer, puis il faut prendre des decisions a partir de ces informations. Donc, en termes d’experience vecue et de problemes de decision, vois-tu des outils comme Fable, je ne parle pas de Fable specifiquement mais de produits LLM de ce genre, aider dans ces situations ?
Joannes Vermorel: Oui, absolument. Meme chez Lokad, nous utilisons ces outils LLM comme outils de productivite depuis plus d’un an. Ils peuvent maintenant quasiment remplacer un data analyst junior, c’est completement clair. Ces grands modeles, lorsqu’il s’agit de mathematiques avancees ou de statistiques avancees, sont deja completement surhumains sur certains aspects du travail, et ils le sont depuis un bon moment. Quand je dis un bon moment, encore une fois, c’est il y a environ un an.
Conor Doherty: D’accord. Ce n’est pas si long pour des entreprises qui ne bougent pas par cycles d’un an.
Joannes Vermorel: Oui, mais ce n’est pas tout frais, et ce n’est pas lie a la derniere version de Fable.
Conor Doherty: D’accord.
Joannes Vermorel: C’est le cas depuis plus d’un an.
Conor Doherty: D’accord.
Joannes Vermorel: Et je pense que ce que cela a change, c’est que toutes les metriques de vanite, qui occupaient des gens dans les entreprises… Le CFO veut des tonnes de metriques de vanite. Le CEO veut des tonnes de metriques de vanite, et chaque directeur a ses metriques favorites qu’il veut suivre. Dans les entreprises classiques, vous vous retrouvez avec une division business intelligence qui emploie potentiellement des dizaines de personnes. Quand je mentionne une entreprise, j’imagine une entreprise nord-americaine d’environ un milliard de dollars de chiffre d’affaires annuel.
Donc, avec un milliard de dollars de revenus annuels, boum, vous avez 10 a 20 personnes qui font essentiellement de la business intelligence et construisent des rapports demandes par les differents directeurs. En general, ces rapports sont tres transitoires: on les veut une fois, ou peut-etre a nouveau l’annee suivante. C’est exactement le genre de choses que les agents vont completement automatiser. En supply chain, les agents peuvent apporter un enorme gain de productivite entre de bonnes mains. Si vous donnez un agent a un supply chain scientist tres capable chez Lokad, ces personnes peuvent faire de grandes choses avec ces agents.
Parce que les supply chain scientists sont deja dans l’etat d’esprit suivant: nous construisons, et c’est notre etat d’esprit depuis plus d’une decennie, une decennie et demie en fait, une recette numerique qui traite le probleme de bout en bout. Maintenant, avec un agent de code, je peux simplement faire cela beaucoup plus vite, et oui, c’est formidable. C’est un gain massif. Cela fonctionne. Si vous voulez appliquer la meme idee dans une organisation ou les decisions supply chain sont prises manuellement, alors le LLM aide a peine.
Nous revenons a des choses discutees dans des episodes precedents. Les LLM sont assez lents lorsqu’il s’agit de revisiter des tonnes de choses. Le LLM peut etre surhumain pour ecrire le script qui fait votre prevision economique, qui construit votre recette numerique et genere toutes les decisions sans supervision. Oui, absolument. Mais si vous voulez que les LLM vous accompagnent dans votre maniere traditionnelle de faire de la supply chain, c’est-a-dire parcourir ligne par ligne une longue feuille de calcul pour ajuster les min et max des positions de stock, cela ne mene nulle part.
Cela ne mene nulle part. Si vous voulez que le LLM soit utile, vous devez adopter le paradigme d’une prise de decision sans supervision, ou les decisions sont pilotees par une recette numerique qui n’est pas un LLM, mais typiquement du logiciel classique, sauf que ce logiciel classique est desormais ecrit en partie avec un agent de code.
Conor Doherty: D’accord. Je veux resserrer la question, parce que je pense que tu as repondu a beaucoup de choses, mais je veux etre tres clair pour ceux qui vont poser cette version de la question. Je vais prendre des chiffres tres ronds pour rendre cela tres simple. Tu as donne l’exemple d’une entreprise nord-americaine faisant, disons, cent millions de revenus par an.
Un milliard, pardon, un milliard, avec les grands. Nous travaillons avec les grands. Donc, un milliard. Disons que cette entreprise utilise Fable un jour et qu’on lui dit: “L’annee prochaine, vous ferez aussi 1,1 milliard de chiffre d’affaires. C’est notre prevision de revenus.” Supposons que cette entreprise ait 10 000 SKU et 10 emplacements. Cela fait 100 000 combinaisons SKU-emplacement.
Savoir que je pourrais faire 1,1 milliard de revenus l’annee prochaine est une information. C’est certainement agreable. C’est 10% de plus que l’an dernier. Tres bien.
Mais ou dois-je envoyer les unites que j’ai aujourd’hui ? Est-ce que j’envoie celle-ci a…
Joannes Vermorel: Oui, au magasin de La Nouvelle-Orleans. C’est ce que je disais sur les metriques de vanite. Et c’est le probleme des previsions nues: les previsions nues sont inutiles, parce qu’elles ne peuvent pas etre utilisees. Si vous abordez le probleme incorrectement, avec le paradigme classique de planification ou vous dites: je connais le futur, puis j’orchestre, alors oui, cela peut etre utilise.
Mais ce paradigme est casse. Il est casse parce que votre nombre, quand vous le posez, vous supposez qu’il n’est pas seulement approximatif. Vous dites: je connais le futur et j’ai quasiment 0% d’erreur. Mais vous savez qu’il y a de l’erreur.
Donc cela ne fonctionne pas. Si vous projetez 10% de croissance, tres bien, mais ce n’est pas une information pertinente. Elle ne cascade pas en decisions. Je ne peux pas lui faire faire quelque chose qu’elle ne peut pas faire, et ce n’est meme pas au bon niveau d’agregation, parce que vos decisions vivent a l’echelle quotidienne et a la granularite du SKU. Votre prevision macro est donc sans pertinence. C’est pourquoi je parle de metriques de vanite.
Elles sont pour les directeurs. Elles servent a la comprehension humaine de haut niveau, et c’est tres bien. C’est parfaitement acceptable, et les agents peuvent faire cela. Boum. Ensuite, vous avez l’automatisation reelle des decisions supply chain, les milliers, dizaines de milliers, voire millions d’allocations quotidiennes de ressources.
Cela necessite un autre logiciel, ce que nous appelons chez Lokad les recettes numeriques, parce que c’est un melange d’algorithmes de machine learning, d’algorithmes d’optimisation, de traitement de donnees pour preparer les donnees, etc. Le LLM peut vous aider a composer ces recettes numeriques, sans probleme. Ensuite, ces recettes numeriques s’executeront independamment du LLM, sans probleme. Mais pour que cela fonctionne, il faut aborder le probleme avec l’idee que les decisions supply chain, les allocations de ressources, sont pilotees par des decisions sans supervision qui sont la consequence d’une recette numerique ecrite. C’est tout ce que je dis.
Je ne sais pas si cela clarifie. Le paradigme que je viens de decrire avec la recette numerique est incompatible avec le paradigme classique qui dit: je connais le futur et je peux simplement orchestrer l’allocation des ressources. Ces deux paradigmes ne sont pas compatibles. Vous ne pouvez en choisir qu’un.
Conor Doherty: Je pense que la confusion peut venir de ton usage du verbe “utiliser”. Tu dis qu’une prevision, une prevision nue, ne peut pas etre utilisee. Quelqu’un qui entend cela pourrait penser: mais nous utilisons aussi la prevision probabiliste, par exemple, nous utilisons evidemment cette information au service d’autre chose. Donc clarifie ce que tu veux dire par: on ne peut pas utiliser cette information.
Joannes Vermorel: Chaque fois que les gens mentionnent la prevision, c’est implicitement une prevision de series temporelles, relativement agregee. Toujours. Il y a tellement d’hypotheses. Ce sera une serie temporelle equidistante: prevision par jour, par semaine, par mois. En theorie, on pourrait considerer des previsions de series temporelles avec un temps non equidistant. Je n’ai jamais vu personne l’utiliser en pratique.
Donc, lorsque nous utilisons le terme prevision, il vient avec des hypotheses mathematiques extremement etroites, comme quand vous dites stock de securite, cela signifie distribution normale. Oui, un mathematicien dira qu’en theorie, en principe, vous pouvez avoir un stock de securite qui ne suit pas une distribution normale. Oui, sauf que 99% des logiciels du marche, quand ils disent stock de securite, c’est une distribution normale.
Donc j’utilise le terme dans le sens generalement compris. Quand je dis prevision et que je dis que la prevision nue est un anti-pattern, nous parlons de previsions de series temporelles equidistantes. Et ce sera a un niveau d’agregation ou vous regardez des series temporelles qui ne sont pas tres clairsemees.
Quand les gens pensent a une serie temporelle, ils imaginent quelque chose qui ressemble a une courbe. Mais si vous etes au niveau du SKU, ce que vous avez, ce sont surtout des zeros et occasionnellement un un. Si vous regardez la serie temporelle d’un SKU sur une annee, c’est 90% de zeros et parfois des uns qui representent le fait que vous avez servi ou vendu une unite. Ce n’est absolument pas ce que les gens ont en tete quand ils pensent serie temporelle. Dans la video de code qu’ils ont montree pour leur prevision, ils avaient une tres belle serie temporelle lisse et hyper-agregee.
Encore une fois, c’est exactement ce que les gens ont en tete, pas la situation super desagreggee que vous rencontrez en supply chain aux granularites qui comptent pour la decision d’allocation de ressources. Donc quand vous voulez faire des predictions, j’utilise volontairement ce terme, different de previsions, a la granularite qui compte pour vos decisions, alors cet instrument mathematique est si radicalement different de la prevision de series temporelles, de ce que les gens appellent en pratique prevision, qu’il vaut mieux l’appeler autrement, parce que ces choses n’ont presque rien en commun.
Conor Doherty: D’accord. Quand nous parlons de decisions supply chain, j’ai note une courte liste de celles qui parleraient, je pense, a la majorite des gens dans la supply chain. Nous parlons de quoi acheter, a quel fournisseur acheter, quand commander, ou placer le stock, quoi fabriquer, quoi accelerer, quoi solder. Nous pouvons continuer, mais ce sont juste…
Joannes Vermorel: Oui, nous pourrions continuer.
Conor Doherty: Ce sont sept exemples, n’est-ce pas ? La vraie question est donc…
Joannes Vermorel: Et a quel prix.
Conor Doherty: Et a quel prix, exactement. Dois-je garder ces articles aujourd’hui ou changer de fournisseur ? Il y a toutes ces classes differentes, et des effets de deuxieme, troisieme, quatrieme ordre. On peut devenir tres meta, mais prenons simplement ces sept exemples tres concrets que les gens peuvent se representer. Avec ces exemples en tete, me dire que mon chiffre d’affaires l’an prochain sera de 1,1 milliard, c’est une information, mais est-ce que cela me rapproche de la capacite a repondre finement a ces questions au quotidien ? Et si la reponse est non, pourquoi ? Parce que si je regarde cette video, je pourrais avoir cette impression.
Et je ne m’en prends pas a Anthropic. Je prends simplement un exemple qui m’a ete presente: qu’est-ce que cela dit d’entreprises comme Lokad ? Eh bien, nous ne vendons pas une information isolee du type “voici votre chiffre d’affaires l’an prochain”. Nous vendons essentiellement les reponses a ces questions.
Joannes Vermorel: Oui. Le point ici est que l’intuition de beaucoup de gens en matiere de statistiques de haute dimension est tout simplement fausse. Prenons une image. Vous pensez a un film comme une serie d’images.
Imaginez que vous avez une image, une frame, et que vous voulez prevoir les pixels de la frame suivante. Le chiffre d’affaires de l’annee prochaine, c’est simplement la couleur moyenne de votre image. Votre couleur moyenne sera quelque chose comme une nuance de gris. C’est la moyenne sur toute l’image.
Conor Doherty: Oui.
Joannes Vermorel: Maintenant vous prevoyez la nuance de gris qui sera la couleur moyenne de toute la frame suivante. C’est votre prevision de chiffre d’affaires. Est-ce que cela vous aide a prevoir les pixels, pixel par pixel, de l’image suivante ?
Pas du tout. Pourquoi ? Parce que si vous agregez tout, si vous reduisez toute votre image a une couleur moyenne…
Conor Doherty: Oui.
Joannes Vermorel: Vous avez perdu l’image. Vous ne voyez plus rien. Donc, pour projeter a quoi ressemblera la frame suivante, faut-il repartir de la couleur moyenne ? Certainement pas.
Vous voulez repartir de l’information la plus granulaire, c’est-a-dire les pixels eux-memes. Et l’idee que vous pouvez avoir une prevision moyenne tres precise de la frame suivante, pour la couleur moyenne, oui. Pourquoi ? Parce que la couleur moyenne d’une frame a l’autre est a peu pres la meme.
Tant que vous ne changez pas ce que vous regardez, ce sera quasiment la meme couleur moyenne. Meme si beaucoup de choses changent d’une image a l’autre, si vous faites la moyenne de toute l’image, c’est presque identique d’une frame a l’autre, sauf si vous coupez et changez de perspective. Donc, quand les gens pensent a prevoir le chiffre d’affaires, oui, vous pouvez le faire. Pouvez-vous avoir une prevision relativement precise ? Peut-etre, parce que c’est hyper-agrege. Mais cette prevision hyper-agregee sera-t-elle utile lorsque vous revenez au niveau super desagrege, qui serait l’equivalent des pixels dans notre image ? La reponse est non.
Encore une fois, pour comprendre pourquoi, pensez au passage d’une frame a la suivante dans une image. Demandez-vous si votre logique pour predire l’image suivante doit passer par l’idee de tout reduire a la couleur moyenne. La reponse est non. Je veux formuler cela tres concretement.
Imaginez que j’ai un abonnement commercial a n’importe quel outil d’IA disponible sur le marche. Je ne vise personne en particulier. Je suis dans cette entreprise au milliard de chiffre d’affaires, j’ai un abonnement a un outil d’IA commercialement disponible, et je dis: “Voici l’acces.” Je cree une API, je lui donne acces a mon ERP, a toutes mes donnees transactionnelles historiques, et je dis: “Je veux savoir ou envoyer toutes ces unites demain. Ou plutot, je dois passer une commande fournisseur demain. Dis-moi ce que je dois acheter et en quelles quantites. Tu peux utiliser n’importe quel modele de prevision. Je simplifie beaucoup la question, mais tu peux utiliser le paradigme de prevision que tu veux. Donne-moi simplement une commande d’achat optimisee.”
Est-ce que cela fonctionnerait ? Je realise que c’est une question simple, mais c’est la facon dont beaucoup de gens envisagent la chose. Ce n’est pas dire qu’ils ont tort, mais ils veulent savoir quel benefice ils tirent de cette technologie.
Joannes Vermorel: A l’heure actuelle, je soupconne que cela ne fonctionnerait pas, sauf si vous orientez le modele vers des decisions sensees. Il y a trop de choses que ces LLM, bien qu’extremement bons, ne savent pas. Ils ne sont pas patients. Il faut guider le modele. Par exemple, le LLM ne peut pas deviner que vous avez un CRM en production depuis sept ans tant que vous ne le dites pas.
Si vous dites “toutes mes donnees sont dans l’ERP”, mais qu’en realite une grande partie des donnees est dans le CRM, et que vous n’avez jamais dit au LLM qu’il devait aussi regarder le CRM, alors il ne le sait pas. Vous pouvez etre tres malin dans votre prompting. Vous pouvez passer en mode inverse et dire: “Je veux faire cela. Pose-moi toutes les questions auxquelles tu veux que je reponde. Je ferai de mon mieux”, puis laisser l’agent prendre le relais. Cela peut fonctionner dans une certaine mesure.
D’apres ma propre experience, meme avec les dernieres versions, comme Astra d’OpenAI qui est presque dans une classe a part, il faut encore un pilotage de haut niveau. Mais c’est bon. Et je pense que si vous vouliez obtenir de bons resultats, ce que vous devriez demander a un outil comme Astra serait: “Aide-nous a reproduire ce que fait Lokad.” Pour de petites configurations, je soupconne que cela pourrait vous mener assez loin. Le probleme, encore une fois, c’est la maintenabilite et l’auditabilite.
Vous voyez, c’est une preoccupation cle. Et ici, si vous demandez aujourd’hui a un agent tres intelligent simplement: “Reproduis Lokad pour moi”, dans une certaine mesure il pourrait reussir. Peut-etre pas pour traiter des teraoctets de donnees, parce que cela cree toutes sortes de complications. Mais en supposant que vos donnees tiennent confortablement sur une station de travail puissante ou l’agent de code s’execute, vous pourriez probablement aller assez loin. Le defi sera de gerer l’intelligence obscure.
C’est un defi chez Lokad. Nous travaillons dessus depuis une decennie et demie. Ce probleme existait deja avant les LLM. Comment s’assurer que la recette numerique reste sous controle, que vous comprenez ce qui se passe ? D’ailleurs, vous pouvez avoir ce probleme avec des humains: un collegue fait quelque chose d’extremement sophistique et complique, puis cette personne part, et plus personne n’a la moindre idee de pourquoi cela fonctionne ni comment cela fonctionne. C’est un probleme tres reel avec ce que j’appellerais l’intelligence obscure.
Quand vous vibe-codez quelque chose de tres sophistique, vous pouvez avoir beaucoup de mal a le maintenir dans le temps. Le LLM lui-meme, lorsqu’il revisite ce code, car il faut comprendre que les LLM sont en quelque sorte sans etat, verra a chaque fois le code comme s’il le decouvrait pour la premiere fois. La prochaine fois que l’agent revisite la base de code, il peut se perdre et se demander: pourquoi cela a-t-il ete fait comme ca ? Je ne sais pas.
Avec le niveau d’intelligence agentique que nous avons aujourd’hui, je pense qu’il n’est pas raisonnable de se passer d’une supervision humaine de haut niveau pour des processus critiques. Ce serait mon point de vue. Vous pouvez faire yolo et dire: “Je vais faire confiance a l’agent.” Il va vibe-coder tout le systeme, mais je soupconne que c’est une recette pour le desastre, simplement parce que nous n’en sommes pas encore la en termes d’intelligence agentique. Et les gens ne realisent peut-etre pas qu’une partie des problemes, quand on utilise des agents tres intelligents, c’est qu’au moins la moitie des betises qu’ils font vient de vous.
C’est parce que vous suggerez quelque chose de stupide. Encore une fois, l’agent est tres docile. Il fera les choses stupides, et c’est un gros probleme. Les agents manquent encore de capacite a resister aux demandes humaines stupides. Ils n’ont pas de mode pour cela.
Peut-etre que les futurs modeles auront un mode “contestation”, mais aujourd’hui c’est encore tres faible. Cela signifie que vous etes a une mauvaise requete de faire quelque chose de tragiquement mauvais pour votre base de code.
Conor Doherty: En parlant de supervision de haut niveau, cela me rappelle le fait que le directeur commercial de Lokad, Fabian Hoehner, et moi allons faire une demo en direct du compte aerospace de Lokad. En preparation, lui et moi en discutions, et il a mentionne que, comme dans n’importe quelle autre verticale ou Lokad opere, les decisions sont generees automatiquement, mais qu’a cause de la valeur de chaque decision individuelle dans l’aerospace, elles sont quand meme verifiees. Par exemple, si la decision est d’acheter une unite et que cette unite coute 100 000 dollars, elle sera probablement verifiee, non pas parce qu’on ne fait pas confiance au systeme, mais parce que le cout de l’erreur est tres eleve. Dans d’autres verticales, acheter une unite peut ne couter que quelques centimes, selon les remises par quantite.
Donc, quand nous parlons d’IA qui commoditise beaucoup de ces taches, vois-tu certaines verticales comme etant plus facilement absorbees par ce type de technologie que d’autres ?
Joannes Vermorel: Evidemment, certaines verticales sont tres orientees ingenierie: oil and gas, aviation, electronique grand public. Je soupconne aussi l’e-commerce. Ces entreprises seront probablement en premiere ligne pour tout automatiser. Ensuite viendront les industries ou c’est simplement tres fastidieux parce qu’il y a trop de choses, comme la fast fashion.
Conor Doherty: C’est justement l’exemple que j’avais en tete.
Joannes Vermorel: Oui, cela viendra. Les gens y sont peut-etre moins orientes technologie, mais la complexite rend ces technologies extremement attirantes, parce que sinon c’est extremement fastidieux. Et en dernier, nous finirons probablement, comme c’est tres souvent le cas, avec les entreprises FMCG, qui sont en retard parce qu’elles traitent comparativement peu de produits avec de tres gros volumes.
Donc meme si la productivite n’est pas bonne, l’impact est moindre que dans d’autres verticales.
Conor Doherty: Je t’ai demande plus tot, dans le cadrage de la discussion, quelle serait la consequence potentielle de ce type de technologie sur les vendeurs du secteur. Supposons, pour les besoins de la discussion, que la direction soit reelle: cette technologie va devenir de mieux en mieux, ce qui sera probablement le cas. Cela signifie, si l’on prend la video de Fable comme exemple, que le tri et le nettoyage des donnees deviennent plus rapides et moins chers, que les previsions deviennent plus rapides et moins cheres, que la generation de rapports et les backtests se font en quelques secondes, automatiquement, en un clic.
Tres bien. Supposons que tout cela soit vrai et devienne tres bon. Qu’est-ce qui devient moins precieux dans cet espace, du point de vue de l’offre des vendeurs, et qu’est-ce qui devient plus precieux ?
Joannes Vermorel: Mon point de vue, c’est que 90% de ces vendeurs vont faire faillite.
Conor Doherty: D’accord.
Joannes Vermorel: Mais pas a cause de cela. Ils feront faillite parce que leurs propres clients feront faillite.
Conor Doherty: Tres different.
Joannes Vermorel: La facon dont je le vois, et c’est quelque chose dont je parle depuis quelques annees, c’est que, surtout avec ces agents, plus de 90% du travail de bureau va s’evaporer. Et cela pourrait meme etre plus que ca. Il y a quelques annees, je prevoyais 90%. Maintenant, nous sommes au-dela. Franchement, si l’on regarde ce que les gens font en moyenne, c’est probablement plus de 90% du travail de col blanc qui peut etre completement automatise.
Cela signifie que certaines entreprises vont l’adopter, et beaucoup ne le feront pas. Si vous regardez l’histoire de l’innovation, vous pourriez penser que l’electricite etait evidente. Mais a la fin du XIXe siecle, la reponse a ete que la plupart des entreprises ont fait faillite et n’ont pas adopte l’electricite. Meme chose avec la revolution suivante, l’automobile. La plupart des entreprises n’ont pas adopte l’automobile et ont fait faillite, etc.
Ce cycle s’est repete encore et encore avec les grands changements technologiques. La realite est que la plupart des entreprises ne reussissent jamais le saut et disparaissent. Je pense que, dans ma vie, l’IA sera probablement le plus grand de ces sauts. Je peux imaginer un saut technologique encore plus important, mais franchement celui-ci parait absolument massif, parce que dans les economies modernes comme la France ou les Etats-Unis, les cols blancs representent 80% de la main-d’oeuvre. Et nous parlons d’en automatiser 90%.
L’impact sera donc absolument immense. Ma vision est qu’un petit nombre d’entreprises adopteront vraiment ces choses, les embrasseront, et pousseront toutes les autres a la faillite. C’est une revolution schumpeterienne, cela arrivera. Je ne predis pas un chomage de masse, parce que d’autres entreprises apparaitront. Le marche resoudra cela assez proprement, comme il le fait: beaucoup d’entreprises font faillite, les gens sont au chomage quelques mois, puis retournent dans d’autres entreprises, parce que les entreprises gagnantes embaucheront massivement pour d’autres postes.
Pour revenir aux vendeurs, si l’on reprend le debut de cette discussion, la plupart des vendeurs dans le domaine des logiciels enterprise de supply chain etaient deja obsoletes il y a 20 ans. Donc une revolution technologique supplementaire change-t-elle quelque chose ? Non. Si vous etes deja obsolete de 20 ans, le fait de devenir obsolete de 30 ans, tant que vos clients acceptent de payer pour des choses obsoletes…
Je lis encore dans l’actualite que pour les systems of record, c’est-a-dire des choses comme SAP, qui sont les choses les plus faciles a vibe-coder, cela fonctionne magnifiquement. Cela fonctionne magnifiquement depuis des annees. Je dis qu’il y a eu une rupture agentique il y a un an, mais meme avant cela, les logiciels CRUD pour systems of record etaient deja devenus triviaux depuis au moins deux ou trois ans. Donc, si votre entreprise depense encore plus d’un million de dollars par an, quelle que soit sa taille, pour un system of record, c’est une depense insensee.
C’est une perte pure. Vous depensez simplement votre argent pour quelque chose de frivole. Aucun system of record ne vaut plus d’un million par an. Si vous avez vraiment beaucoup de donnees, on peut discuter des couts materiels, mais avec un million par an pour des enregistrements, vous pouvez presque gerer tous les enregistrements transactionnels de Walmart avec ce budget.
Cela pose vraiment la question: de quels enregistrements parlons-nous ? Si vous dites avoir besoin d’un budget superieur a celui necessaire pour stocker les donnees de Walmart, representees intelligemment, pas de facon super gonflee, alors il y a un probleme. Les agents de code sont tres bons pour optimiser le code. Ils pourraient faire cela.
Donc, pour revenir au tableau d’ensemble, mon avis est que les vendeurs qui vendent des produits obsoletes continueront a vendre leurs produits obsoletes, comme ils l’ont fait ces 20 dernieres annees. Cette mascarade ne prendra fin que lorsque leurs propres clients feront faillite, parce qu’au bout du compte le marche n’est pas un grand educateur, c’est simplement un filtre. Les entreprises qui operent avec des paradigmes obsoletes auront comme consequence, au lieu d’une reduction de 90% de la main-d’oeuvre pour la plupart des fonctions, une reduction de 5%. Elles n’auront qu’une amelioration cosmetique.
Or ce n’est pas ce qu’il faut viser. Aujourd’hui, avec les outils disponibles, un projet IA typique, quand vous attaquez une fonction dans l’entreprise, devrait etablir comme baseline, je ne sais pas, au minimum diviser les effectifs par deux. Si vous menez un projet de deploiement IA et qu’a la fin les effectifs de la fonction que vous voulez augmenter avec l’IA n’ont pas ete divises par deux, c’est un echec abject. Deux, ce n’est vraiment pas ambitieux aujourd’hui pour ce type d’automatisation.
Plus raisonnable serait 75%, et l’objectif long terme, disons a trois ou cinq ans, serait 90%. Oui, reduction des effectifs. Encore une fois, nous parlons de choisir selectivement une fonction ou l’IA peut etre utilisee. Et pour beaucoup de choses, il y a une facon de l’utiliser. Diviser les effectifs par deux n’est meme pas vraiment ambitieux. Le probleme aujourd’hui est que beaucoup d’entreprises ne voient absolument pas ces resultats, parce que leur approche de l’IA et de l’automatisation est, en termes de paradigme, extremement obsolete.
Conor Doherty: Nous parlions des vendeurs, et cette conversation est nee d’une video envoyee par un ami de la chaine pour avoir notre reaction. Il y avait une question qu’il voulait que je te pose, et je terminerai avec elle. Imagine que demain un vendeur entre dans le bureau de mon patron et dise: “Notre IA planifie autonomement votre supply chain.” Que devrais-je lui demander de demontrer ?
Joannes Vermorel: La question a poser est: comment ? Il faut comprendre comment, ce qui se passe sous le capot. Pour contexte, c’est une entreprise de wholesale. Il faut comprendre ce qui se passe sous le capot. “Expliquez-moi pas a pas. Je veux comprendre.” Et ensuite, pouvons-nous avancer sur une trajectoire ou vous vous engagez a livrer les economies d’effectifs dont nous avons discute ensemble ?
Et inversement, il y a des drapeaux rouges. Si le vendeur facture par siege, cela signifie qu’il est dans son interet de minimiser la productivite, de s’assurer qu’il y ait autant de personnes que possible, et de maintenir les effectifs et le nombre de comptes.
Conor Doherty: Oui.
Joannes Vermorel: Exactement. Autre drapeau rouge: si le vendeur dit “nous allons augmenter ce que font vos collaborateurs.” Drapeau rouge absolu. Ce n’est pas comme cela que cela fonctionnera. Vous ne pouvez pas obtenir 90% de reduction d’effectifs en disant que vous augmentez la productivite des gens. Il faut repenser le travail.
C’est pourquoi je dis: expliquez-moi comment vous y parvenez. Idealement, la perspective a cinq ans est 90%. Ce serait une bonne baseline: 90% de reduction d’effectifs. Nous sommes 20 personnes; dans cinq ans, nous serons deux. Dites-moi exactement comment cela fonctionne, ce que fait votre systeme, et pourquoi vous etes convaincu qu’avec deux personnes sur 20, nous pourrons operer.
Conor Doherty: Donc une autre personne dans ton exemple. Oui.
Joannes Vermorel: Oui. Et en general, les vendeurs de logiciels enterprise poussent des technologies tellement obsoletes que lorsque vous demandez ce qui se passe sous le capot, vous realisez tres vite que c’est extremement obsolete. Et aujourd’hui, la magie de ChatGPT, c’est que meme s’il y a des termes techniques que vous ne comprenez pas, vous pouvez simplement enregistrer la conversation et demander a ChatGPT une evaluation. ChatGPT vous donnera une evaluation raisonnablement solide. Demandez-lui simplement d’adopter une posture adversariale, sinon il sera beaucoup trop gentil dans sa critique.
Vous pouvez poser la premise: “Cher ChatGPT, ce vendeur gonfle probablement ses affirmations et embellit la situation. Sois impitoyable et critique ce qui m’est presente.” Vous obtiendrez une critique decente, mais il faut regarder ce qui se passe sous le capot.
Conor Doherty: Pour etre juste, et pour faire echo a cette idee, il n’a jamais ete aussi simple d’obtenir une etude de marche assez solide sur presque n’importe quel vendeur.
Joannes Vermorel: Oui.
Conor Doherty: Et vous n’avez meme pas besoin du modele le plus puissant. Nous ne sommes pas sponsorises par ChatGPT, pardon, par OpenAI, mais vous n’avez meme pas besoin du modele le plus sophistique de ChatGPT. Voici un vendeur, voici son site web, evalue-le, donne-moi un rapport de marche, compare-le a ses pairs.
Joannes Vermorel: Mais attention, il faut demander une posture adversariale, sinon ChatGPT est beaucoup trop confiant. Il faut dire: ne fais pas confiance aux case studies, ne fais confiance a aucune affirmation du vendeur.
Conor Doherty: Exactement.
Joannes Vermorel: Assure-toi de fonder ton evaluation sur des faits. A quoi ressemble la technologie ? Suppose le pire. Chaque fois qu’une technologie n’est pas decrite, suppose que c’est une moyenne mobile. Chaque fois que quelque chose…
Conor Doherty: Non, c’est du logiciel enterprise. C’est fonctionnel.
Joannes Vermorel: C’est fonctionnel. Oui. Le logiciel enterprise fonctionne comme ca. Si le vendeur ne donne pas les details, il n’y a pas de recette magique.
Il n’y a pas d’ingredient magique, comme une technologie hyper avancee. Non, non. “C’est une IA speciale.” Non, non. Supposez le pire. Par exemple, s’il n’y a pas de documentation technique, il faut supposer que c’est un cauchemar et que c’est pour cela qu’ils ne publient pas leur documentation technique: le produit est un gros tas de boue, et le vendeur a tellement honte qu’il ne veut pas la rendre publique.
Il faut donc demander a ChatGPT d’adopter cet etat d’esprit adversarial. Fonde ton evaluation sur ce que tu peux observer. Assure-toi que c’est factuel. Sois extremement sceptique face a toute affirmation, surtout les case studies. Suppose que toutes les case studies sont fabriquees, parce que souvent elles le seront, ou au minimum raisonne a partir des premiers principes.
Raisonner a partir des premiers principes signifie: le vendeur dit qu’il fait tout dans une base SQL. Est-ce vraiment compatible avec des technologies avancees de machine learning ? Demandez a ChatGPT de raisonner a partir des premiers principes. Regardez ce qu’ils font, et a partir de la extrapolez si ce qu’ils disent est vraiment credible ou non, et si cela permettra d’atteindre cette reduction de 90% des effectifs dans cinq ans, qui devrait etre l’horizon.
Conor Doherty: Quand nous publierons cet enregistrement, je ferai faire par ChatGPT un resume de ce diagnostic et nous le publierons avec ce clip pour promouvoir ce podcast, parce que je pense que c’est a la fois tres fonctionnel et tres accessible. Tu ne dis pas qu’il faut passer au crible des petaoctets de donnees ou devenir expert en prevision. Il fut un temps ou l’on pouvait dire: oui, il faut avoir davantage de sympathie mecanique, ce qui est toujours bon, et cela reste toujours bon, mais realiste ment, la plupart des gens ne le feront pas. En revanche, il y a tres peu d’excuses pour dire: je n’ai litteralement pas 60 secondes pour examiner ce sur quoi je m’apprete a depenser peut-etre plus d’un million de dollars.
C’est vraiment un peu fort.
Joannes Vermorel: Il faut simplement garder en tete que, par defaut, et c’est la raison pour laquelle je dis qu’il faut prompter tous les modeles comme cela, tous ces LLM sont essentiellement fine-tunes pour etre gentils, dociles, doux et non antagonistes. En consequence de ce comportement par defaut, peut-etre parce que vous posez une question sur votre collegue et que votre collegue est la pour regarder, ils n’essaient pas de presenter les choses sous un mauvais jour par defaut.
Mais si vous les poussez avec un prompt tres specifique, aucun probleme. Le modele peut livrer une critique dure de n’importe quoi. Mais il faut aider et orienter un peu le modele, parce que le fine-tuning par defaut, et c’est le cas de presque tous les modeles a ma connaissance, consiste a etre relativement doux, gentil et positif sur les choses.
Conor Doherty: De facon generale, tu lances ce defi avec, je suppose, un degre de confiance enorme dans le fait que Lokad ne tombera pas sous ce standard.
Joannes Vermorel: Oui, c’est une bonne position. Je souligne simplement que, comparativement, j’ai deja soumis Lokad a ce genre de stress test par le passe. Je n’ai pas teste les derniers modeles, Astra d’OpenAI ou les derniers d’Anthropic, mais Lokad s’en sortait correctement dans ce stress test.
Conor Doherty: D’accord. Je n’ai pas d’autres questions, Joannes. Si quelqu’un m’envoie le feedback qu’il a obtenu de ChatGPT, je te le transmettrai directement pour commentaire, et nous en reparlerons une autre fois. Comme toujours, un plaisir. Et a vous qui nous regardez, merci beaucoup.
Si vous voulez contacter Joannes et moi, si vous voulez partager avec nous votre feedback de LLM.