Back to Lokad TV


00:00:00 Einfuehrung
00:02:49 Kann Claude wirklich prognostizieren?
00:07:49 Verarbeiten LLMs wirklich Zahlen?
00:09:12 Wie wird KI Prognoseanbieter beeinflussen?
00:14:38 Was ist der Unterschied zwischen Prognose und Planung?
00:18:03 Koennen LLMs Supply-Chain-Entscheidungen unterstuetzen?
00:22:31 Von Umsatzprognosen zu taeglichen operativen Entscheidungen
00:27:11 Warum sind nackte Prognosen unbrauchbar?
00:30:12 Granulare Supply-Chain-Entscheidungen prognostizieren
00:34:57 Kann eine KI eigenstaendig Bestellungen erzeugen?
00:42:24 Welche Branchen werden KI am schnellsten einfuehren?
00:44:25 Was wird mehr oder weniger wertvoll?
00:52:48 Wie sollten Unternehmen KI-Anbieter bewerten?
00:55:51 ChatGPT fuer Anbieterrecherche nutzen
00:56:19 Warum adversariales Prompting wichtig ist
01:00:36 Kann Lokad denselben Stresstest bestehen?

Zusammenfassung

Conor Doherty interviewt Joannes Vermorel, CEO und Gruender von Lokad, zu Claude Fable 5.1 und dessen beworbenen Prognosefaehigkeiten. Joannes argumentiert, dass der eigentliche Durchbruch in der Faehigkeit von Agenten liegt, Analyse- und Programmieraufgaben zu automatisieren. Sie untersuchen, warum Zeitreihenprognosen keine Supply-Chain-Plaene sind, wie LLMs Entscheidungsautomatisierung unterstuetzen koennen und welche Branchen sie am schnellsten einfuehren duerften. Die Diskussion endet mit einem praktischen Rahmen, um KI-Anbieter herauszufordern, ihre Technologie zu bewerten, messbare Produktivitaetsgewinne zu verlangen und Marketingaussagen mit adversarialen Prompts zu pruefen.

Vollstaendige Transkription

Conor Doherty: Joannes und ich haben gerade unsere Diskussion ueber die Veroeffentlichung von Claude Fable 5.1 durch Anthropic abgeschlossen, genauer gesagt ueber dessen zumindest oeffentlich beworbene Prognosefaehigkeiten. Ausgeloest wurde das Gespraech durch ein Video, das wir von einem Freund des Kanals erhalten haben. Er wollte unsere Meinung, unsere Reaktion auf die Folgen dieses moeglichen Durchbruchs bei Prognosen, der natuerlich auf einem LLM-Modell beruht. Joannes und ich haben darueber gesprochen, und daraus wurde eine breitere Diskussion darueber, wie man Anbieter in diesem Bereich wirklich bewerten sollte, einschliesslich Lokad. Am Ende gab Joannes, denke ich, einen sehr praktischen Leitfaden oder Diagnosetest fuer den Fall, dass man mit einem Vorschlag eines Anbieters konfrontiert wird, der sagt: “Ja, meine KI kann Ihre Supply Chain vollstaendig autonom prognostizieren, planen und von Anfang bis Ende ausfuehren.” Wie gesagt, Joannes hatte einige sehr konkrete und nuetzliche Hinweise, wie man solche Aussagen einem Stresstest unterziehen sollte.

Wenn Sie also sonst nichts aus dieser Folge mitnehmen, bleiben Sie bis zum Ende dabei, oder springen Sie sogar direkt zum Ende, wenn Sie moechten, und nehmen Sie diese praktischen Informationen mit. Und damit kommen wir zum heutigen Gespraech. Joannes, ich habe dich hierher gebeten, um ein Video zu besprechen, das uns von einem Freund des Kanals geschickt wurde. Ich habe es dir weitergeleitet.

Wir haben es privat besprochen, und jetzt setzen wir uns hier hin und nehmen einen Podcast dazu auf. Es geht um das Video, das Anthropic veroeffentlicht hat und das die Prognosefaehigkeiten von Claude Fable 5.1 beschrieben oder, sagen wir, beworben hat. Fuer den Rest des Videos sage ich einfach Fable, weil ich nicht in jedem Satz Claude Fable 5.1 sagen moechte, aber ab jetzt meinen wir Claude Fable 5.1. In dieser Demo sieht man, wie es rohe B2B-Daten aufnimmt und dann ueber Nacht unbeaufsichtigt Umsatzprognosen ausfuehrt und Berichte fuer Analysten erstellt.

Diese sollen sie dann pruefen. Es kann seine eigenen Backtests ueber eine einfache ChatGPT-artige Schnittstelle ausfuehren. Das ist alles fantastisch. Der Lokad-Follower schickte es mir und meinte, es waere aus offensichtlichen Gruenden interessant, eure Einschaetzung dazu zu bekommen, denn wenn es kommerziell verfuegbare KI gibt, die im Grunde ueber Nacht unbeaufsichtigt Prognosen erzeugt, die Sprache war “Ergebnisse erzeugt”.

Wir werden gleich darauf eingehen, was Ergebnis bedeutet, Prognose versus Entscheidung und so weiter, aber kommerziell verfuegbare KI, die ueber Nacht Prognosen erstellt: Er wollte unsere Meinung, besonders natuerlich deine, dazu, was das fuer den Markt bedeutet. Also, Joannes, du hast das Video gesehen, du kennst den Kontext. Warst du umgehauen?

Joannes Vermorel: Tatsaechlich ein wenig, ja, denn es ist fairerweise beeindruckend. Es ist sehr beeindruckend. Aber was noch viel beeindruckender ist als das, was dieser Use Case zeigt, ist, dass Prognose nur ein Beispiel ist. Was seit im Wesentlichen letztem September passiert ist, also vor etwa einem Jahr, ist, dass diese Coding Agents inzwischen fuer relativ einfache Aufgaben einen Grad an Autonomie erreicht haben, der absolut beeindruckend ist. Ich wuerde sagen, seit etwa einem Jahr, und das war sogar vor Claude Fable 5.1, gab es den eigentlichen Sprung, etwa im letzten Sommer.

Nicht in diesem Sommer, sondern im davor. Man kann inzwischen relativ einfache Aufgaben stellen, die man einem Business Analyst geben wuerde. Eine davon waere: “Baue mir ein Prognosemodell, stelle sicher, dass es mit unseren historischen Daten per Backtest zusammenpasst, und pruefe das Ganze jeden Tag erneut, damit es relevant bleibt.” Ja, das funktioniert. Was es dann macht: Es baut den Connector, um sich mit den Datenquellen zu verbinden, vorausgesetzt es kann ein paar SQL-Abfragen schreiben.

Es schreibt die Daten in ein paar flache Textdateien, erstellt ein Python-Skript, fuehrt dieses Python-Skript aus, erstellt dann eine kleine Web-Oberflaeche und praesentiert die Ergebnisse in sauber verpackter Form.

Nebenbei baut es auch das Backtest-Werkzeug, um sicherzustellen, dass das Modell hinreichend gut zu den vorhandenen Daten passt. Und mit etwas Separatem, das im Video nicht ganz klar ist, kann man das LLM einfach nach Zeitplan taeglich aufrufen lassen, damit es die ganze Konstruktion erneut anschaut und die Prognose aktualisiert. Aber machen wir uns nichts vor: Die Art von Prognose, die dabei gebaut wird, ist nur ein normales, altes Prognosemodell. Nichts in diesem Video deutet darauf hin, dass Fable hier etwas Besonderes macht. Es wird irgendeine Art regressives Modell mit ein paar Parametern zusammensetzen, um Saisonalitaeten zu beruecksichtigen. Business as usual. Sie erwaehnen einen Monte-Carlo-Prozess mit 1000 Iterationen.

Conor Doherty: Ja, das hat er gesagt.

Joannes Vermorel: Das ist wahrscheinlich einfach die Schleifenkonstante, die sie in Python genutzt haben, um ein paar Iterationen laufen zu lassen. Wieder nichts besonders Ausgefallenes. Was wirklich beeindruckend ist, sind also nicht die Prognoseergebnisse, die ich extrem gewoehnlich finde, sondern die Tatsache, dass man mit diesen Agenten fast alles tun kann, was man einem Business Analyst geben wuerde, und dass man fuer relativ einfache Aufgaben quasi autonom ein recht ordentliches Ergebnis bekommt, vorausgesetzt die Umgebung ist bereits eingerichtet. Denn die Einrichtung der Umgebung ist wahrscheinlich der komplizierteste Teil: Haben Sie zum Beispiel Lesezugriff auf die Datenbank? Sie wollen dem Agenten keinen Schreibzugriff auf Produktion geben.

Hat er also nur Lesezugriff? Ist Python installiert? Ist Node installiert? Haben Sie dies und jenes und all die noetigen Kleinigkeiten? Und wenn Sie das Ergebnis mit Kollegen teilen wollen, brauchen Sie eine Moeglichkeit, diese Web-App bereitzustellen. Sonst laeuft sie nur auf Ihrem Desktop, und wenn Sie sie teilen wollen, muessen Ihre Kollegen vielleicht Git auschecken und genau dieselben Berechtigungen haben. Das Hauptproblem liegt also in der Verrohrung, der Infrastruktur, dem Setup. Aber ja, mit modernen Agenten und modernen LLMs, also State-of-the-Art-LLMs, sind solche Dinge buchstaeblich One-Shots.

Conor Doherty: Ja. Du hast gerade den Ausdruck einfache Aufgaben verwendet. Ich moechte auf etwas zurueckkommen, ueber das wir vor ein paar Jahren gesprochen haben. Ich erinnere mich, als ChatGPT 3.5 herauskam, also Ende 2022, Anfang 2023.

Wir sprachen ueber LLMs, also Large Language Models, und du sagtest damals, dass sie bei textbasierten Aufgaben glaenzen. Jetzt sprechen wir aber darueber, dass LLMs im Grunde Zahlen verarbeiten, mehr oder weniger. Ist das die Aussage, die du machst?

Joannes Vermorel: Nein, es beruehrt fast keine Zahl. Fast keine. Es beruehrt Python.

Conor Doherty: Okay.

Joannes Vermorel: Der Ansatz ist so, dass das Modell fast nie eine Zahl beruehrt. Es erstellt eine SQL-Abfrage, das ist Text. Es erstellt ein Python-Skript, das ist Text.

Es erstellt ein Python-Skript fuer den Backtest, auch das ist wieder Text, und dann bekommt es eine kleine Zusammenfassung der Anpassung, die nur aus einer Handvoll Zahlen besteht. Das kann es verarbeiten. Ein LLM konnte selbst zu GPT-3.5-Zeiten eine halbe Handvoll Zahlen in einem Gespraech verarbeiten. Was es nicht konnte, war Tausende von Zahlen verarbeiten. Aber genau das passiert hier nicht. Fable versucht gar nicht, Tausende von Zahlen zu verarbeiten. Das erledigt ein Python-Skript mit klassischer Ausfuehrung.

Conor Doherty: Okay. Dann kommen wir auf die Ausgangsfrage zurueck: Als uns das Video geschickt wurde, war die ausdrueckliche Frage, wie dieser Durchbruch, selbst wenn er noch recht jung ist, also dieser allgemeine Durchbruch von LLMs in die Prognose, Anbieter in diesem Bereich beeinflusst. Zum Beispiel Anbieter, die Prognosedienste verkaufen: Warum sollte jemand weiter ein Abonnement bei einem Anbieter bezahlen, wenn er einfach ein Anthropic-Abonnement haben kann?

Joannes Vermorel: Zuerst muessen wir festhalten, dass diese Anbieter schon vor 20 Jahren veraltet waren, also lange vor den LLMs. Deshalb ist es vielleicht merkwuerdig: Stellen Sie sich Leute vor, die Schreibmaschinen benutzen, und Apple sagt: Hier ist das naechste iPhone. Wird ein noch besseres iPhone Leute, die immer noch Schreibmaschinen verwenden, davon abhalten, Schreibmaschinen zu verwenden? Nein.

Die grosse Mehrheit der Software rund um Planung im Bereich Supply Chain ist konzeptionell komplett veraltet, und zwar seit buchstaeblich zwei Jahrzehnten. Interessant ist, dass sogar neue Unternehmen in diesem Bereich entstehen und vom ersten Tag an mit Konzepten starten, die vor 20 Jahren schon veraltet gewesen waeren. Das ist verblüffend. Wir haben Wettbewerber, die 2025 oder 2026 gegruendet wurden und mit Konzepten anfangen, die vor 20 Jahren obsolete gewesen waeren.

Der erste Realitaetscheck ist also: Diese Anbieter bleiben im Grunde unberuehrt, denn wenn ihre Kunden auch nur etwas Sinn dafuer haetten, haetten sie schon lange vor den LLMs erkannt, dass diese Anbieter voellig veraltet waren. Deshalb sage ich: Ja, es ist nett, aber es aendert nicht viel. Dann gibt es noch einen anderen Punkt, den wir oft besprochen haben: nackte Prognosen sind ein Anti-Pattern. Der Ansatz, Prognosen ueber Zeitreihen zu machen, ist kaputt. Wir haben das auf diesem Kanal ausfuehrlich besprochen. Es funktioniert einfach nicht. Das Problem ist, dass viele Unternehmen und viele Menschen, wenn man ihnen sagt, dass das Problem das Konzept der Zeitreihe selbst ist, die man loswerden sollte, nicht wirklich folgen.

Kann ein LLM das allerbeste Zeitreihen-Prognosemodell bauen? Absolut. Absolut. Ich waere nicht ueberrascht, wenn man Fable Zeit gaebe, an einem Kaggle-Wettbewerb teilzunehmen, und es ziemlich gut abschneiden wuerde. Vielleicht nicht State of the Art, vielleicht nicht ganz oben, aber ich waere nicht ueberrascht, wenn es in einem klassischen Prognosewettbewerb recht hoch punktet.

Das Problem ist aber, dass die Zeitreihenperspektive defekt ist. Wenn Sie danach fragen, und das ist ein Problem, das LLMs nicht beheben, dann sind LLMs sehr folgsam. Wenn Sie sagen: “Finde mir ein schnelleres Pferd”, dann findet Ihnen das Ding ein schnelleres Pferd. Es mag andeuten, dass Pferde nicht ideal sind, aber letztlich sind diese LLMs, und das ist eine gute Eigenschaft, extrem zahm.

Sie tun, was man ihnen sagt. Das gehoert zum Alignment, und das ist grossartig, weil es sie extrem nuetzlich macht. Aber es bedeutet auch, dass, wenn man nach etwas fragt, das im Wesentlichen eine technologische Sackgasse ist, das LLM sehr gerne genau das liefert. Die Frage ist also: Kann ein State-of-the-Art-Modell die alternativen Ansaetze umsetzen? Absolut. Absolut. Ich sage nicht, dass Fable 5.1 die Alternative nicht kann.

Es ist absolut dazu faehig. Wird es sie tun? Nicht, wenn man es nicht darum bittet. Das Problem ist also nicht Prompting im Sinne von ausgefallenen Prompting-Techniken.

Es geht eher um die hohe Ebene dessen, worum man bittet. Nackte Prognosen sind, wie gesagt, ein Anti-Pattern. Sie wollen keine Zeitreihenprognosen erzeugen. Das ist voellig nutzlos.

Ja, das LLM kann das komplett automatisieren, aber das ist schlicht das Falsche, das automatisiert wird.

Conor Doherty: Die Art, wie du das beschrieben hast, bereitet die naechste Frage gut vor: Was bittest du dieses Werkzeug zu tun? Das kommt zurueck zu etwas, das du am Anfang gesagt hast. Du sagtest sinngemaess: Selbst wenn es prognostizieren kann, heisst das nicht, dass es planen kann. Ich denke, der Unterschied zwischen Prognose und Planung ist es wert, etwas Zeit darauf zu verwenden. Also, statt dass ich es formuliere, erklaere bitte die funktionale Differenz zwischen einem Werkzeug, das eine Prognose erzeugt, und einem Werkzeug, das einen Plan erzeugt, wobei ein Plan vermutlich eine Reihe von Entscheidungen ist, die getroffen werden sollen.

Joannes Vermorel: Leider lautet das Paradigma des Marktes: Die Prognose ist der Plan. Damit sind wir wieder bei defekten Zeitreihen und bei Anbietern, die mit veralteten Paradigmen arbeiten. Das Problem ist so verbreitet, dass sogar Unternehmen wie Anthropic, wenn sie die Faehigkeiten ihres Modells bewerben wollen, auf ein Zeitreihenmodell zurueckgreifen, das komplett kaputt und defekt ist.

Conor Doherty: Nun, es ist das, was der Markt will, oder womit der Markt vertraut ist oder woran er gewoehnt ist.

Joannes Vermorel: Genau. Das ist es, womit der Markt vertraut ist. Aber es ist ein defektes Paradigma. Ich wuerde sogar die klassische Vorstellung von Planung vollstaendig zurueckweisen. Die klassische Vorstellung von Planung ist ein zweistufiger Prozess: Schritt eins, man kennt die Zukunft; Schritt zwei, man orchestriert die Ressourcenzuweisung, um zu dieser Zukunft zu passen und die Einhaltung sicherzustellen.

Planung ist dann im Grunde Prognose plus Orchestrierung. Ich sage, diese Perspektive ist kaputt. Ja, Planung im klassischen Sinne ist mehr als nur Prognose, aber ein Agent kann die Orchestrierung sehr leicht erledigen. Das ist super einfach und wird genauso kaputt sein, weil das Paradigma kaputt ist. Wenn man einen Agenten bittet, in einem kaputten Paradigma zu arbeiten, wird er gerne folgen, aber das Paradigma bleibt kaputt. Es ist also egal, wie klug und faehig der Agent ist.

Er wird nicht die Kapitalrendite liefern, die man erwartet.

Conor Doherty: Ich bitte dich jetzt ein wenig zu spekulieren, denn das Video, das diese Diskussion ausgeloest hat, behandelte ausdruecklich Umsatzprognosen. Es war also keine Nachfrageprognose im eigentlichen Sinne.

Joannes Vermorel: Ja.

Conor Doherty: Und wenn wir in einem Supply-Chain-Kontext ueber Entscheidungen sprechen, ist das hier ein Supply-Chain-Unternehmen, ein Supply-Chain-Kanal. Nachfrage waere natuerlich ein wichtiger Teil dieses Prognoseprozesses. Wenn wir nun ueber den Unterschied zwischen Prognose und Planung sprechen, oder was wir Entscheidungen nennen wuerden, bin ich neugierig, wie du siehst, vielleicht spekulierend, wie Fable oder aehnliche Produkte sich in den Entscheidungsprozess in der Supply Chain einbringen koennten.

Wenn du zum Beispiel Supply-Chain-Direktor bist, willst du natuerlich wissen, ob das Unternehmen gute Umsaetze macht, ob es ein profitables Jahr wird. Aber an jedem beliebigen Tag, wenn du 10.000 Produkte und 10 Standorte hast, gibt es sehr viele moegliche SKU-Standort-Kombinationen, die du betrachten musst, und dann musst du mit diesen Informationen Entscheidungen treffen. Siehst du Werkzeuge wie Fable, nicht unbedingt Fable selbst, aber solche LLM-Produkte, in dieser gelebten Erfahrung und bei diesen Entscheidungsproblemen als hilfreich?

Joannes Vermorel: Ja, absolut. Selbst bei Lokad nutzen wir seit mehr als einem Jahr solche LLM-Werkzeuge als Produktivitaetswerkzeuge. Es kann inzwischen im Grunde einen Einsteiger-Data-Analyst ersetzen, das ist voellig klar. Diese grossen Modelle sind bei fortgeschrittener Mathematik und Statistik in bestimmten Aspekten schon komplett uebermenschlich. Und das schon seit einer Weile. Wenn ich sage seit einer Weile, meine ich etwa ein Jahr.

Conor Doherty: Okay. Nicht so lange, wenn man bedenkt, dass Unternehmen sich nicht in Jahreszyklen bewegen.

Joannes Vermorel: Ja, aber es ist nicht brandneu und es haengt nicht mit der neuesten Fable-Version zusammen.

Conor Doherty: Okay. Es war…

Joannes Vermorel: Es ist seit mehr als einem Jahr der Fall.

Conor Doherty: Okay.

Joannes Vermorel: Was sich veraendert hat: All die Vanity Metrics, fuer die Unternehmen bisher Leute beschaeftigt haben. Der CFO will jede Menge Vanity Metrics. Der CEO will jede Menge Vanity Metrics, und jeder einzelne Direktor hat seine Lieblingsmetriken, die er verfolgen moechte. In klassischen Unternehmen endet man dann mit einer Business-Intelligence-Abteilung, die potenziell Dutzende Leute beschaeftigt. Wenn ich eine Firma meine, stelle ich mir ein nordamerikanisches Unternehmen mit einer Milliarde Dollar Jahresumsatz vor.

Bei einer Milliarde Umsatz hat man schnell 10 bis 20 Leute, die im Wesentlichen Business Intelligence machen und Berichte bauen, die von verschiedenen Direktoren angefragt werden. Meistens sind diese Berichte sehr transient. Man will sie einmal, oder vielleicht naechstes Jahr wieder. Genau solche Dinge werden Agenten komplett automatisieren. In der Supply Chain koennen Agenten in den richtigen Haenden einen massiven Produktivitaetsschub bringen. Wenn man einem sehr klugen und faehigen Supply Chain Scientist bei Lokad einen Agenten gibt, koennen diese Leute grossartige Dinge damit tun.

Denn Supply Chain Scientists sind bereits in der Denkweise: Wir bauen eine numerische Rezeptur, die das Problem von Anfang bis Ende adressiert. Das ist seit mehr als einem Jahrzehnt, eigentlich seit anderthalb Jahrzehnten, unsere Denkweise. Und jetzt kann ich das mit einem Coding Agent viel schneller tun. Ja, das ist grossartig. Es ist ein massiver Gewinn. Es funktioniert. Wenn man dieselbe Idee in einer Organisation anwenden will, in der Supply-Chain-Entscheidungen manuell getroffen werden, hilft ein LLM kaum.

Das ist wieder etwas, das wir in frueheren Folgen besprochen haben. LLMs sind ziemlich langsam, wenn es darum geht, Unmengen von Dingen erneut zu betrachten. Das LLM kann uebermenschlich sein, wenn es darum geht, das Skript zu schreiben, das Ihre wirtschaftliche Prognose erstellt, oder Ihre numerische Rezeptur zu bauen, die alle Entscheidungen unbeaufsichtigt erzeugt. Ja, absolut. Aber wenn Sie wollen, dass das LLM Sie in Ihrer traditionellen Art begleitet, Supply Chain zu betreiben, also Zeile fuer Zeile in einer langen Tabelle die Min- und Max-Bestaende anzupassen, dann fuehrt das nirgendwohin.

Das fuehrt nirgendwohin. Wenn Sie wollen, dass das LLM nuetzlich ist, muessen Sie das Paradigma unbeaufsichtigter Entscheidungsfindung annehmen, bei dem Entscheidungen vollstaendig durch eine numerische Rezeptur gesteuert werden. Diese Rezeptur ist kein LLM, sondern typischerweise klassische Software, nur dass diese klassische Software jetzt teilweise mit einem Coding Agent geschrieben wird.

Conor Doherty: Okay. Ich moechte die Frage schaerfen, denn ich glaube, du hast vieles beantwortet, aber ich will es fuer Leute ganz klar machen, die im Grunde diese Version der Frage stellen werden. Ich nehme sehr runde Zahlen, damit es einfach ist. Du hast das Beispiel eines nordamerikanischen Unternehmens gegeben, sagen wir mit 100 Millionen Umsatz pro Jahr.

Eine Milliarde, sorry, eine Milliarde, wir arbeiten mit den Grossen. Also eine Milliarde. Sagen wir, dieses Unternehmen nutzt eines Tages Fable und bekommt gesagt: Ja, naechstes Jahr machen Sie 1,1 Milliarden Umsatz. Das prognostizieren wir fuer Ihren Umsatz. Sagen wir, das Unternehmen hat 10.000 SKUs und 10 Standorte. Das sind 100.000 SKU-Standort-Kombinationen.

Zu wissen, dass ich naechstes Jahr vielleicht 1,1 Milliarden Umsatz mache, ist eine Information. Das ist sicher nett. Es sind 10 Prozent Wachstum gegenueber letztem Jahr. Okay, gut.

Aber wohin schicke ich heute die Einheiten, die ich habe? Schicke ich diese Einheit nach…

Joannes Vermorel: Ja, in den Laden in New Orleans. Genau das meinte ich mit Vanity Metrics. Das Problem mit nackten Prognosen ist, dass nackte Prognosen nutzlos sind, weil sie nicht verwendet werden koennen. Wenn man das Problem falsch angeht, also im klassischen Planungsparadigma, in dem man sagt, ich kenne die Zukunft und orchestriere dann, ja, dann kann man sie verwenden.

Aber dieses Paradigma ist kaputt. Es ist kaputt, weil Ihre Zahl, wenn Sie sie annehmen, nicht nur ungefaehr ist. Sie tun so, als kennten Sie die Zukunft und haetten fast null Prozent Fehler. Aber Sie wissen, dass es Fehler gibt.

Es funktioniert also nicht. Wenn Sie 10 Prozent Wachstum projizieren, okay, aber es ist keine relevante Information. Sie kaskadiert keine Entscheidungen. Ich kann damit nichts tun, und sie liegt nicht einmal auf der richtigen Aggregationsebene, denn Ihre Entscheidungen leben zeitlich auf der Ebene taeglicher Entscheidungen, und die Granularitaet ist die SKU. Ihre Makroprognose ist also irrelevant. Deshalb sage ich: Sie haben Vanity Metrics.

Sie sind fuer Direktoren. Sie sind fuer ein menschliches Verstaendnis auf hoher Ebene, und das ist in Ordnung. Agenten koennen das machen. Kein Problem.

Und dann gibt es die echte Automatisierung der Supply-Chain-Entscheidungen, die Vielzahl, potenziell Tausende, Zehntausende oder Millionen taeglicher Ressourcenzuweisungen. Dafuer braucht man ein anderes Stueck Software, das wir bei Lokad numerische Rezepturen nennen, weil es eine Mischung aus Machine-Learning-Algorithmen, Optimierungsalgorithmen, Datenaufbereitung und so weiter ist. Das LLM kann Ihnen helfen, diese numerischen Rezepturen zu komponieren, kein Problem, und diese Rezepturen laufen dann unabhaengig vom LLM. Kein Problem. Aber damit das funktioniert, muessen Sie das Problem aus der Perspektive angehen, dass Supply-Chain-Entscheidungen, also Ressourcenzuweisungen, durch unbeaufsichtigte Entscheidungen gesteuert werden, die die Folge einer geschriebenen numerischen Rezeptur sind.

Das ist alles, was ich sage. Dieses Paradigma der numerischen Rezeptur ist unvereinbar mit dem klassischen Paradigma: Ich kenne die Zukunft und kann dann die Ressourcenzuweisung orchestrieren. Diese beiden Paradigmen sind nicht kompatibel. Man kann nur eines waehlen.

Conor Doherty: Ich glaube, Verwirrung koennte entstehen, weil du das Verb “verwenden” benutzt. Du sagst, eine Prognose, eine nackte Prognose, kann man nicht verwenden. Jemand koennte denken: Aber ihr verwendet doch auch probabilistische Prognosen, zum Beispiel. Offensichtlich nutzen wir diese Information im Dienste von etwas anderem. Also klaere, was du meinst mit: Man kann diese Information nicht verwenden.

Joannes Vermorel: Jedes Mal, wenn Leute Prognose erwaehnen, ist implizit eine relativ aggregierte Zeitreihenprognose gemeint. Immer. Ich muss das nicht einmal spezifizieren. Es gibt so viele Annahmen: Es wird eine aequidistante Zeitreihe sein, also Prognose pro Tag, Woche oder Monat. Theoretisch koennte man nicht aequidistante Zeitreihenprognosen betrachten.

Ich habe noch nie gesehen, dass das jemand praktisch nutzt. Wenn wir also den Begriff Forecast verwenden, kommt er mit extrem engen mathematischen Annahmen, genau wie Safety Stock in der Praxis Normalverteilung bedeutet.

Conor Doherty: Ja.

Joannes Vermorel: Ja, ja. Ein Mathematiker wuerde sagen: Theoretisch kann man einen Safety Stock haben, der keiner Normalverteilung folgt. Ja, ausser dass 99 Prozent der Software am Markt, wenn sie Safety Stock sagt, eine Normalverteilung meint.

In der Theorie kann man es anders machen, aber ich benutze den Begriff so, wie er allgemein verstanden wird. Wenn ich Prognose sage und sage, Prognose ist das nackte Prognose-Anti-Pattern, sprechen wir von aequidistanten Zeitreihenprognosen. Und es wird auf einer Aggregationsebene sein, bei der die Zeitreihen nicht extrem duenn besetzt sind.

Wenn Menschen an eine Zeitreihe denken, stellen sie sich etwas vor, das wie eine Kurve aussieht. Aber auf SKU-Ebene hat man meistens Nullen und gelegentlich Einsen. Wenn man die Zeitreihe fuer eine SKU ueber ein Jahr betrachtet, sind es 90 Prozent Nullen und gelegentlich Einsen, die bedeuten, dass man eine Einheit bedient oder verkauft hat. Das ist absolut nicht das, was Menschen im Kopf haben, wenn sie an Zeitreihen denken. Und in diesem Claude-Video hatten sie fuer ihre Prognose eine sehr schoene, glatte, hoch aggregierte Zeitreihe.

Genau das haben Leute im Kopf, nicht die extrem disaggregierte Situation, der man in der Supply Chain begegnet, wenn man auf den Granularitaeten arbeitet, die fuer die Entscheidung und Ressourcenzuweisung zaehlen. Wenn Sie also Vorhersagen treffen wollen, und ich benutze bewusst dieses Wort anders als Prognose, auf einer Granularitaet, die fuer Ihre Entscheidungen relevant ist, dann ist dieses mathematische Instrument so radikal anders als die Zeitreihenprognose, als das, was Leute tatsaechlich Forecast nennen, dass es besser ist, es anders zu nennen. Denn diese Dinge haben fast nichts gemeinsam.

Conor Doherty: Wenn wir ueber Supply-Chain-Entscheidungen sprechen, habe ich eine kurze Liste der Entscheidungen aufgeschrieben, die wahrscheinlich fuer die meisten Leute in Supply Chains relevant sind. Wir sprechen ueber: was kaufen, bei welchem Lieferanten kaufen, wann bestellen, wohin Bestand legen, was herstellen, was beschleunigen, was rabattieren. Wir koennen weitermachen, aber das sind nur…

Joannes Vermorel: Ja, wir koennten weitermachen.

Conor Doherty: Das sind nur sieben. Die Frage ist also…

Joannes Vermorel: Und zu welchem Preis.

Conor Doherty: Und zu welchem Preis, genau. Und soll ich heute bei diesem Lieferanten bleiben oder den Lieferanten wechseln? Es gibt all diese Klassen, zweite, dritte, vierte Ordnung, man kann sehr meta werden. Aber nehmen wir nur sieben sehr konkrete, die Leute im Kopf aufbauen koennen. Mit diesen Beispielen im Kopf: Wenn mir jemand sagt, mein Umsatz naechstes Jahr betraegt 1,1 Milliarden, ist das Information. Aber bringt mich das naeher daran, diese Fragen taeglich granular zu beantworten? Und wenn die Antwort nein ist, warum nicht? Denn wenn ich dieses Video sehe, koennte ich diesen Eindruck bekommen.

Ich kritisiere Anthropic nicht, ich nehme es nur als Beispiel. Mir wurde die Frage gestellt: Was sagt das ueber Unternehmen wie Lokad? Nun, wir verkaufen keine isolierte Information wie “hier ist Ihr Umsatz fuer naechstes Jahr”. Wir verkaufen im Grunde Antworten auf diese Fragen.

Joannes Vermorel: Ja. Der Punkt ist, dass die Intuition vieler Menschen bei hoeherdimensionaler Statistik schlicht falsch ist. Nehmen wir ein Bild. Ein Film ist eine Reihe von Bildern.

Stellen Sie sich vor, Sie haben ein Einzelbild und wollen prognostizieren, wie die Pixel im naechsten Einzelbild aussehen werden. Die Prognose des naechsten Jahresumsatzes ist nur die durchschnittliche Farbe Ihres Bildes. Die Durchschnittsfarbe wird irgendein Grauton sein, gemittelt ueber das ganze Bild.

Conor Doherty: Ja.

Joannes Vermorel: Und jetzt prognostizieren Sie den Grauton, der die durchschnittliche Farbe fuer das naechste Bild sein wird. Das ist Ihre Umsatzprognose. Hilft Ihnen das, die Pixel des naechsten Bildes zu prognostizieren, Pixel fuer Pixel? Ueberhaupt nicht. Warum? Weil Sie, wenn Sie alles aggregieren, Ihr gesamtes Bild auf eine Durchschnittsfarbe reduzieren.

Conor Doherty: Ja.

Joannes Vermorel: Sie haben das Bild verloren. Sie sehen nichts. Wenn es darum geht, das naechste Einzelbild zu projizieren, lautet die Antwort: Sollten Sie bei der Durchschnittsfarbe anfangen? Sicher nicht.

Sie wollen bei der granularsten Information anfangen, also bei den Pixeln selbst. Die Idee, dass man eine sehr genaue Durchschnittsprognose fuer das naechste Bild haben kann, also die Durchschnittsfarbe, ist plausibel. Warum? Weil sich die Durchschnittsfarbe von einem Frame zum naechsten kaum aendert. Solange Sie nicht die Szene wechseln, bleibt sie fast dieselbe Durchschnittsfarbe. Selbst wenn sich von Bild zu Bild vieles aendert, ist das gesamte Bild im Durchschnitt fast gleich, solange es keinen Schnitt gibt.

Wenn Menschen von Umsatzprognosen sprechen, ja, das kann man tun. Kann man eine relativ genaue Prognose haben? Moeglicherweise, weil sie hyperaggregiert ist. Ist diese hyperaggregierte Prognose nuetzlich, wenn Sie wieder auf der super disaggregierten Ebene sind, also dem Aequivalent der Pixel in unserem Bild? Die Antwort ist nein. Wenn Sie verstehen wollen, warum, denken Sie einfach daran, dass Sie vom einen Frame zum naechsten wollen und sich fragen: Sollte meine Logik zur Vorhersage des naechsten Bildes alles auf eine Durchschnittsfarbe reduzieren? Die Antwort ist nein.

Conor Doherty: Ich moechte diese Frage sehr konkret formulieren. Stellen wir uns vor, ich habe ein kommerzielles Abonnement fuer irgendein kommerziell verfuegbares KI-Tool. Ich meine nicht speziell Fable. Ich bin also in diesem Unternehmen mit einer Milliarde Umsatz und habe ein Abonnement fuer ein frei verfuegbares kommerzielles KI-Werkzeug. Ich sage: Hier ist Zugriff. Ich erstelle eine API, gebe Zugriff auf mein ERP und alle historischen Transaktionsdaten, und sage: “Okay, ich will wissen, wohin ich morgen all diese Einheiten schicken soll. Ich muss morgen eine Bestellung aufgeben.

Sag mir, was ich kaufen soll und in welchen Mengen. Du kannst jedes Prognosemodell verwenden, das du willst. Ich vereinfache die Frage stark, aber du kannst jedes Prognoseparadigma verwenden. Gib mir einfach eine optimierte Bestellung.” Wuerde das funktionieren? Ich weiss, das ist eine einfache Frage, aber genau so betrachten viele Menschen das: Welchen Nutzen bekomme ich aus dieser Technologie?

Joannes Vermorel: Im Moment wuerde ich vermuten, dass es nicht funktioniert, es sei denn, man steuert das Modell in sinnvolle Entscheidungen. Es gibt zu viele Dinge. Diese LLMs sind extrem gut, aber sie sind nicht geduldig. Es gibt so viel, was sie nicht wissen. Man muss das Modell steuern. Zum Beispiel kann das LLM nicht erraten, dass Sie ein CRM haben, das seit sieben Jahren in Produktion ist, bis Sie es sagen.

Wenn Sie sagen: “Alle meine Daten sind im ERP”, aber ein grosser Teil der Daten ist im CRM, und Sie dem LLM nie gesagt haben, dass es auch ins CRM schauen soll, dann weiss es das nicht. Man kann beim Prompting sehr clever sein und in einen Reverse-Modus gehen: “Ich will das tun. Stell mir alle Fragen, die du beantwortet haben willst. Ich werde mein Bestes tun.” Dann kann man den Agenten den Prozess uebernehmen lassen. Das kann bis zu einem gewissen Grad funktionieren.

Meine Erfahrung ist, dass man selbst mit den neuesten Releases wie Astra von OpenAI, das fast eine Klasse fuer sich ist, immer noch Steuerung auf hoher Ebene braucht. Aber es ist gut. Wenn man gute Ergebnisse will, sollte man ein Werkzeug wie Astra bitten: Hilf uns, das zu replizieren, was Lokad tut. Ich vermute, fuer kleine Setups kann einen das ziemlich weit bringen. Das Problem ist wieder Wartbarkeit und Auditierbarkeit.

Wenn man heute einem sehr klugen Agenten sagt: “Repliziere Lokad fuer mich”, koennte er bis zu einem gewissen Grad tatsaechlich Erfolg haben. Vielleicht nicht mit Terabytes an Daten, denn dort gibt es sehr viele Probleme. Aber wenn Ihre Daten bequem auf eine leistungsfaehige Workstation passen, auf der der Coding Agent laeuft, koennte man wahrscheinlich recht weit kommen. Die Herausforderung ist der Umgang mit dunkler Intelligenz.

Das ist eine Herausforderung bei Lokad. Wir arbeiten seit anderthalb Jahrzehnten daran. Das Problem gab es schon vor LLMs. Wie stellt man sicher, dass die numerische Rezeptur unter Kontrolle bleibt, dass man versteht, was passiert? Uebrigens kann man dieses Problem auch mit Menschen haben: Ein Kollege baut etwas extrem Raffiniertes und Kompliziertes, geht dann weg, und niemand hat eine Ahnung, warum es funktioniert oder wie es funktioniert. Das ist ein reales Problem dunkler Intelligenz. Wenn man einfach etwas sehr Ausgefallenes vibe-codet, kann man grosse Schwierigkeiten haben, es im Laufe der Zeit zu warten.

Auch das LLM selbst kann, wenn es diesen Code erneut anschaut, in Schwierigkeiten geraten, denn LLMs sind gewissermassen zustandslos. Jedes Mal, wenn der Agent die Codebasis erneut betrachtet, ist es, als saehe er sie zum ersten Mal. Beim naechsten Besuch der Codebasis kann der Agent verloren sein und fragen: Warum wurde das so gemacht? Ich weiss es nicht.

Mit dem aktuellen Niveau agentischer Intelligenz halte ich es nicht fuer vernuenftig, bei mission-kritischen Prozessen auf menschliche Aufsicht auf hoher Ebene zu verzichten. Man kann natuerlich einfach “YOLO” sagen und dem Agenten vertrauen. Er wird alles vibe-coden, aber ich halte das fuer ein Rezept fuer eine Katastrophe, weil wir bei agentischer Intelligenz noch nicht ganz so weit sind. Ausserdem erkennen viele Leute nicht, dass mindestens die Haelfte der dummen Dinge, die sehr smarte Agenten tun, auf einen selbst zurueckgeht.

Man schlaegt etwas Dummes vor, und der Agent ist sehr folgsam. Er wird die dummen Dinge tun, und das ist ein grosses Problem. Diese Agenten haben noch nicht wirklich die Faehigkeit, gegen dumme menschliche Anfragen zu argumentieren. Einen Modus dafuer haben sie nicht.

Vielleicht werden zukuenftige Modelle einen Pushback-Modus haben, aber im Moment ist das noch sehr schwach. Das bedeutet, dass man nur eine schlechte Anfrage davon entfernt ist, etwas Tragisch-Schlechtes fuer seine Codebasis zu tun.

Conor Doherty: Apropos Aufsicht auf hoher Ebene: Das erinnert mich daran, dass Fabian Hoehner, der Commercial Director bei Lokad, und ich eine Live-Demo des Aerospace-Accounts von Lokad machen werden. In der Vorbereitung sagte er mir, dass, wie in jeder anderen Vertikale, in der Lokad arbeitet, die Entscheidungen automatisch generiert werden. Aber wegen des Werts jeder einzelnen Entscheidung in der Luftfahrt werden diese trotzdem geprueft. Wenn es zum Beispiel darum geht, eine Einheit zu kaufen, und diese Einheit kostet 100.000 Dollar, wird das wahrscheinlich geprueft, nicht weil man dem System nicht vertraut, sondern weil die Kosten eines Fehlers so hoch sind. In anderen Vertikalen kostet eine Einheit vielleicht nur ein paar Cent, je nach Preisstaffel.

Wenn wir also darueber sprechen, dass KI viele dieser Aufgaben im Grunde kommoditisiert: Siehst du bestimmte Vertikalen als leichter von dieser Technologie uebernehmbar als andere?

Joannes Vermorel: Offensichtlich gibt es Vertikalen, die sehr engineering-orientiert sind: Oel und Gas, Luftfahrt, Consumer Electronics. Ich vermute auch E-Commerce. Diese Unternehmen werden an vorderster Front stehen, wenn es darum geht, alles zu automatisieren. Danach kommen Branchen, in denen es einfach extrem muehsam ist, weil es so viel gibt, zum Beispiel Fast Fashion.

Conor Doherty: Genau daran dachte ich.

Joannes Vermorel: Ja, das wird kommen. Die Leute sind dort vielleicht weniger technologisch orientiert, aber die Komplexitaet macht diese Technologien extrem attraktiv, weil es sonst extrem muehsam ist. Und zuletzt werden wahrscheinlich, wie so oft, FMCG-Unternehmen zurueckbleiben, weil sie vergleichsweise wenige Produkte und sehr hohe Volumina haben.

Selbst wenn die Produktivitaet nicht gut ist, wirkt sich das dort weniger stark aus als in anderen Vertikalen.

Conor Doherty: Ich habe dich vorhin nach den moeglichen Folgen dieser Technologie fuer Anbieter gefragt. Nehmen wir an, die Richtung stimmt, diese Technologie wird immer besser. Das bedeutet, wenn man das Fable-Video nimmt: Daten sortieren und bereinigen wird schneller und billiger, Prognosen werden schneller und billiger, Berichte generieren und Backtesting passieren in Sekunden, alles automatisch per Klick.

Okay, nehmen wir an, das alles stimmt und wird richtig gut. Was wird in diesem Bereich auf Anbieterseite weniger wertvoll, und was wird wertvoller?

Joannes Vermorel: Meine Einschaetzung ist, dass 90 Prozent dieser Anbieter bankrottgehen werden.

Conor Doherty: Okay.

Joannes Vermorel: Aber nicht deswegen. Genauer gesagt: Sie werden bankrottgehen, weil ihre eigenen Kunden bankrottgehen.

Conor Doherty: Sehr anders.

Joannes Vermorel: So sehe ich es. Ich sage seit einigen Jahren voraus, dass besonders mit diesen Agenten ueber 90 Prozent der White-Collar-Arbeit verschwinden werden. Vielleicht sogar mehr. Frueher sagte ich 90 Prozent, inzwischen sind wir darueber hinaus. Wenn man anschaut, was Menschen im Durchschnitt tun, kann wahrscheinlich ueber 90 Prozent dieser Arbeit vollstaendig automatisiert werden. Das bedeutet, dass manche Unternehmen mitziehen werden, viele aber nicht.

Wenn man die Geschichte der Innovation betrachtet, denkt man vielleicht, Elektrizitaet sei offensichtlich gewesen. Aber Ende des 19. Jahrhunderts gingen die meisten Unternehmen bankrott und fuehrten Elektrizitaet nicht ein. Dasselbe passierte mit der naechsten Revolution, den Automobilen. Die meisten Unternehmen fuehrten Automobile nicht ein und gingen bankrott. Dieser Zyklus wiederholte sich immer wieder. Bei grossen technologischen Veraenderungen schafft es die Mehrheit der Unternehmen nicht, den Sprung zu machen, und verschwindet.

Ich vermute, KI wird in meiner Lebenszeit der groesste Sprung sein. Vielleicht kann man sich einen noch bedeutenderen technologischen Sprung vorstellen, aber es sieht absolut massiv aus, denn in modernen Volkswirtschaften wie Frankreich oder den USA macht White-Collar-Arbeit etwa 80 Prozent der Erwerbsbevoelkerung aus, und wir sprechen davon, 90 Prozent davon zu automatisieren.

Der Effekt wird enorm sein. Einige wenige Unternehmen werden diese Dinge wirklich einfuehren und annehmen, und sie werden die anderen Unternehmen in die Insolvenz druecken. Das ist die Schumpeter’sche Revolution. Das wird passieren. Ich prognostiziere keine Massenarbeitslosigkeit, denn andere Unternehmen werden entstehen. Der Markt loest das ziemlich sauber: Viele Unternehmen gehen bankrott, Menschen sind ein paar Monate arbeitslos und gehen dann zu einem anderen Unternehmen, weil die Gewinnerunternehmen wie verrueckt fuer andere Jobs einstellen.

Zurueck zu den Anbietern: Wie gesagt, die meisten Anbieter im Bereich Enterprise-Supply-Chain-Software waren schon vor 20 Jahren veraltet. Wenn man schon 20 Jahre veraltet ist, aendert eine weitere technologische Revolution nicht viel. Solange Kunden fuer veraltete Dinge zahlen, geht die Show weiter. Ich lese immer noch in den Nachrichten, dass Unternehmen fuer Systems of Record, also Dinge wie SAP, extrem viel ausgeben, obwohl das genau die Art von Software ist, die am einfachsten zu vibe-coden ist.

Das funktioniert wunderbar, und zwar schon seit Jahren. Ich sprach von einem agentischen Durchbruch vor einem Jahr, aber CRUD-Software fuer Systems of Record war schon zwei oder drei Jahre davor trivial geworden. Wenn ein Unternehmen heute noch mehr als eine Million Dollar pro Jahr fuer ein System of Record ausgibt, unabhaengig von seiner Groesse, dann ist das schlicht leichtsinnige Ausgabe.

Das ist reiner Verlust. Man gibt Geld fuer Frivoles aus. Kein System of Record ist mehr als eine Million Dollar pro Jahr wert. Wenn man wirklich sehr viele Daten hat, kann man ueber Hardwarekosten sprechen. Aber fuer eine Million Dollar pro Jahr kann man fast alle Transaktionsdatensaetze von Walmart verwalten, wenn man sie klug und nicht super aufgeblasen darstellt. Das wirft die Frage auf: Von welchen Datensaetzen sprechen wir?

Wenn Sie sagen, Sie brauchen ein Budget, das groesser ist als das, was noetig waere, um die Daten von Walmart klug zu halten, dann stimmt etwas nicht. Coding Agents sind zudem sehr gut darin, Code zu optimieren. Sie koennten das also tun.

Die Anbieter veralteter Produkte werden ihre veralteten Produkte weiter verkaufen, wie sie es seit 20 Jahren tun. Diese Farce endet erst, wenn ihre eigenen Kunden bankrottgehen, denn der Markt ist kein guter Lehrer, sondern ein Filter. Unternehmen, die mit veralteten Paradigmen arbeiten, werden statt 90 Prozent Personalreduktion fuer die meisten Aufgaben vielleicht 5 Prozent erreichen. Das ist nur eine kosmetische Verbesserung, und das ist nicht, was man suchen sollte.

Mit den heutigen Werkzeugen sollte ein typisches KI-Projekt, wenn man eine Funktion im Unternehmen betrachtet, mindestens eine Halbierung des Headcounts als Baseline haben. Wenn man ein KI-Projekt durchfuehrt und am Ende ist der Headcount der Funktion nicht halbiert, dann ist das ein klaeglicher Fehlschlag. Faktor zwei ist heute wirklich nicht ambitioniert. Realistischer waeren 75 Prozent, und das langfristige Ziel in drei bis fuenf Jahren waeren 90 Prozent. Ja, Headcount-Reduktion, aber selektiv dort, wo KI sinnvoll einsetzbar ist. Das Problem ist, dass viele Unternehmen solche Ergebnisse nicht sehen, weil sie KI und Automatisierung mit extrem veralteten Paradigmen angehen.

Conor Doherty: Wir haben ueber Anbieter gesprochen, und dieses Gespraech entstand, weil ein Freund des Kanals uns dieses Video geschickt hat. Er wollte, dass ich dir eine Frage stelle, und damit schliesse ich. Stell dir vor, morgen kommt ein Anbieter in das Buero meines Chefs und sagt: “Unsere KI plant Ihre Supply Chain autonom.” Was sollte ich ihn demonstrieren lassen?

Joannes Vermorel: Die Frage ist: Man sollte fragen, wie. Man muss verstehen, was unter der Haube passiert. Fuer den Kontext: Es ist ein Grosshandelsunternehmen. Sie muessen verstehen, was unter der Haube passiert, denn das ist entscheidend. “Fuehren Sie mich durch. Ich will es verstehen.” Und dann: Koennen wir einen Weg gehen, auf dem Sie sich verpflichten, die Headcount-Einsparungen zu liefern, die wir gemeinsam besprechen? Umgekehrt gibt es Red Flags: Wenn der Anbieter pro Seat abrechnet, liegt es in seinem Interesse, die Produktivitaet zu minimieren, damit moeglichst viele Personen und Seats erhalten bleiben.

Conor Doherty: Ja.

Joannes Vermorel: Genau. Eine weitere Red Flag waere, wenn der Anbieter sagt: Wir werden Ihre Leute augmentieren. Absolute Red Flag. So funktioniert es nicht.

Man erreicht keine 90 Prozent Headcount-Reduktion, indem man sagt, man augmentiere die Produktivitaet der Leute. Man muss die Arbeit neu denken. Deshalb wuerde ich sagen: Fuehren Sie mich durch, wie Sie das erreichen. Idealerweise wollen wir auf eine Perspektive von fuenf Jahren hinaus: 90 Prozent Headcount-Reduktion. Wenn wir heute 20 Leute sind, sollen es in fuenf Jahren zwei sein. Erklaeren Sie mir genau, wie Ihr System funktioniert und warum Sie zuversichtlich sind, dass wir mit zwei von zwanzig Menschen arbeiten koennen.

Conor Doherty: Also eine andere Person in deinem Beispiel.

Joannes Vermorel: Ja. Und normalerweise verwenden Enterprise-Software-Anbieter Technologien, die so veraltet sind, dass man sehr schnell merkt, wie veraltet sie sind, wenn man fragt, was unter der Haube passiert. Heutzutage kann man sogar, wenn man technische Begriffe nicht versteht, das Gespraech aufzeichnen und ChatGPT um eine Bewertung bitten. ChatGPT wird eine ziemlich solide Einschaetzung geben, wenn man es bittet, eine adversariale Haltung einzunehmen. Sonst ist es bei Kritik viel zu freundlich. Man muss den Rahmen setzen: Lieber ChatGPT, dieser Anbieter uebertreibt wahrscheinlich seine Behauptungen und beschönigt die Lage. Sei gnadenlos und kritisiere, was mir praesentiert wird. Dann bekommt man ordentliche Kritik. Aber man muss trotzdem anschauen, was unter der Haube passiert.

Conor Doherty: Fairerweise war es noch nie einfacher, ziemlich solide Marktforschung zu praktisch jedem Anbieter zu bekommen.

Joannes Vermorel: Ja.

Conor Doherty: Und man braucht nicht einmal das leistungsstaerkste Modell. Wir werden nicht von ChatGPT oder OpenAI gesponsert, aber man muss nicht einmal das anspruchsvollste ChatGPT-Modell verwenden. Hier ist ein Anbieter, hier ist die Website, bewerte ihn, gib mir einen Marktbericht, vergleiche ihn mit Wettbewerbern.

Joannes Vermorel: Aber Vorsicht: Man muss eine adversariale Haltung verlangen, denn sonst ist ChatGPT viel zu vertrauensvoll. Man muss sagen: Vertraue keinen Case Studies, vertraue keinen Behauptungen des Anbieters.

Conor Doherty: Genau.

Joannes Vermorel: Sorge dafuer, dass die Bewertung in Fakten verankert ist. Wie sieht die Technologie aus? Nimm das Schlimmste an. Wenn ein Stueck Technologie nicht beschrieben wird, nimm an, es sei ein Moving Average.

Conor Doherty: Nein, es ist Enterprise Software. Das ist funktional.

Joannes Vermorel: Ja, genau. Enterprise Software funktioniert so. Wenn der Anbieter keine Details gibt, gibt es kein magisches Rezept. Es gibt keine magische Zutat, keine hyperfortgeschrittene Technologie. Nein. “Das ist spezielle KI.” Nein.

Nimm das Schlimmste an. Wenn es zum Beispiel keine technische Dokumentation gibt, muss man annehmen, dass es ein Albtraum ist und sie deshalb ihre Dokumentation nicht veroeffentlichen. Das Produkt ist ein grosser Haufen Schlamm, und der Anbieter schaemt sich so sehr, dass er es nicht oeffentlich machen will.

Man muss ChatGPT also diese adversariale Haltung geben: Begruende die Bewertung mit Beobachtbarem, sei faktisch, sei extrem skeptisch gegenueber jeder Behauptung, besonders Case Studies. Nimm an, dass alle Case Studies gefaelscht oder zumindest stark geschoent sind, und argumentiere aus ersten Prinzipien. Wenn ein Anbieter sagt, er mache alles in einer SQL-Datenbank, frage: Ist das wirklich kompatibel mit fortgeschrittenen Machine-Learning-Technologien? Bitte ChatGPT, aus ersten Prinzipien zu argumentieren.

Schau dir an, was sie tun, und extrapoliere daraus, ob das, was sie sagen, glaubwuerdig ist und ob es in fuenf Jahren wirklich diese 90 Prozent Headcount-Reduktion erreichen kann, die am Horizont stehen sollte.

Conor Doherty: Wenn wir diese Aufnahme veroeffentlichen, werde ich eine von ChatGPT erstellte Zusammenfassung dieses Diagnosetests haben und sie mit diesem Clip posten, um den Podcast zu bewerben. Ich denke, das ist tatsaechlich sehr funktional und erreichbar. Es ist nicht so, als wuerdest du sagen, man muesse Petabytes an Daten durchforsten und Prognoseexperte werden. Frueher konnte man sagen: Man braucht mehr mechanisches Verstaendnis, und das ist immer gut, aber realistisch werden die meisten Leute das nicht tun. Es gibt aber wenig Entschuldigung dafuer zu sagen: Ich habe nicht einmal 60 Sekunden, um zu pruefen, wofuer ich vielleicht mehr als eine Million Dollar ausgeben werde. Das ist schon etwas dreist.

Joannes Vermorel: Man muss bedenken, dass all diese LLMs standardmaessig darauf feinabgestimmt sind, nett, zahm, freundlich und nicht antagonistisch zu sein. Deshalb sage ich, dass man sie so prompten muss. Aufgrund dieses Standardverhaltens versuchen sie nicht, etwas in schlechtem Licht darzustellen, vielleicht weil jemand nach einem Kollegen fragt und der Kollege daneben sitzt.

Wenn man sie aber mit einem sehr spezifischen Prompt dazu bringt, ist es kein Problem. Das Modell kann harte Kritik an allem liefern. Man muss das Modell nur ein wenig steuern, denn die Standard-Feinabstimmung ist, soweit ich weiss, bei fast allen Modellen relativ freundlich und positiv.

Conor Doherty: Im Allgemeinen stellst du diese Herausforderung vermutlich mit grossem Vertrauen, dass Lokad an diesem Massstab nicht scheitert.

Joannes Vermorel: Ja, das ist eine gute Position. Ich sage nur, vergleichsweise: Ich habe Lokad in der Vergangenheit mit solchen Tests geprueft. Ich habe die neuesten Modelle, Astra von OpenAI oder die neuesten von Anthropic, noch nicht getestet, aber Lokad schnitt bei diesem Stresstest ordentlich ab.

Conor Doherty: Okay. Ich habe keine weiteren Fragen, Joannes. Wenn jemand mir sein Feedback schickt, das er von ChatGPT bekommen hat, leite ich es direkt an dich weiter, damit wir es spaeter kommentieren koennen. Wie immer, ein Vergnuegen. Und an alle Zuschauer: Vielen Dank.

Wenn Sie mit Joannes und mir Kontakt aufnehmen wollen, wenn Sie Ihr LLM-Feedback mit uns teilen wollen.