Les IA de type modèle de langage LLM ne seront performantes que quand elles seront connectées à une ontologie (base de connaissances / Knowledge Graph)

LLM ontologie e1729692110811

Thèse : les IA génératives de texte actuelles, basées sur des modèles de langage (LLM), se fourvoient dans une erreur de conception fondamentale qui les condamne à ne produire que du texte banal et faux, ce qui les rend largement inutiles.

La vraie révolution de l'IA générative textuelle viendra d'une mise en relation entre les réseaux neuronaux et les ontologies.

Vous n'avez rien compris à ce que je viens de dire ?

Pas de souci, je vais tout vous expliquer.

Mais avant de commencer, je vais vous asséner un argument d'autorité.

En effet, je m'apprête à formuler une critique impitoyable des LLMs, déjà tout auréolés de prestige, alors que comme vous ne le savez peut-être pas, je ne suis personne dans le monde de l'IA : ni data scientist, ni AI architect, ni machine-learning engineer, ni même simple codeur en Python, je vais pourtant affirmer une thèse qui vous révulsera peut-être immédiatement, à savoir que les modèles de langage actuels sont très bêtes et qu'ils le resteront tant qu'on ne les connectera pas à une ontologie.

Donc pour ma défense, je dois citer deux stars, qui ont dit ce que je viens de dire - donc peut être que si c'est eux qui parlent, vous leur ferez confiance.

  • Sam Altman, CEO d'OpenAI qui édite entre autres ChatGPT, dans une interview en avril 2024, a affirmé que ChatGPT était pour l'instant plutôt bête ; on est d'accord !
  • et Yann Le Cun, co-inventeur de l'apprentissage profond (deep learning) et responsable IA chez Meta qui édite LLaMa, a aussi déclaré récemment que les LLMs n'avaient même pas le niveau intellectuel d'un enfant de 5 ans et que la technologie des LLMs qui fait grand bruit serait oubliée en quelques années, et ne représentait pas la meilleure voie de progrès pour l'IA

Voilà, j'espère donc que votre scepticisme initial face à ma thèse va bien ployer sous le poids considérable de ces deux autorités 🙂

Maintenant, entrons dans le vif du sujet.

L'erreur de conception des modèles de langage / LLMs

Je vais démontrer ici que, par conception, les modèles de langage / LLMs sont incapables de produire ce qu'on attend la plupart du texte d'un texte : une information fiable, basée sur les réalités du monde - et pas un charabia de banalités statistiquement probables.

L'explosion des IA génératives et l'échec de leur version texte

Depuis quelques années, les IA génératives font la Une des médias et font irruption dans la vie quotidienne, le travail et la conscience de milliards d'humains.

Des startups deviennent des multinationales en quelques mois ; on vit une ère de destruction / création schumpétérienne massive.

Vous ne connaissez pas ce concept ? Attendez, le modèle de langage Mixtral 7x22b de la licorne française Mistral AI va vous renseigner :

La destruction créatrice, ou destruction créatrice schumpétérienne, est un concept économique développé par l'économiste Joseph Schumpeter. Il décrit le processus par lequel l'innovation et le progrès technologique détruisent les anciennes structures économiques et en créent de nouvelles. Ce processus est considéré comme un moteur essentiel de la croissance économique à long terme, car il permet de remplacer les industries et les entreprises obsolètes par de nouvelles, plus efficaces et plus productives.

On ne demande pas les mêmes choses à chaque média, et donc à chaque IA selon son média

Les attentes et les usages de chaque média diffèrent

Pourtant, ce qui est au fond toujours la même technologie basée sur les réseaux neuronaux et l'apprentissage machine, donne des résultats très différents suivant le média auquel on l'applique :

  • dans le domaine de l'image, les IA génératives comme Midjourney, Ideogram, Dall-E, Stable Diffusion, Leonardo etc, donnent des résultats saisissants, avec une qualité en progrès constant ; du photoréalisme au croquis, du manga au logo, elles savent créer des visuels convaincants à la vitesse de la lumière
  • dans le domaine du son, les IA de text-to-speech et autres imitations de la voix humaine sont arrivées à maturité et prêtes pour un usage professionnel, comme la géniale IA de synthèse vocale d'ElevenLabs ; tandis qu'en musique des IA comme Suno produisent des résultats vaguement acceptables - mais la musique semble par définition plus difficile à automatiser car liée à la vie émotionnelle qu'un algorithme a forcément du mal à formaliser
  • dans le domaine du texte, l'IA donne certes des résultats étonnants - et la plus connue des IA génératives, ChatGPT, est précisément un LLM textuel - mais rencontre de nombreuses limites : hallucine, raconte n'importe quoi, débite des banalités au kilomètre, etc

Ces différences dans la qualité des résultats en fonction du média s'expliquent en partie par le fait que l'humanité ne demande pas du tout les mêmes choses à chaque média.

Le média image peut certes dire la vérité - par exemple sur une photo historique - mais s'emploie en majorité pour représenter l'imaginaire : on ne lui demande ni la vérité ni le réalisme, mais le rêve, la puissance évocatrice, la beauté. On ne regarde pas un manga pour apprendre quelque chose, on ne stagne pas devant Netflix pour s'informer sur le réel - mais pour planer, délirer, couper les ponts avec le réel.

Le média musique s'éloigne encore plus de toute exigence de vérité ou de réalisme : un rythme de tambour, une nappe de synthé, un air d'harmonica, un riff de guitare ou une mélopée arménienne ne sont pas là pour représenter le monde tel qu'il est, mais pour plaire à l'oreille, au corps et au cœur.

Avec le média texte, les choses sont très différentes. Le texte a une double vocation : possiblement artistique donc lié à l'imaginaire, à la vie mentale et émotionnelle, dans des formes et des genres comme le roman, la poésie, le théâtre, le texte a un usage dominant comme média d'information - dans ce cas, on lui demande absolument de dire la vérité et de s'abstenir de formuler des banalités comme des absurdités.

Le média texte doit dire la vérité et représenter le monde

Le texte est le vecteur principal :

  • de l'information
  • de la philosophie
  • des sciences

Quand vous avez découvert une nouvelle molécule, réalisé une étude sociologique, étudié l'implication d'une entreprise dans un scandale fiscal, vous ne sortez pas une chanson ni un dessin, vous écrivez un article, chargé de dire le réel et la vérité.

Or cette tâche, les LLMs s'avèrent fondamentalement incapables de l'accomplir - parce que par définition ils n'ont pas été conçus pour cela.

La prédiction du prochain mot ne peut pas suffire à satisfaire ce qu'on attend d'un texte

prochain mot llm
Une IA tente de deviner le prochain mot

Prédire le prochain token le plus probable mène à du texte vide

Schématiquement, un modèle de langage est une machine à prédire le prochain token (un token étant un morceau de mot).

Tout ce que savent faire ChatGPT, Mixtral, LLaMa, Gemini et toute la clique des LLMs, c'est cela et uniquement cela : prédire la probabilité d'un token en fonction d'un corpus et d'un prompt.

Cela explique qu'on puisse faire écrire n'importe quoi à ces modèles, et qu'ils ne s'aperçoivent jamais qu'ils sont en train de délirer de manière pseudo-savante : on a pu faire compter des œufs de vache à ChatGPT sans qu'il ne bronche, et j'ai pu me faire passer pour un escargot blessé demandant des conseils médicaux depuis le téléphone d'un promeneur sans que les LLM n'y voient rien à redire, comme si tout était normal.

En fait, le problème de fond des LLMs dans l'usage social qu'on voudrait en faire - par exemple, écrire des articles informatifs - est qu'ils ne savent rien de rien à propos du monde réel.

On leur dit "ciel", ils complètent "bleu" ou "gris", mais pas "électrique". On peut leur demander de définir le ciel, et ils répondent en gros en faisant une synthèse du corpus autour de ces tokens - la synthèse est parfois vraie, parfois fausse.

Exemple de banalités générées

Quand je demande à des LLMs de me rédiger une "Histoire du design danois", j'obtiens du pseudo-texte informatif.

Le plan de l'article n'a en moyenne aucun sens : au lieu de faire la périodisation exigée par le concept même d'histoire (faire l'histoire de quelque chose nécessite de comprendre les phases de l'existence de cette chose, genre début, milieu, fin d'un processus), les LLMs font un découpage sans queue ni tête, mélangeant allègrement les périodes ("l'âge d'or du design danois") et les thèmes ("La quête de minimalisme et d'élégance du design danois").

Un défaut fondamental des LLM tient à leur nature : parce qu'ils ne sont fait que pour prédire le token le plus probable, ils ne sortent en moyenne que du texte d'une banalité affligeante. Par exemple, une IA de copywriting m'a sorti cette série de clichés inutilisables :

Le design danois a toujours été synonyme d'élégance épurée, de fonctionnalité et de minimalisme raffiné. Les pionniers de ce mouvement ont laissé une empreinte indélébile sur le monde du design, inspirant les générations futures avec leur vision avant-gardiste et leur audace créative. Ces icônes ont défié les conventions, repoussant les limites de l'innovation tout en préservant l'essence même du design danois : la simplicité et la beauté intemporelle.

Elégance épurée, empreinte indélébile, générations futures, vision avant-gardiste : toutes ces associations de termes reviennent à dire que l'eau est une substance liquide, qui mouille et qu'on appelle la pluie quand elle tombe du ciel - donc fondamentalement à ne rien dire qu'on ne sache pas déjà avant même de lire le texte.

Les modèles de langage produisent le contraire de ce qu'on attend d'un texte

Sachant que la vocation informationnelle profonde du média texte consiste à dire quelque chose de nouveau sur le monde, à apporter une info, on peut donc conclure que les modèles de langage font précisément l'inverse de ce qu'on attend d'un texte : détruire toute nouveauté, tuer l'info. Texte IA = charabIA.

Sauf à accepter de publier ou d'utiliser du texte médiocre, mal pensé et banal, il s'avère donc que les fantastiques LLMs ne sont finalement pas bons à grand chose, parce qu'il leur manque un aspect essentiel des textes : le fait qu'ils représentent le monde, ce monde dont par définition les modèles de langage probabilistes ne savent strictement rien.

Les modèles de langage ont besoin d'une ontologie !

Une ontologie est une représentation ordonnée des êtres, de leurs propriétés et de leurs relations.

Seule la connexion des modèles de langage avec des ontologies permettra de les rendre fiables, exacts, novateurs - utilisables.

 

Qu'est-ce qu'une ontologie ?

Sans être moi-même un modèle prédictif, car je ne suis qu'un bout de viande qui écrit, je peux prédire que la prochaine révolution concernant l'IA textuelle consistera à brancher un LLM sur une ontologie.

"Qu'est-ce que c'est que ça ????"

Attendez, c'est pas si compliqué que ça en a l'air.

L'ontologie a plusieurs sens.

Ce terme grec mélange 2 mots :

  • ontos, ce qui est, l'être ;
  • et logos, le langage ou le savoir.

L'ontologie en philosophie

L'ontologie dans son sens premier est une branche fondamentale de la philosophie, qui étudie l'être, qui se pose la question : Qu'est-ce qui est ?

Avec des problèmes comme :

  • de quoi est fait l'univers ?
  • matière, esprit, idées ?
  • Dieu existe-t-il ?
  • le monde est-il déterminé ?
  • suis-je libre ?
  • dois-je suivre une loi morale fondamentale ?
  • Etc.

Ces problèmes mènent à des théories comme

  • le matérialisme (l'univers n'est que matière),
  • le spiritualisme (l'univers est fait en partie d'esprit),
  • l'idéalisme (l'univers est fait en partie d'idées),
  • le monisme (l'univers n'est fait que d'une substance),
  • le dualisme (l'univers est fait de deux substances), etc.

Heureusement, ce n'est pas de cette ontologie-là qu'on parle. Ouf !

L'ontologie informationnelle

L'ontologie a un autre sens dans le domaine de l'information : c'est une représentation structurée du réel cherchant l'exactitude et l'exhaustivité.

Une ontologie va représenter toute chose existante, tout être, de manière relationnelle, chaque être étant lié à d'autres par des relations.

Il peut s'agir d'un être réel ou imaginaire, abstrait ou concret... donc un chien, l'azote, le fonctionnalisme, Guillaume Meurice, une licorne, TotalEnergies, l'euro...

Par exemple l'être Forêt est lié à l'être Arbre (relation "constitué de"), l'être Arbre est lié aux êtres chêne, peuplier, sapin (relation "espèces d'arbres"), l'être Ecorce est liée à l'être Arbre (relation "partie de"), l'être incendie de forêt est lié à l'être Forêt (relation "évènement"), etc etc.

Ce ne sont pas juste des mots, donc des tokens au sens des LLMs, qui sont décrits et liés ainsi, parce que des mots différents peuvent représenter un seul et même être.

Par exemple "Paris", "capitale de la France", "ville-lumière", "ville organisatrice des JO 2024", utilisent des mots très différents pour faire référence au même être.

Ce sont bel et bien des choses, qui existent dans le réel - et même les êtres imaginaires existent dans le réel : par exemple les elfes existent en tant que personnages de fictions, dessins, peluches, etc.

L'ontologie de Google : le Knowledge Graph

Le moteur de recherche Google s'est doté d'une ontologie depuis 2012, pour mieux comprendre les requêtes des internautes et mieux y répondre.

Google a donc créé le Knowledge Graph, ou graphique des connaissances. Il s'agit d'une ontologie qui lui permet de "comprendre" que des expressions très différentes désignent la même chose - par exemple qu'IA veut dire intelligence artificielle - et que ces choses sont liées entre elles, pas juste par des mots, mais par des relations dans le monde réel, des faits.

Ainsi, le Knowledge Graph "sait" qu'un VTT est synonyme de "vélo de randonnée", et qu'il est une forme de vélo (d'autres formes sont le tricycle, le vélo de route etc), qui peut se décliner en modèles pour homme, femme ou enfant ; il "sait" qu'un tel objet a des roues, qui ont souvent des pneus mais pas forcément.

Google nomme "entités" (entities, en anglais) les objets qui cmposent son Knowledge Graph. Ce terme étant peu connu, je vais plutôt continuer à parler d'êtres ou d'objets, mais fondamentalement c'est bel et bien d'entités qu'il s'agit dans cet article.

L'ontologie wikidata

Crée en 2012, wikidata est une forme d'ontologie basée sur le mouvement wikimedia et wikipedia. Son objectif est de mettre sous forme de base de donnée relationnelle toutes les connaissances contenues dans wikipédia, dans toutes les langues - ce qui implique déjà de faire le lien entre eau, aqua, agua, Wasser, water, etc.

L'ontologie Schema.org

L'initiative Schema.org représente une autre tentative pour transformer le chaos informationnel du web en données structurées cohérentes.

Ce langage représente des êtres comme "Organization", "Person", "Product", liste leurs attributs autorisés, les formats que peuvent prendre ces attributs, les relations possibles entre ces entités.

Bref, je n'entre pas dans le détail, je voulais juste montrer qu'il existe, depuis déjà 12 ans, d'énormes ontologies informatiques (il en existait d'autres avant !), et que le concept n'a donc rien de bien nouveau.

Connecter les modèles de langage (LLM) avec des ontologies

Pour performer, les LLMs ne devraient tout simplement pas fonctionner comme ils fonctionnent.

Prédire les objets avant de prédire que les tokens

Plus précisément, ils ne devraient pas avant tout prédire le prochain token, mais calculer la pertinence des principaux êtres connectés à telle série de tokens, puis l'organiser, puis recourir à leur algorithme de prédiction de tokens.

Par exemple, pour traiter correctement la demande de rédaction d'un article sur le thème "Histoire du design danois", il faudrait d'abord que les modèles de langage intègrent le fait que le concept d'histoire commande une périodisation (un découpage temporel), puis sache transformer ce concept en une série de périodes marquées par des dates.

Une réponse correcte serait par exemple :

  • Avant 1920 : l'ère artisanale
  • 1920-1945 : le design danois entre dans l'ère moderniste et industrielle, sous l'influence du Bauhaus, tout en gardant une esthétique marquée par l'artisanat traditionnel

Ensuite, il faudrait que le 2è point fasse l'objet d'une recherche des êtres les plus pertinents pendant cette période : les designers influents, les enseignants modernistes, les marques innovantes, les nouveaux procédés industriels, etc. Ce ne sont pas juste des noms qui seraient cherchés, mais bel et bien des choses et des faits - typiquement les objets d'une ontologie.

En d'autres termes, il faut que les modèles de langage dépassent cette phase très superficielle, où ils en restent à l'écume des mots, et intègrent des ontologies faites d'objets dotés de propriétés, intrinsèques ou accidentelles (par exemple avoir deux jambes quand on est humain, ou ne plus en avoir après un accident), et de relations avec d'autres objets.

Traduire les corpus en ontologies

Pour que les LLMs puissent fonctionner par objets dotés de propriétés et de relations, il faut qu'ils deviennent en partie des traducteurs de corpus en ontologies.

En effet, la simple analyse statistique d'un corpus ne suffit pas à dire des choses vraies.

ChatGPT m'a par exemple affirmé que Philippe Starck était un designer italien : il est évident que cela s'explique par le fait que le design italien est le plus puissant du monde, très riche en designers, marques, œuvres célèbres, écoles, médias, et que donc beaucoup de pages web du corpus d'apprentissage de ChatGPT mentionnaient Philippe Starck dans un contexte où il était associé à des designers italiens, des marques italiennes, des meubles italiens etc. Le modèle a donc "appris" une erreur basée sur une corrélation bien réelle, mais pas sur les faits.

Les erreurs de débutant et autres absurdités des LLM se règleraient facilement par l'adjonction d'une ontologie, qui ferait de "français" une propriété intrinsèque de l'objet "Philippe Starck", et pas juste une corrélation statistique hasardeuse ; qui interdirait aux LLM d'admettre le faux fait qu'un escargot puisse leur écrire depuis un smartphone.

Traduire un corpus en ontologie implique d'identifier les êtres malgré la forte diversité de leurs représentations textuelles, et d'en reconnaitre les propriétés et les relations avec les autres êtres ; une lourde tâche documentaire qu'un réseau neuronal, aidé de quelques milliers de vérificateurs humains, devrait pouvoir apprendre à faire.

Cette traduction ou transposition des corpus textuels, ou plus généralement documentaires (tous types de documents), en ontologies, pourrait servir notamment à employer les LLM comme chatbots ou systèmes experts, en leur fournissant tout le savoir des individus et des entreprises, dont les corpus d'entraînement des LLM n'ont aucune connaissance.

Par exemple, j'ai travaillé pour une entreprise qui vend du béton ciré. Elle a une liste de produits qui portent des noms. Si j'interroge ChatGPT, LLaMa ou Mixtral sur ces produits, ils n'en savent évidemment rien, donc ces LLMs ne peuvent servir ni de chatbots, ni de documentalistes internes, ni de rien d'autres.

Si je ne fais que fournir des PDFs sur ces produits à des LLMs, en mode fine-tuning ou RAG, j'obtiendrai certes de meilleurs résultats, mais pas autant que si ces PDFs étaient d'abord traduits en ontologie : tel produit a comme caractéristiques intrinsèque un nom, un matériau, des couleurs, une fonction, des conditions d'usage, un poids, un prix etc etc.

De là, on pourrait interroger la base de connaissance fondée sur l'ontologie de cette entreprise, et obtenir des réponses fondées sur des faits et pas juste sur des corrélations statistiques entre des mots.

Exemples d'applications d'ontologies associées à des LLMs

On peut envisager de nombreuses applications de cette combinaison entre des ontologies et des modèles de langage prédictifs.

Médecine

Une ontologie médicale connecterait l'ensemble des êtres de la discipline : organes, chercheurs, labos, médecins, molécules, maladies, médicaments... On obtiendrait ainsi un système expert beaucoup plus fiable que la soupe statistique à la sauce probabiliste.

Droit

Une ontologie juridique (probablement sur des bases nationales), recenserait tous les êtres du droit : lois, décrets, jugements, tribunaux, etc etc. Sur une base de faits bien établis, les raisonnements des LLMs seraient considérablement plus corrects qu'actuellement.

Technologie

La connexion entre une base de connaissances identifiants tous les brevets, toutes les machines, toutes les technologies existantes, et un modèle de langage, permettrait de faire calculer à ce dernier des innovations pas encore découvertes - au contraire des LLMs qui ne savent que répéter tout ce qu'on sait déjà. Au lieu de prédire uniquement le token probable, une IA experte en technologie chercherait à mettre en relation l'existant d'une manière originale.

Beaucoup d'innovations technologiques consistent en effet à transposer un concept d'un domaine à un autre : de la lance propulsée à la main, on fait la flèche propulsée par le relâchement de la tension d'une corde...

Fondez des startups d'ontologie !

Si jamais les géants de l'IA ne sont pas déjà en train d'y travailler, la connexion entre LLM et ontologies sera probablement la prochaine révolution hi-tech qui rendra les modèles de langage vraiment utilisables.

Après avoir eu l'idée de cette article, j'ai eu l'idée de googler "LLM ontology", et découvert un peu tard qu'il y a des articles en anglais sur ce thème depuis 2023. Je n'ai pas fouillé plus que ça ; les articles que j'ai lus ne m'ont pas semblé plus approfondis que ce que je viens d'écrire, et plutôt moins, alors que je suis loin d'être expert. (Comme je vous l'ai dit en intro, je ne suis qu'un gros nigaud qui réfléchit.)

Pourquoi je dis ça ?

Parce qu'à mon avis il y a des startups à monter là-dessus ; ou peut-être pas si, comme je le crois, les ténors du domaine sont déjà en train d'y travailler. Pour l'instant je n'ai entendu aucune nouvelle de ce genre néanmoins. A mon avis, les premiers qui baseront un LLM sur une ontologie et pas seulement sur un corpus, auront un avantage concurrentiel certain (mais peut-être pas pour bien longtemps).

Hélas je n'ai aucune compétence technique pour réaliser un tel projet : si vous les avez, bon courage, et si vous connaissez des gens qui les ont, allez leur souffler une bonne idée !

1 réflexion sur “Les IA de type modèle de langage LLM ne seront performantes que quand elles seront connectées à une ontologie (base de connaissances / Knowledge Graph)”

  1. Julien Neville

    Article assez inspirant (et déjà un peu obsolète: lire ce que produit Sonnet 4 sur "le design danois;))
    En tant qu'ingénieur (pas spécialement informaticien), je m'intéresse moi-même beaucoup aux ontologies et aux systèmes experts.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Inscrivez-vous à nos newsletters
Retour en haut