Pourquoi le RAG ne sera jamais le cerveau d'une entreprise
La recherche trouve du texte. Une décision exige une structure : ce qui prime sur quoi, ce qui s'applique à qui, ce qui a force juridique. Cette structure s'appelle une ontologie, et aucun index vectoriel ne la contient.
Presque toute l'IA d'entreprise se construit aujourd'hui autour d'une seule idée. Rassembler les documents. Construire un index vectoriel. Brancher un LLM. Obtenir des réponses.
Cela fonctionne remarquablement pour trouver de l'information. Cela n'aide presque pas à décider. Il vaut la peine d'être précis sur les raisons : elles sont structurelles, et non affaire de réglage.
Un cas concret : le classement douanier
Prenez une administration douanière. Des dizaines de milliers de documents : lois, arrêtés, nomenclature tarifaire et notes explicatives, accords internationaux, renseignements tarifaires contraignants, jurisprudence, instructions internes.
Supposons que le modèle ait tout lu. Chaque page, parfaitement retrouvée, dans le contexte.
Il ignore toujours :
- Ce qui prime sur quoi. Un arrêté ministériel ne prévaut pas sur une obligation conventionnelle. Une instruction interne ne prévaut sur aucun des deux. La hiérarchie est une propriété de l'ordre juridique, pas du texte.
- Ce qui est encore en vigueur. Un document n'annonce presque jamais sa propre abrogation. La modification vit dans un autre texte, publié plus tard, parfois dans un autre registre.
- Le champ d'application. Une règle sur les « articles textiles » vise un ensemble précis de positions tarifaires, et savoir lequel exige la nomenclature, pas la phrase.
- Où sont les contradictions. Deux dispositions contradictoires se ressemblent pour une similarité cosinus. Les départager suppose de connaître la règle de conflit.
- Ce qui a déjà été décidé. La cohérence avec les décisions antérieures sur des marchandises substantiellement similaires est souvent l'exigence juridique réelle — et « substantiellement similaire » est une relation du domaine, pas une distance textuelle.
Un expert traite tout cela sans effort, non parce qu'il a mémorisé davantage de documents, mais parce qu'il possède un modèle interne de l'organisation du domaine : quelles entités existent, comment elles se relient, quelles relations impliquent quelles obligations, ce qui l'emporte sur quoi.
Ce modèle est exactement ce dont les systèmes de recherche sont dépourvus. C'est ce qu'on appelle une ontologie.
L'ontologie, au sens de l'ingénieur
Le mot traîne un héritage académique ; soyons concrets. Ici, une ontologie est un modèle formel et vérifiable par machine d'un domaine :
- les entités — marchandises, déclarations, parties, procédures, autorisations ;
- les relations — est-un, fait-partie-de, abroge, exige, exclut, s'applique-à ;
- les contraintes — cette procédure exige cette autorisation ; ce classement exclut celui-là ;
- la provenance — chaque assertion traçable jusqu'à sa source, avec sa version et sa période de validité.
Rien d'exotique. Toute organisation réglementée sérieuse en possède déjà des fragments : nomenclatures, registres, référentiels, arbres de décision d'un manuel de conformité, règles tacites transmises d'un senior à un junior. Simplement, rien de tout cela n'est écrit sous une forme exploitable par une machine — et c'est précisément le savoir qu'une AI Factory laisse tomber en silence.
Notez ce que l'ontologie apporte au-delà des plongements. La similarité vectorielle est une notion unique, indifférenciée et symétrique de « proximité ». Un domaine fonctionne avec de nombreuses relations typées et orientées, et la différence entre « ces deux règles se ressemblent » et « cette règle abroge celle-là » est la différence entre un résultat de recherche et une décision.
Ce qui change quand la structure existe
Avec un modèle du domaine, une réponse générée devient quelque chose que l'on peut interroger.
Le LLM propose un classement. La couche symbolique peut alors vérifier : la position proposée existe-t-elle dans la version en vigueur de la nomenclature ? Ses notes d'exclusion contredisent-elles la description des marchandises ? L'autorisation requise est-elle présente ? Une décision antérieure couvre-t-elle un cas substantiellement similaire ? Puis confirmer la proposition, la rejeter avec un motif, ou la router vers un humain parce que le cas se trouve dans une zone réellement ambiguë.
Trois propriétés apparaissent, hors de portée de la recherche seule.
L'explicabilité. Non pas « le modèle a porté attention à ces tokens », mais une chaîne : cette position, en raison de cette note, en vigueur depuis cette date, cohérente avec ce précédent. Une explication avec laquelle un expert peut être en désaccord — la seule qui vaille.
La reproductibilité. Le même cas produit la même décision, car la partie décisive n'est pas échantillonnée dans une distribution. La créativité du modèle se limite à proposer ; l'acceptation est déterministe.
Le bornage. On peut empêcher le système d'affirmer ce que le modèle du domaine déclare impossible. Non par une prière dans un prompt, mais parce que l'assertion échoue à une vérification avant de devenir une réponse.
Ce n'est pas « le RAG est inutile »
Non. La recherche est le bon outil pour ancrer la langue dans votre corpus, et elle reste dans l'architecture. L'affirmation est plus étroite et plus ferme : la recherche est un composant, pas une architecture. Un système dont la conception se résume à « retrouver puis générer » n'a aucun endroit où loger la hiérarchie des normes, la validité, l'autorisation ou la preuve — tout cela finit dans des chaînes de prompt, où rien n'est opposable.
L'alternative n'est pas d'abandonner les modèles de langage, mais de leur donner un contrepoids. Le neuronal pour la langue, l'extraction, l'hypothèse et l'interaction ; le symbolique pour la structure, les contraintes, la hiérarchie et la preuve. Les systèmes bâtis sur ce couple s'appellent neuro-symboliques, et c'est là, selon nous, que va l'IA d'entreprise crédible.
Reste la question pratique : qu'est-ce qui fait tourner cette boucle ? Il faut bien quelque chose pour tenir ensemble le modèle, l'ontologie, les politiques, les outils et l'humain dans un même flux d'exécution.
Prochain article : Qu'est-ce qu'un harness system — l'architecture qui s'interpose entre un agent et le réel.