Pourquoi l'AI Factory est une impasse
Charger les documents, construire un index RAG, brancher un LLM. Tous les programmes d'IA d'entreprise commencent ainsi — et la plupart se terminent de la même manière. Le problème n'est pas le modèle.
Ces deux dernières années ont vu naître une catégorie entière : l'AI Factory. Toutes les présentations se ressemblent.
Chargez vos documents. Construisez un index RAG. Branchez un LLM. Obtenez un assistant.
Cela paraît suffisant. En démonstration, c'est superbe. Puis, dans un nombre frappant d'entreprises, le projet s'arrête discrètement quelque part entre le pilote et la production.
Pas parce que le modèle était mauvais. Pas parce qu'il manquait des GPU. Pas parce que la recherche aurait pu être mieux réglée.
Le problème se situe une couche plus bas.
Ce qu'un LLM sait réellement de votre entreprise
Un modèle de langage génère des suites de texte plausibles. C'est une capacité immense, et ce n'est pas, à elle seule, la capacité sur laquelle on bâtit un système de décision d'entreprise.
Le modèle ne sait pas lesquels de vos documents ont force juridique et lesquels sont des brouillons oubliés sur un disque partagé. Il ne sait pas qu'un arrêté de mars annule une instruction de janvier. Il ne sait pas qu'une règle ne s'applique qu'à une catégorie de marchandises, à un segment de clients, à une juridiction. Il ne sait pas expliquer pourquoi il a tranché ainsi sous une forme qu'un auditeur accepterait. Et il ne sait pas vérifier sa propre conclusion autrement qu'avec davantage de texte.
Surtout, il n'a aucune notion de responsabilité — cette propriété qui fait d'une décision d'entreprise une décision d'entreprise. Quelqu'un la signe. Quelqu'un peut être appelé à s'en expliquer. Quelqu'un peut la révoquer.
Rien de tout cela n'est dans les poids. Rien de tout cela n'est non plus dans l'index vectoriel.
Pourquoi la démonstration fonctionne et le déploiement échoue
La démonstration fonctionne parce qu'on y pose des questions. « Que dit notre politique de retours ? » « Résume ce contrat. » « Quels fournisseurs sont concernés ? »
Le RAG excelle à cela. C'est une très bonne recherche dotée d'une interface en langue naturelle.
Le déploiement échoue parce que la production réclame des décisions et des actions. Classer cet envoi. Valider cette facture. Émettre cette réponse au régulateur. Modifier cet enregistrement. Or une décision a des exigences qu'un résultat de recherche n'a pas :
- elle doit être traçable jusqu'à la norme ou l'enregistrement qui la fonde ;
- elle doit être reproductible — le même cas tranché de la même manière demain ;
- elle doit être bornée — le système ne doit pas pouvoir accomplir une action que personne n'a autorisée ;
- elle doit être révisable par un humain, aux points qui comptent, et à ceux-là seulement.
Une AI Factory ne fournit rien de cela. Elle fournit un modèle et un index, et laisse ces quatre propriétés difficiles à l'intégrateur. Celui-ci les reconstruit à la main, projet par projet, dans des gabarits de prompts et du code de liaison — et c'est précisément cette couche qui ne survit ni au volume réel, ni aux audits, ni au renouvellement des équipes.
Deux modes d'échec
En pratique, ces projets échouent dans l'une de deux directions.
Ils se réduisent à une recherche d'entreprise. L'issue honnête. L'organisation obtient un meilleur moteur de recherche interne. C'est utile, mais ce n'est pas la transformation pour laquelle le budget a été voté.
Ils deviennent un chat coûteux au-dessus des documents. L'issue désagréable. Le système arrive entre les mains de gens qui ont besoin de réponses sur lesquelles agir ; les réponses sont le plus souvent justes et parfois fausses avec aplomb ; et la confiance s'effondre en silence. Après avoir surpris deux fois le système en train d'inventer une référence, un expert cesse de l'utiliser — et aucune amélioration de la précision moyenne ne le ramène, car le problème n'a jamais été la précision moyenne. Le problème est que rien, dans l'architecture, ne distinguait une réponse fondée d'une réponse inventée.
Les deux issues ont la même racine : l'architecture s'arrête à la génération. Après le modèle, il n'y a rien.
La couche manquante
Regardez ce qui se passe réellement quand un collaborateur expérimenté décide dans un domaine réglementé.
Il forme rapidement une hypothèse — c'est la part intuitive et associative, et c'est précisément celle que les LLM reproduisent bien. Puis il fait ce qu'un modèle de langage ne fait pas du tout : il la vérifie. Contre la nomenclature. Contre la version en vigueur du texte. Contre la jurisprudence. Contre les limites de sa propre délégation. Si cela ne tient pas, il révise. Si cela tient mais dépasse son niveau, il escalade.
L'hypothèse est neuronale. La vérification est symbolique. Le travail professionnel compétent, c'est la boucle entre les deux.
L'IA d'entreprise n'a, presque partout, construit que la première moitié. Elle a industrialisé la production d'hypothèses et laissé la vérification, l'autorisation et l'explication à l'improvisation.
C'est pourquoi nous pensons que l'industrie s'est trompée de direction. Il ne faut pas une AI Factory de plus — un pipeline qui s'achève avec les tokens. Il faut une autre architecture : un environnement d'exécution pour systèmes intelligents, où le modèle propose, le modèle du domaine valide, les politiques décident de ce qui est permis, les outils agissent, et l'humain assume les décisions qu'il doit assumer.
Nous appelons cela un harness system.
Prochain article de la série : pourquoi le RAG ne suffit pas et ce qu'apporte un modèle sémantique du domaine — Pourquoi le RAG ne sera jamais le cerveau d'une entreprise.