Почему AI Factory — это тупиковый путь
Загрузили документы, построили RAG, подключили LLM. Так начинается почти каждая корпоративная AI-программа — и так же почти каждая заканчивается. Проблема не в модели.
За последние два года появилась целая категория продуктов — AI Factory. Любая презентация выглядит примерно одинаково.
Загружаете документы. Строите RAG-индекс. Подключаете LLM. Получаете AI-помощника.
Кажется, что этого достаточно. На демо это выглядит прекрасно. А потом, в поразительном числе компаний, проект тихо останавливается где-то между пилотом и продуктивом.
Не потому что модель плохая. Не потому что мало GPU. Не потому что RAG можно было настроить лучше.
Проблема лежит на слой глубже.
Что LLM на самом деле знает о вашей компании
Языковая модель генерирует правдоподобные продолжения текста. Это огромная способность — и сама по себе она не та способность, на которой можно строить корпоративную систему принятия решений.
Модель не знает, какие из ваших документов имеют юридическую силу, а какие остались черновиком на общем диске. Не знает, что мартовский приказ отменяет январскую инструкцию. Не знает, что правило относится только к определённой категории товаров, определённому сегменту клиентов, определённой юрисдикции. Не умеет объяснить, почему она решила именно так, в форме, которую примет аудитор. И не умеет проверить собственный вывод ничем, кроме нового текста.
И самое главное — у неё нет понятия ответственности, того свойства, которое делает корпоративное решение корпоративным решением. Кто-то его подписывает. Кого-то можно спросить. Кто-то может его отменить.
Ничего из этого нет в весах модели. И в векторном индексе этого тоже нет.
Почему демо работает, а внедрение — нет
Демо работает, потому что на демо задают вопросы. «Что у нас написано про возвраты?» «Кратко изложи этот договор.» «Каких поставщиков это касается?»
С этим RAG справляется отлично. Это очень хороший поиск с естественно-языковым интерфейсом.
Внедрение проваливается, потому что продуктив требует решений и действий. Классифицировать поставку. Согласовать счёт. Выпустить ответ регулятору. Изменить запись. А у решения есть требования, которых нет у результата поиска:
- оно должно быть прослеживаемым — до конкретной нормы или записи, которая его обосновывает;
- оно должно быть воспроизводимым — тот же случай завтра должен решаться так же;
- оно должно быть ограниченным — система не должна иметь возможности выполнить действие, которое никто не разрешал;
- оно должно быть проверяемым человеком — в тех точках, где это важно, и только в них.
AI Factory не даёт ничего из этого. Она даёт модель и индекс, а четыре сложных свойства оставляет интегратору. Интеграторы строят их вручную, под каждый проект, в промпт-шаблонах и питоновской склейке — и именно этот слой не переживает встречи с реальным объёмом, реальным аудитом и реальной текучкой кадров.
Два сценария провала
На практике проекты AI Factory заканчиваются одним из двух способов.
Они сжимаются до корпоративного поиска. Честный исход. Компания получает хороший поиск по внутренним документам. Это имеет ценность, но не ту трансформацию, под которую утверждался бюджет.
Они превращаются в дорогой чат над документами. Неприятный исход. Система попадает к людям, которым нужны ответы, на основе которых можно действовать; ответы чаще всего верные, а изредка — уверенно неверные; и доверие тихо исчезает. После того как эксперт дважды поймал систему на выдуманной ссылке, он перестаёт ею пользоваться — и повышение средней точности его уже не вернёт, потому что дело было не в средней точности. Дело в том, что архитектура никак не различала обоснованный ответ и выдуманный.
Оба исхода растут из одного корня: архитектура заканчивается на генерации. После модели нет ничего.
Отсутствующий слой
Посмотрите, что реально происходит, когда опытный сотрудник принимает решение в регулируемой области.
Он быстро формирует гипотезу — это интуитивная, ассоциативная часть, и именно её LLM воспроизводит по-настоящему хорошо. А потом делает то, чего языковая модель не делает вовсе: проверяет её. По классификатору. По действующей редакции нормы. По прецеденту. По границам собственных полномочий. Если не сходится — пересматривает. Если сходится, но выше его уровня — эскалирует.
Гипотеза — нейронная. Проверка — символьная. Компетентная профессиональная работа — это цикл между ними.
Корпоративный AI почти повсеместно построил только первую половину. Он индустриализовал генерацию гипотез и оставил проверку, авторизацию и объяснение на импровизацию.
Поэтому нам кажется, что индустрия пошла не туда. Нужна не очередная AI Factory — конвейер, который заканчивается вместе с токенами. Нужна другая архитектура: среда исполнения интеллектуальных систем, в которой модель предлагает, модель предметной области проверяет, политики решают, что разрешено, инструменты выполняют, а человек владеет теми решениями, которыми обязан владеть.
Мы называем это Harness System.
Следующая статья серии: почему корпоративному AI недостаточно RAG и что даёт семантическая модель предметной области — Почему RAG никогда не станет мозгом компании.