Нейросимволическая среда исполнения
Языковые модели предсказывают токены. Организации живут знаниями, правилами и ответственностью. Нейросимволическая среда исполнения — слой, где предложение модели встречается с ограничениями предметной области, шаг за шагом, во время работы.
Большие языковые модели изменили способ взаимодействия человека с компьютером. Но главную проблему корпоративных систем они не решили.
Организации работают не с текстом. Они работают со знаниями — структурами, регламентами, юридическими ограничениями и ответственностью за результат. У языковой модели ничего этого нет. Она предсказывает следующий токен, крайне хорошо.
Поэтому корпоративному AI нужен ещё один слой. Мы называем его нейросимволической средой исполнения: средой, которая объединяет два принципиально разных способа рассуждения и постоянно переключается между ними по ходу задачи.
Две половины
Нейронная половина отвечает за то, в чём статистические модели сильны: понимание языка, чтение неопрятных документов, извлечение сущностей, порождение гипотез, планирование многошаговой работы и диалог с человеком. Она быстрая, универсальная, терпимая к неоднозначности — и она выдаёт гладкий, хорошо структурированный неверный ответ ровно тем же тоном, что и верный.
Символьная половина хранит то, что обязано быть точным: онтологию предметной области, правила и ограничения, классификаторы и справочники, политики, типизированные связи между сущностями и цепочки обоснования. Она узкая, хрупкая за пределами своей области и — что критично — проверяемая. Символьное утверждение либо выполняется, либо нет, и причину можно распечатать.
Ни одной из них недостаточно. Чисто нейронная система красноречива и безответственна. Чисто символьная — ответственна и не может прочитать письмо. Вся интересная инженерия — в их переплетении.
Цикл
Во время работы задача не идёт по схеме «модель, потом проверка». Она колеблется.
- Намерение. Нейронный слой превращает запрос — сообщение, документ, элемент очереди — в структурированное намерение: что спрашивают, о каких сущностях, от чьего имени.
- Заземление. Подтягивается релевантный материал: документы, записи, прежние решения, применимые нормы. Здесь и есть место поиска — как шага, а не как архитектуры.
- Предложение. Модель предлагает следующее действие: классификацию, вызов инструмента, черновик ответа, план.
- Символьная проверка. Предложение проверяется по модели предметной области. Существуют ли упомянутые сущности? Валидна ли классификация в текущей редакции номенклатуры? Выполняются ли ограничения? Действительно ли процитированные источники подтверждают утверждение?
- Оценка политик. Независимо от того, корректно ли предложение, — разрешено ли оно? Этот агент, этот инструмент, эти данные, этот пользователь, этот порог, эта юрисдикция.
- Исполнение или эскалация. Если проверка пройдена и действие разрешено — инструмент выполняется. Если проверка провалена, отказ вместе с причиной возвращается модели как вход для пересмотренного предложения. Если всё валидно, но решение значимо, — остановка и ожидание человека.
- Верификация. После исполнения результат проверяется снова: совпал ли эффект с намерением, корректен ли формат вывода, удовлетворяет ли запись инвариантам, которым должна.
- След. Каждый шаг выше фиксируется как свидетельство, а не как строчка лога: предложение, пройденная проверка, применённое правило, согласовавший человек.
Провал шага 4 — не аварийная ситуация. Это и есть механизм. Отклонённое предложение с машиночитаемой причиной является лучшим входом для модели, чем исходный промпт, — поэтому цикл сходится там, где однопроходная схема галлюцинировала бы.
Что это даёт
Объяснимость становится структурной, а не повествовательной. Система не просит модель объяснить себя — самообъяснение модели это ещё одна генерация с теми же характеристиками надёжности, что и ответ. Объяснением служит след: сработавшие правила, проверенные источники, выполненные ограничения.
Воспроизводимость становится возможной, потому что решающие шаги детерминированы. Сэмплирование модели влияет на то, какие предложения рассматриваются; оно не влияет на то, какие принимаются. Прогоните тот же случай завтра на той же модели области и тех же политиках — получите то же решение, а когда решение изменится, можно показать, что именно изменилось.
Доверие вытекает из двух предыдущих плюс возможность ограничить поведение. Организация может заявить и продемонстрировать, что класс действий недостижим, — потому что решает слой политик, а не промпт.
Чего это не даёт
Об этом важно говорить внятнее, чем о преимуществах.
Такая архитектура не делает систему безопасной по построению и не является формальной верификацией. Проверки хороши ровно настолько, насколько хороша модель предметной области за ними, а её построение — реальная работа, которую ни один вендор не выполняет за вас на демо. Покрытие частичное: часть утверждений проверяема по структуре, часть нет, и среда, которая делает вид, что это не так, хуже той, которая направляет непроверяемое человеку.
Галлюцинации это тоже не устраняет. Оно меняет их цену. Необоснованное предложение, провалившее проверку и не ставшее действием, — внутреннее событие. То же предложение в схеме «найти и сгенерировать» — ответ, на основании которого кто-то действует.
Честная формулировка звучит так: не гарантия, а разница между непроверенной генерацией и проверенным, ограниченным, атрибутируемым решением.
Почему мы считаем это следующим этапом
Агентные платформы сегодня конкурируют в том, насколько легко собрать агента. Эта конкуренция закончится, потому что собирать агентов становится проще каждый квартал и в какой-то момент перестанет быть отличием вовсе.
Сложным останется другое — эксплуатировать агентов в организации, у которой есть аудиторы, регуляторы, ответственность и сотрудники. Это задача среды исполнения, и именно по этому слою, как мы думаем, будут судить следующее поколение платформ.
Заключительная статья серии: Почему OpenCradle — что из этого следует для продукта и почему новый инфраструктурный слой неизбежен.