Что такое Cradle?

Cradle — это harness system для локальных LLM, оркестрационный и управляющий слой с двухуровневой системой рисков и человеческим одобрением, а не просто агент.

Не просто агент — harness system

Большинство инструментов «локального AI-агента» передают языковой модели промпт и пересылают всё, что она вернула. Cradle другой: это harness system. Языковая модель — это двигатель, но ценность в том, что вокруг него построено: оркестрационный и управляющий слой, который решает, какой агент отвечает, обосновывает ответ в ваших документах, пропускает каждый ответ через двухуровневую систему рисков и направляет любую неопределённость человеку-оператору, прежде чем она достигнет внешнего мира.

Ничего не покидает периметр без прохождения через эту упряжь. В этом весь смысл: on-premise, работающий офлайн, проверяемый ИИ, который можно действительно поставить перед реальными клиентами и реальными данными.

Что делает Cradle

Cradle получает сообщения из чат-каналов (Telegram, встраиваемый виджет или простой HTTP API), триажирует каждое, готовит обоснованный ответ локальной LLM и либо отправляет автоматически, либо откладывает на одобрение оператора:

Входящее сообщение
  → Risk L1 (детерминированные правила)  → PII / инъекции / опасные признаки
  → Risk L2 (LLM-классификатор)            → { category, risk, confidence, skills }
  → Router                                 → выбирает агента по роли и навыкам
  → RAG                                    → опирает черновик на вашу базу знаний
  → Agent                                  → пишет ответ с цитатами
  → Decision:
      green            → автоответ
      yellow / red     → Inbox оператора → approve / edit / reject → send

Каждый шаг записывается: оценки риска, точные фрагменты источников, стоимость на тикет и журнал аудита API. Результат — проверенный ответ с полной документированной цепочкой, а не непрозрачный выход модели.

Столпы harness

  • Двухуровневая система рисков (СУР). Уровень 1 — детерминированные правила (паттерны drop-table, учётные данные, PII → red/yellow). Уровень 2 — LLM-классификатор, возвращающий структурированный вердикт {category, risk, confidence, reasoning, requiredSkills}. Red и yellow никогда не уходят автоматически.
  • Human-in-the-loop одобрение. Неопределённые ответы попадают в Inbox оператора, где их можно одобрить, отредактировать или отклонить, прежде чем канал их увидит.
  • Retrieval-augmented grounding. Ответы опираются на ваши собственные документы через локальный векторный поиск (sqlite-vec) с inline-цитатами — никакого внешнего API, данные не покидают машину.
  • Полностью локальный inference. Модели работают через node-llama-cpp (llama.cpp). После скачивания моделей Cradle работает полностью офлайн. Не нужен Ollama или облачный endpoint.
  • Auditability by construction. Журнал рисков, исходные цитаты, события стоимости и использование API-ключей — это первоклассные таблицы, а не дополнительные плагины.

Три компонента

КомпонентЧто этоРоль
Cradle (desktop app)Electron-клиентКонсоль: настройка коннекторов, ревью и одобрение результатов. Сам inference не запускает.
Cradle Server / cradle-cliHeadless cradle-server + тонкий CLIМозг: хранит данные, коннекторы и запускает inference.
SmartNotesЗахват заметок по голосовому триггеруГовори во время работы; SmartNotes структурирует заметки и может отправлять задачи в Cradle.

Куда идти дальше