Что такое Cradle?
Cradle — это harness system для локальных LLM, оркестрационный и управляющий слой с двухуровневой системой рисков и человеческим одобрением, а не просто агент.
Не просто агент — harness system
Большинство инструментов «локального AI-агента» передают языковой модели промпт и пересылают всё, что она вернула. Cradle другой: это harness system. Языковая модель — это двигатель, но ценность в том, что вокруг него построено: оркестрационный и управляющий слой, который решает, какой агент отвечает, обосновывает ответ в ваших документах, пропускает каждый ответ через двухуровневую систему рисков и направляет любую неопределённость человеку-оператору, прежде чем она достигнет внешнего мира.
Ничего не покидает периметр без прохождения через эту упряжь. В этом весь смысл: on-premise, работающий офлайн, проверяемый ИИ, который можно действительно поставить перед реальными клиентами и реальными данными.
Что делает Cradle
Cradle получает сообщения из чат-каналов (Telegram, встраиваемый виджет или простой HTTP API), триажирует каждое, готовит обоснованный ответ локальной LLM и либо отправляет автоматически, либо откладывает на одобрение оператора:
Входящее сообщение
→ Risk L1 (детерминированные правила) → PII / инъекции / опасные признаки
→ Risk L2 (LLM-классификатор) → { category, risk, confidence, skills }
→ Router → выбирает агента по роли и навыкам
→ RAG → опирает черновик на вашу базу знаний
→ Agent → пишет ответ с цитатами
→ Decision:
green → автоответ
yellow / red → Inbox оператора → approve / edit / reject → sendКаждый шаг записывается: оценки риска, точные фрагменты источников, стоимость на тикет и журнал аудита API. Результат — проверенный ответ с полной документированной цепочкой, а не непрозрачный выход модели.
Столпы harness
- Двухуровневая система рисков (СУР). Уровень 1 — детерминированные правила
(паттерны drop-table, учётные данные, PII → red/yellow). Уровень 2 —
LLM-классификатор, возвращающий структурированный вердикт
{category, risk, confidence, reasoning, requiredSkills}. Red и yellow никогда не уходят автоматически. - Human-in-the-loop одобрение. Неопределённые ответы попадают в Inbox оператора, где их можно одобрить, отредактировать или отклонить, прежде чем канал их увидит.
- Retrieval-augmented grounding. Ответы опираются на ваши собственные документы
через локальный векторный поиск (
sqlite-vec) с inline-цитатами — никакого внешнего API, данные не покидают машину. - Полностью локальный inference. Модели работают через
node-llama-cpp(llama.cpp). После скачивания моделей Cradle работает полностью офлайн. Не нужен Ollama или облачный endpoint. - Auditability by construction. Журнал рисков, исходные цитаты, события стоимости и использование API-ключей — это первоклассные таблицы, а не дополнительные плагины.
Три компонента
| Компонент | Что это | Роль |
|---|---|---|
| Cradle (desktop app) | Electron-клиент | Консоль: настройка коннекторов, ревью и одобрение результатов. Сам inference не запускает. |
Cradle Server / cradle-cli | Headless cradle-server + тонкий CLI | Мозг: хранит данные, коннекторы и запускает inference. |
| SmartNotes | Захват заметок по голосовому триггеру | Говори во время работы; SmartNotes структурирует заметки и может отправлять задачи в Cradle. |
Куда идти дальше
- Впервые с Cradle? Установите desktop-приложение.
- GPU-сервер? Следуйте руководству по GPU-серверу.
- Нужна общая картина? Читайте обзор архитектуры.
- Предлагаете Cradle как услугу? Смотрите Cradle как датацентр-сервис.
- Используете голосовой помощник для заметок? Читайте документацию SmartNotes.