← Решения

Цепочка микро-агентов

Не прокси в LLM — цепочка микро-агентов

Запрос не уходит целиком в одну модель. Планировщик и специалисты работают на локальных LLM и собирают факты. Большая модель вызывается один раз — чтобы собрать ответ из уже найденного, после Guard.

передаёт задачу
шаги уходят параллельно

оба результата сходятся

перед большой моделью
затем один вызов
готовый текст

Агенты: planner, fill, diagram. Результат проходит Guard и один раз уходит в большую LLM.

Зачем это нужно

Не каждый запрос должен идти в большую модель. Локальные агенты закрывают план и tools сами — ответ быстрее, токены дешевле, задача ближе к тому, что система умеет сделать.

Скорость ответа

До большой LLM доходит не всё. План, поиск и вызов инструментов считают локальные модели. Облако ждёт только синтез — или не вызывается вовсе, если шаг уже закрыт.

Экономия токенов

В большую модель уходит собранный evidence, не весь чат и не весь корпус. Планировщик, fill и diagram работают локально — дорогие токены не тратятся на выбор tool и добор аргументов.

Точнее в задачу

Система знает свои возможности: какие tools есть, что умеет RAG, что рисует diagram. Запрос режется на шаги, которые она реально выполнит — меньше общих фраз, больше попаданий.

Как это выглядит в чате →

Запуск за минуты

Одна команда ставит self-hosted стек: секреты, миграции и сервисы — знания, задачи, процессы и AI внутри вашего периметра.