Скорость ответа
До большой LLM доходит не всё. План, поиск и вызов инструментов считают локальные модели. Облако ждёт только синтез — или не вызывается вовсе, если шаг уже закрыт.
Цепочка микро-агентов
Запрос не уходит целиком в одну модель. Планировщик и специалисты работают на локальных LLM и собирают факты. Большая модель вызывается один раз — чтобы собрать ответ из уже найденного, после Guard.
оба результата сходятся
Агенты: planner, fill, diagram. Результат проходит Guard и один раз уходит в большую LLM.
Не каждый запрос должен идти в большую модель. Локальные агенты закрывают план и tools сами — ответ быстрее, токены дешевле, задача ближе к тому, что система умеет сделать.
До большой LLM доходит не всё. План, поиск и вызов инструментов считают локальные модели. Облако ждёт только синтез — или не вызывается вовсе, если шаг уже закрыт.
В большую модель уходит собранный evidence, не весь чат и не весь корпус. Планировщик, fill и diagram работают локально — дорогие токены не тратятся на выбор tool и добор аргументов.
Система знает свои возможности: какие tools есть, что умеет RAG, что рисует diagram. Запрос режется на шаги, которые она реально выполнит — меньше общих фраз, больше попаданий.
Одна команда ставит CLI ush и self-hosted стек: секреты,
миграции и сервисы внутри вашего периметра.
curl -fsSL https://storage.unishift.ru/services/prod/install.sh | bash
Сейчас решение полностью бесплатное. Когда выйдет стабильный релиз, на ваш email придёт лицензионный ключ для бизнеса с персональными скидками.