Модели решений запускаются локально: Ollaya вместо Ollama для классификации
Вышел Ollaya — открытый инструмент командной строки, который запускает на вашем компьютере модели решений. Такая модель не пишет текст, а выбирает один из заданных вариантов и сообщает, насколько уверена. Ответ приходит за 8-10 миллисекунд на домашней видеокарте против 236-276 миллисекунд у облачных сервисов того же класса. Устанавливается одной командой, лицензия Apache-2.0.
Что такое модель решений
Привычная языковая модель пишет ответ по кусочкам: предсказала слово, посмотрела на написанное, предсказала следующее. Отсюда эффект печатающей машинки и задержка, которая растёт вместе с длиной ответа.
Модель решений устроена иначе. Она получает текст и список допустимых вариантов, делает один проход и возвращает выбор с вероятностью. Ничего не генерируется, поэтому нет и очереди из токенов.
Задачи у неё соответствующие: это письмо про оплату или про доставку, отзыв положительный или отрицательный, обращение срочное или нет, подходит ли текст под правила. То есть вся та рутина, которую сегодня отдают большой модели просто потому, что она под рукой.
Чем Ollaya отличается от Ollama
Название выбрано не случайно: Ollama давно делает то же самое для языковых моделей. Разница в классе моделей и в том, что из этого следует.
| Ollama | Ollaya | |
|---|---|---|
| Что запускает | языковые модели, пишут текст | модели решений, выбирают вариант |
| Типичный ответ | от секунд до минут | 8-10 мс на RTX 4090 |
| Что на выходе | текст | вариант плюс вероятность |
| Зачем нужно | чат, код, переписывание текста | классификация, фильтры, маршрутизация |
Общее у них главное: данные не уходят с вашей машины и вы не платите за токены.
Что внутри
В комплекте семь моделей с открытыми весами под разные роли: самая быстрая и многоязычная, самая точная, классификатор без обучения под конкретные классы, классификатор с инструкциями, отдельная модель для проверки безопасности содержимого, модель с калиброванной уверенностью и модель с контекстом до 8 тысяч токенов.
Ставится на macOS, Windows, Linux и в Docker, работает на процессоре и на видеокартах NVIDIA.
Запуск выглядит как одна команда вида ollaya run laya. Заявлена совместимость с SDK облачного
сервиса того же класса без правок кода, то есть переехать с облака на свою машину можно без
переписывания интеграции.
Почему это заметили
За неделю вокруг нового класса моделей появилось сразу несколько проектов: локальный запуск, память проектов для инструментов разработки, автоматическое ревью кода. Когда вокруг идеи вырастает слой инструментов, она перестаёт быть демонстрацией и начинает применяться.
Где такое реально нужно
Понятная область: массовые однотипные решения, где важна скорость и цена, а не красота формулировок.
- Разбор входящих обращений по темам до того, как их увидит человек.
- Фильтры содержимого: пропускать, отправлять на проверку, отклонять.
- Маршрутизация внутри агента, когда надо быстро решить, какой инструмент взять.
- Разметка больших выгрузок, где строк десятки тысяч и каждая требует одного решения.
Экономия получается двойная. Локальный запуск снимает плату за операцию, а замена большой модели на маленькую снижает задержку с секунд до миллисекунд.
Что здесь не сработает
Ограничение прямо следует из устройства. Варианты ответа должны быть известны заранее.
Всё, где нужен сам текст (письмо, описание товара, разбор договора, код), остаётся за обычными моделями. Сложные суждения с оговорками тоже: модель решений отвечает «да с вероятностью 0,82», а не «зависит от того, что вы имеете в виду под сроком».
Разумная схема — сочетание. Быстрая модель отсеивает поток и решает типовое, большая работает только там, где нужен развёрнутый ответ. Ровно так и устроены агентные сценарии в tenzor: дешёвые шаги делает лёгкая модель, тяжёлые — сильная, и цена ответа складывается из фактических шагов.
Что такое модель решений?+
Модель, которая не генерирует текст, а выбирает один из заранее заданных вариантов и возвращает вероятность своего выбора. Ответ приходит за один проход, поэтому задержка измеряется миллисекундами.
Чем Ollaya отличается от Ollama?+
Ollama запускает локально языковые модели, которые пишут текст. Ollaya запускает модели решений: на выходе вариант с вероятностью, а не текст, и ответ приходит за 8-10 миллисекунд вместо секунд.
Что нужно, чтобы запустить это у себя?+
Поддерживаются macOS, Windows, Linux и Docker, работа на процессоре или видеокарте NVIDIA. Запуск выполняется одной командой, лицензия Apache-2.0, в комплекте семь моделей с открытыми весами.
Может ли такая модель заменить обычную нейросеть?+
Нет. Она закрывает только задачи с заранее известным списком вариантов: классификацию, фильтры, маршрутизацию. Всё, где нужен текст или развёрнутое суждение, остаётся за обычными моделями.
Что дальше почитать
- Токены дешевеют в сотни раз, а счёт не падает — почему дешёвая модель на рутине экономит больше, чем смена тарифа.
- Модели для чата — что доступно сейчас и по какой цене.
Соберите сценарий из разных моделей
Рутину отдайте лёгкой модели, сложное оставьте сильной. Разницу в счёте видно за первую же неделю.
Открыть чат