Модели решений теперь обучают дома: одна видеокарта и три часа
Появился проект Jeff: три небольшие модели решений, обученные на одной рабочей станции с видеокартой RTX PRO 6000. Младшая на 0,8 млрд параметров готовилась около двух часов, старшая на 2 млрд — три с половиной. Никакого облака. На пяти публичных тестах результат 83,1% против 83,0% у платного облачного аналога того же класса. Код открыт по MIT, веса по Apache 2.0.
Что такое модель решений
Обычная языковая модель пишет ответ по кусочкам и тратит на это время и деньги. Модель решений устроена проще: получает текст и список допустимых вариантов, делает один проход и возвращает выбор с вероятностью.
Задачи у неё соответствующие. Это письмо про оплату или про доставку. Отзыв положительный или отрицательный. Обращение срочное или нет. Подходит ли текст под правила. Всё, где ответ выбирается из заранее известного набора, а не сочиняется.
Класс появился недавно, и первые такие модели были облачными и платными. Главная новость здесь в том, что за считаные недели появился воспроизводимый вариант на домашнем железе.
Что показывают цифры
| Что | Результат |
|---|---|
| Точность на 5 публичных тестах | 83,1% (у платного облачного аналога 83,0%) |
| Ответ на видеокарте RTX PRO 6000 | 22-29 мс |
| Ответ на ноутбуке с M4 Max | 28-60 мс |
| Ответ на процессоре, 32 потока | 463-1000 мс |
| Обучение модели 0,8 млрд | около 2 часов |
| Обучение модели 2 млрд | около 3,5 часов |
Занятная деталь: на игровых задачах младшая модель на 0,8 млрд обошла старшую на 2 млрд. Больше не всегда лучше, особенно когда задача требует быстрого выбора, а не размышления.
Почему разница между GPU и процессором такая большая
22 мс против секунды — это разница между «встроено в обработку потока» и «ждём ответа». Если модель решает, куда направить обращение, при секундной задержке очередь начинает копиться. Именно поэтому такие модели и делают маленькими.
Что здесь действительно интересно
Не сами цифры, а скорость повторения. Между появлением платного облачного сервиса и открытым аналогом, обученным за вечер на одной видеокарте, прошло меньше месяца.
Данные для обучения тоже синтетические: их сгенерировала другая открытая модель. То есть цепочка целиком собирается из доступных частей, без закрытых датасетов и без аренды кластера.
Практический вывод для бизнеса неприятен для продавцов таких сервисов. Узкая задача, решаемая маленькой моделью, плохо поддаётся монетизации: слишком легко воспроизвести у себя.
Где это применимо
Смысл появляется там, где решений много, они однотипные и цена каждого должна быть близка к нулю.
- Разбор входящих обращений по темам до того, как их увидит человек.
- Фильтры содержимого: пропустить, отправить на проверку, отклонить.
- Маршрутизация внутри агента: каким инструментом воспользоваться на этом шаге.
- Разметка больших выгрузок, где строк десятки тысяч.
- Работа с данными, которые нельзя отправлять наружу: всё считается на своей машине.
Последний пункт часто решающий. Медицинские, кадровые и юридические данные проще обработать локально, чем согласовывать передачу во внешний сервис.
Чего такая модель не умеет
Ограничение прямо следует из устройства: варианты ответа должны быть известны заранее.
Всё, где нужен текст (письмо, описание товара, разбор договора, код), остаётся за обычными моделями. Сложные суждения с оговорками тоже: модель решений отвечает «да с вероятностью 0,82», а не «зависит от того, что вы понимаете под сроком поставки».
Разумная схема — сочетание. Маленькая модель отсеивает поток и решает типовое, большая работает там, где нужен развёрнутый ответ.
Что делать, если своей видеокарты нет
Локальный запуск требует железа и рук: поставить, обновлять, следить за нагрузкой. Для одного сценария это оправдано, для пяти разных — уже работа системного администратора.
Обычный путь — начать с готового сервиса и посмотреть на цифры. В tenzor такой сценарий собирается в чате: лёгкая модель разбирает поток и делает простые шаги, сильная включается там, где нужен развёрнутый ответ, а фактическое списание по каждому шагу видно в истории расходов. Когда станет понятно, что один конкретный шаг съедает основную часть счёта, его и есть смысл переносить на свою машину.
Что такое модель решений?+
Модель, которая не пишет текст, а выбирает один из заранее заданных вариантов и возвращает вероятность выбора. Ответ приходит за один проход, поэтому задержка измеряется десятками миллисекунд.
Можно ли обучить такую модель самому?+
Да, проект Jeff показал воспроизводимый путь: модели на 0,8 и 2 млрд параметров обучены на одной рабочей станции с профессиональной видеокартой за 2-3,5 часа, на синтетических данных от другой открытой модели.
Насколько она быстрее обычной нейросети?+
Ответ приходит за 22-29 мс на видеокарте и 28-60 мс на ноутбуке с M4 Max. На процессоре без видеокарты — от 0,5 до 1 секунды, что для потоковой обработки уже много.
Зачем запускать нейросеть локально?+
Ради скорости, отсутствия платы за операцию и того, что данные не покидают вашу машину. Это особенно важно для медицинских, кадровых и юридических данных.
Что дальше почитать
- Модели решений запускаются локально: Ollaya вместо Ollama — как запустить такие модели, если обучать своё не нужно.
- Нейросети в телефоне без интернета — другой сценарий работы без облака.
- Как выбрать нейросеть под задачу и бюджет — как считать стоимость результата.
Соберите сценарий из разных моделей
Отдайте рутину лёгкой модели, сложное оставьте сильной, а потом посмотрите в истории расходов, что именно съедает счёт.
Открыть чат