Ember-1: качество Kimi K3 при расходе токенов на 40% меньше
Fireworks представила Ember-1 — модель на базе Kimi K3, которая выдаёт сопоставимый результат, тратя примерно на 40% меньше токенов. На задачах с кодом и инструментами она местами обходит оригинал: 82,0% против 80,9% на Terminal Bench, 75,2% против 66,4% на DeepSWE. При тех же тарифах экономия на счёте выходит от 15 до 51%. Пока это исследовательское превью с открытым доступом на две недели.
В чём идея
Современные сильные модели много «думают»: прежде чем ответить, они генерируют длинную цепочку рассуждений, которую вы не видите, но полностью оплачиваете.
Часть этой цепочки полезна, часть — топтание на месте. Ember-1 сделана так, чтобы приходить к тому же выводу короче. Не быстрее в смысле железа, а с меньшим числом шагов.
Для пользователя разница проявляется в счёте. Тариф за миллион токенов не изменился, изменилось количество токенов на одну задачу.
Что показывают бенчмарки
| Тест | Ember-1 | Kimi K3 | О чём тест |
|---|---|---|---|
| Terminal Bench 2.1 | 82,0% | 80,9% | работа в командной строке |
| DeepSWE 1.1 | 75,2% | 66,4% | правки в реальных репозиториях |
| SWE-bench Verified | 92,2% | 93,2% | исправление багов по описанию |
Картина честная: где-то лучше, где-то чуть хуже. Провала нет ни на одном тесте, а расход токенов при этом ниже. Отдельно заявлен результат на наборе из 500 клинических случаев, где модель вышла на лучшее соотношение качества и цены среди открытых и закрытых вариантов.
Почему разрыв на DeepSWE такой большой
Тесты вроде DeepSWE проверяют длинные последовательности действий. Там обычно и теряются модели, которые уходят в размышления: цепочка растёт, контекст забивается, задача теряется. Короткое рассуждение здесь помогает не только счёту, но и результату.
Чем это интересно за пределами новости
Тенденция понятнее самой модели. Цена за токен падает уже год, но счета у многих растут, потому что растёт число токенов на задачу: рассуждения, поиск, чтение файлов, шаги агента.
Поэтому конкуренция постепенно смещается. Раньше мерились тарифом и баллами в рейтинге, теперь всё чаще — расходом на единицу результата. Ember-1 сделана ровно по этой логике: не новая модель, а способ получить прежний результат дешевле.
Второе наблюдение: надстройки над открытыми моделями становятся отдельным жанром. Базовая модель китайская и открытая, оптимизация американская, продаётся как сервис. Раньше этот слой считали временным, сейчас он выглядит устойчивым.
Стоит ли ждать её в русскоязычных сервисах
Сейчас это исследовательское превью с доступом на две недели и возможным продлением по запросу сообщества. Для продукта, который считает деньги пользователя, такой статус — повод посмотреть, а не подключать.
Мы смотрим на такие вещи с одной стороны: сколько в итоге спишется за вашу типичную задачу. Тариф сам по себе ни о чём не говорит, потому что разные модели тратят на один и тот же вопрос разное число токенов. Что доступно сейчас и по какой цене — в таблице моделей для чата, а сама Kimi описана на отдельной странице.
Как сократить расход токенов на своих задачах
Работает независимо от модели и даёт больше, чем смена тарифа.
- Не давайте рассуждающую модель там, где нужен короткий ответ. Классификация, резюме, переформулировка отлично делаются моделями попроще.
- Следите за длиной диалога. Большой документ, приложенный к первому сообщению, оплачивается на каждом следующем шаге заново.
- Формулируйте задачу с готовым форматом ответа. Чем точнее описан результат, тем короче путь к нему.
- Смотрите фактическое списание, а не тариф. Одна и та же задача у двух моделей может отличаться по счёту в разы при одинаковом качестве.
Что такое Ember-1?+
Модель от Fireworks на базе открытой Kimi K3, оптимизированная так, чтобы приходить к тому же результату примерно на 40% меньшим числом токенов рассуждения. Доступна как исследовательское превью.
Она лучше Kimi K3?+
По-разному. На Terminal Bench 82,0% против 80,9%, на DeepSWE 75,2% против 66,4%, на SWE-bench Verified немного уступает: 92,2% против 93,2%. Главное отличие не в баллах, а в расходе токенов.
Сколько можно сэкономить?+
При тех же тарифах за миллион токенов экономия составляет от 15 до 51% в зависимости от задачи, потому что сокращается число токенов, которые модель тратит на скрытое рассуждение.
Почему счёт за нейросети растёт, хотя токены дешевеют?+
Потому что растёт число токенов на одну задачу: скрытые рассуждения, веб-поиск, чтение файлов и многошаговые действия агента. Цена шага падает, а шагов становится больше.
Что дальше почитать
- Токены дешевеют в сотни раз, а счёт не падает — та же тема с цифрами.
- Как выбрать нейросеть под задачу и бюджет — как сравнивать модели по стоимости результата.
Сравните списание на своей задаче
Прогоните типичную работу через две модели и посмотрите не тариф, а фактический счёт в истории расходов.
Открыть чат