tenzorНачать
Все статьи

Ember-1: качество Kimi K3 при расходе токенов на 40% меньше

Fireworks представила Ember-1 — модель на базе Kimi K3, которая выдаёт сопоставимый результат, тратя примерно на 40% меньше токенов. На задачах с кодом и инструментами она местами обходит оригинал: 82,0% против 80,9% на Terminal Bench, 75,2% против 66,4% на DeepSWE. При тех же тарифах экономия на счёте выходит от 15 до 51%. Пока это исследовательское превью с открытым доступом на две недели.

В чём идея

Современные сильные модели много «думают»: прежде чем ответить, они генерируют длинную цепочку рассуждений, которую вы не видите, но полностью оплачиваете.

Часть этой цепочки полезна, часть — топтание на месте. Ember-1 сделана так, чтобы приходить к тому же выводу короче. Не быстрее в смысле железа, а с меньшим числом шагов.

Для пользователя разница проявляется в счёте. Тариф за миллион токенов не изменился, изменилось количество токенов на одну задачу.

Что показывают бенчмарки

ТестEmber-1Kimi K3О чём тест
Terminal Bench 2.182,0%80,9%работа в командной строке
DeepSWE 1.175,2%66,4%правки в реальных репозиториях
SWE-bench Verified92,2%93,2%исправление багов по описанию

Картина честная: где-то лучше, где-то чуть хуже. Провала нет ни на одном тесте, а расход токенов при этом ниже. Отдельно заявлен результат на наборе из 500 клинических случаев, где модель вышла на лучшее соотношение качества и цены среди открытых и закрытых вариантов.

Почему разрыв на DeepSWE такой большой

Тесты вроде DeepSWE проверяют длинные последовательности действий. Там обычно и теряются модели, которые уходят в размышления: цепочка растёт, контекст забивается, задача теряется. Короткое рассуждение здесь помогает не только счёту, но и результату.

Чем это интересно за пределами новости

Тенденция понятнее самой модели. Цена за токен падает уже год, но счета у многих растут, потому что растёт число токенов на задачу: рассуждения, поиск, чтение файлов, шаги агента.

Поэтому конкуренция постепенно смещается. Раньше мерились тарифом и баллами в рейтинге, теперь всё чаще — расходом на единицу результата. Ember-1 сделана ровно по этой логике: не новая модель, а способ получить прежний результат дешевле.

Второе наблюдение: надстройки над открытыми моделями становятся отдельным жанром. Базовая модель китайская и открытая, оптимизация американская, продаётся как сервис. Раньше этот слой считали временным, сейчас он выглядит устойчивым.

Стоит ли ждать её в русскоязычных сервисах

Сейчас это исследовательское превью с доступом на две недели и возможным продлением по запросу сообщества. Для продукта, который считает деньги пользователя, такой статус — повод посмотреть, а не подключать.

Мы смотрим на такие вещи с одной стороны: сколько в итоге спишется за вашу типичную задачу. Тариф сам по себе ни о чём не говорит, потому что разные модели тратят на один и тот же вопрос разное число токенов. Что доступно сейчас и по какой цене — в таблице моделей для чата, а сама Kimi описана на отдельной странице.

Как сократить расход токенов на своих задачах

Работает независимо от модели и даёт больше, чем смена тарифа.

  • Не давайте рассуждающую модель там, где нужен короткий ответ. Классификация, резюме, переформулировка отлично делаются моделями попроще.
  • Следите за длиной диалога. Большой документ, приложенный к первому сообщению, оплачивается на каждом следующем шаге заново.
  • Формулируйте задачу с готовым форматом ответа. Чем точнее описан результат, тем короче путь к нему.
  • Смотрите фактическое списание, а не тариф. Одна и та же задача у двух моделей может отличаться по счёту в разы при одинаковом качестве.
Что такое Ember-1?+

Модель от Fireworks на базе открытой Kimi K3, оптимизированная так, чтобы приходить к тому же результату примерно на 40% меньшим числом токенов рассуждения. Доступна как исследовательское превью.

Она лучше Kimi K3?+

По-разному. На Terminal Bench 82,0% против 80,9%, на DeepSWE 75,2% против 66,4%, на SWE-bench Verified немного уступает: 92,2% против 93,2%. Главное отличие не в баллах, а в расходе токенов.

Сколько можно сэкономить?+

При тех же тарифах за миллион токенов экономия составляет от 15 до 51% в зависимости от задачи, потому что сокращается число токенов, которые модель тратит на скрытое рассуждение.

Почему счёт за нейросети растёт, хотя токены дешевеют?+

Потому что растёт число токенов на одну задачу: скрытые рассуждения, веб-поиск, чтение файлов и многошаговые действия агента. Цена шага падает, а шагов становится больше.

Что дальше почитать

Сравните списание на своей задаче

Прогоните типичную работу через две модели и посмотрите не тариф, а фактический счёт в истории расходов.

Открыть чат