tenzorНачать
Все статьи

Как выбрать нейросеть под задачу и бюджет, а не по рейтингу

Появился открытый калькулятор соотношения цены и качества моделей: он строит линию честной цены и показывает, какие модели за неё вылетают. Данные тянет из публичного индекса производительности и обновляет ежедневно. Инструмент англоязычный и технический, но идея в нём правильная, и её стоит разобрать: выбирать модель по месту в общем рейтинге — самый дорогой способ.

Что не так с рейтингами моделей

Рейтинг отвечает на вопрос «какая модель умнее вообще». В работе этот вопрос почти никогда не возникает.

Вам нужно сделать конкретную вещь: разобрать таблицу, написать письмо, поправить код, ответить клиенту. Модель на первом месте общего рейтинга может делать это в четыре раза дороже модели с десятого места, а разницу в результате вы не заметите.

Вторая ловушка: рейтинги усредняют. Модель с высоким общим баллом бывает посредственна в коде и блестяща в текстах, и наоборот. Средняя оценка скрывает именно то, что вам нужно.

Что показывает калькулятор

Инструмент строит график, где по одной оси цена, по другой — оценка возможностей, и проводит линию по лучшим вариантам. Смысл простой: модель на линии столько и стоит, модель под линией дороже, чем заслуживает.

Сравнение идёт не по одной цифре: отдельно общий индекс, отдельно код, отдельно математика, плюс цена за миллион токенов на входе и на выходе и скорость ответа. Данные берутся из публичного индекса и обновляются каждый день автоматически.

Что тут полезно даже без самого инструмента

Сама привычка смотреть на пару «цена и результат» вместе, а не на одно место в рейтинге. Модель, которая решает вашу задачу за тот же результат вдвое дешевле, полезнее модели с более высоким баллом.

Считайте стоимость задачи, а не токенов

Цена за миллион токенов вводит в заблуждение чаще, чем помогает. Модели расходуют разное количество токенов на один и тот же вопрос.

Разница возникает на трёх вещах. Рассуждающая модель тратит токены на размышление, которого вы не видите. Слабая модель чаще отвечает мимо, и ей приходится переспрашивать и переделывать. Модель с плохой инструкцией на входе тянет в контекст лишнее.

Отсюда практический способ выбора, который работает лучше любых таблиц: взять свою типичную задачу, прогнать через три кандидата и сравнить не тариф, а итоговое списание за готовый результат.

Простые правила, которые экономят больше всего

  • Рутину — дешёвой модели. Классификация письма, короткое резюме, переформулировка. Разницы в результате не видно, а счёт отличается в разы.
  • Сильную модель — на разбор и решения. Договор, архитектура, сложный документ, длинный код.
  • Следите за длиной контекста. Документ, который едет в модель с каждым сообщением диалога, оплачивается каждый раз заново. Это самая частая причина неожиданного счёта.
  • Проверяйте по одной задаче, а не по десяти. Возьмите ту, которую делаете каждый день: она и определит ваш бюджет.

Как выбрать модель под свою задачу

Порядок, который занимает минут пятнадцать и потом экономит месяцами.

Сформулируйте, что именно вы делаете чаще всего, и сохраните два-три реальных примера с готовым правильным ответом. Без примеров сравнение превращается в спор о вкусах.

Прогоните их через три модели разного уровня: дешёвую, среднюю, дорогую. Сравните по трём признакам: попал ли ответ в задачу, сколько правок пришлось внести, сколько списалось.

Возьмите самую дешёвую из тех, что справились. Дорогую оставьте на случаи, когда дешёвая явно не дотягивает, а не по умолчанию.

В tenzor для этого есть всё нужное: модель переключается в шапке чата, цена ориентировочно показана в таблице моделей, а фактическое списание по каждой генерации видно в истории расходов.

Какая нейросеть лучше?+

Вопрос без общего ответа: модели по-разному сильны в коде, текстах и работе с документами, а цены различаются в разы. Правильнее спрашивать, какая модель лучше решает вашу конкретную задачу при разумной цене.

Почему нельзя ориентироваться на цену за миллион токенов?+

Разные модели тратят разное число токенов на один и тот же вопрос: рассуждающие расходуют их на скрытые размышления, слабые заставляют переделывать ответ. Сравнивать нужно списание за готовый результат.

Как сравнить модели на своей задаче?+

Возьмите два-три реальных примера с заранее известным правильным ответом, прогоните через дешёвую, среднюю и дорогую модель и сравните: попал ли ответ в задачу, сколько правок потребовалось, сколько списалось.

На чём экономить в первую очередь?+

На рутине: классификацию, короткие резюме и переформулировки отдавайте дешёвым моделям. И следите за длиной контекста — большой документ в долгом диалоге оплачивается на каждом сообщении заново.

Что дальше почитать

Сравните модели на своей задаче

Возьмите то, что делаете каждый день, и прогоните через две-три модели. Списание по каждой видно в истории расходов.

Открыть чат