Как выбрать нейросеть под задачу и бюджет, а не по рейтингу
Появился открытый калькулятор соотношения цены и качества моделей: он строит линию честной цены и показывает, какие модели за неё вылетают. Данные тянет из публичного индекса производительности и обновляет ежедневно. Инструмент англоязычный и технический, но идея в нём правильная, и её стоит разобрать: выбирать модель по месту в общем рейтинге — самый дорогой способ.
Что не так с рейтингами моделей
Рейтинг отвечает на вопрос «какая модель умнее вообще». В работе этот вопрос почти никогда не возникает.
Вам нужно сделать конкретную вещь: разобрать таблицу, написать письмо, поправить код, ответить клиенту. Модель на первом месте общего рейтинга может делать это в четыре раза дороже модели с десятого места, а разницу в результате вы не заметите.
Вторая ловушка: рейтинги усредняют. Модель с высоким общим баллом бывает посредственна в коде и блестяща в текстах, и наоборот. Средняя оценка скрывает именно то, что вам нужно.
Что показывает калькулятор
Инструмент строит график, где по одной оси цена, по другой — оценка возможностей, и проводит линию по лучшим вариантам. Смысл простой: модель на линии столько и стоит, модель под линией дороже, чем заслуживает.
Сравнение идёт не по одной цифре: отдельно общий индекс, отдельно код, отдельно математика, плюс цена за миллион токенов на входе и на выходе и скорость ответа. Данные берутся из публичного индекса и обновляются каждый день автоматически.
Что тут полезно даже без самого инструмента
Сама привычка смотреть на пару «цена и результат» вместе, а не на одно место в рейтинге. Модель, которая решает вашу задачу за тот же результат вдвое дешевле, полезнее модели с более высоким баллом.
Считайте стоимость задачи, а не токенов
Цена за миллион токенов вводит в заблуждение чаще, чем помогает. Модели расходуют разное количество токенов на один и тот же вопрос.
Разница возникает на трёх вещах. Рассуждающая модель тратит токены на размышление, которого вы не видите. Слабая модель чаще отвечает мимо, и ей приходится переспрашивать и переделывать. Модель с плохой инструкцией на входе тянет в контекст лишнее.
Отсюда практический способ выбора, который работает лучше любых таблиц: взять свою типичную задачу, прогнать через три кандидата и сравнить не тариф, а итоговое списание за готовый результат.
Простые правила, которые экономят больше всего
- Рутину — дешёвой модели. Классификация письма, короткое резюме, переформулировка. Разницы в результате не видно, а счёт отличается в разы.
- Сильную модель — на разбор и решения. Договор, архитектура, сложный документ, длинный код.
- Следите за длиной контекста. Документ, который едет в модель с каждым сообщением диалога, оплачивается каждый раз заново. Это самая частая причина неожиданного счёта.
- Проверяйте по одной задаче, а не по десяти. Возьмите ту, которую делаете каждый день: она и определит ваш бюджет.
Как выбрать модель под свою задачу
Порядок, который занимает минут пятнадцать и потом экономит месяцами.
Сформулируйте, что именно вы делаете чаще всего, и сохраните два-три реальных примера с готовым правильным ответом. Без примеров сравнение превращается в спор о вкусах.
Прогоните их через три модели разного уровня: дешёвую, среднюю, дорогую. Сравните по трём признакам: попал ли ответ в задачу, сколько правок пришлось внести, сколько списалось.
Возьмите самую дешёвую из тех, что справились. Дорогую оставьте на случаи, когда дешёвая явно не дотягивает, а не по умолчанию.
В tenzor для этого есть всё нужное: модель переключается в шапке чата, цена ориентировочно показана в таблице моделей, а фактическое списание по каждой генерации видно в истории расходов.
Какая нейросеть лучше?+
Вопрос без общего ответа: модели по-разному сильны в коде, текстах и работе с документами, а цены различаются в разы. Правильнее спрашивать, какая модель лучше решает вашу конкретную задачу при разумной цене.
Почему нельзя ориентироваться на цену за миллион токенов?+
Разные модели тратят разное число токенов на один и тот же вопрос: рассуждающие расходуют их на скрытые размышления, слабые заставляют переделывать ответ. Сравнивать нужно списание за готовый результат.
Как сравнить модели на своей задаче?+
Возьмите два-три реальных примера с заранее известным правильным ответом, прогоните через дешёвую, среднюю и дорогую модель и сравните: попал ли ответ в задачу, сколько правок потребовалось, сколько списалось.
На чём экономить в первую очередь?+
На рутине: классификацию, короткие резюме и переформулировки отдавайте дешёвым моделям. И следите за длиной контекста — большой документ в долгом диалоге оплачивается на каждом сообщении заново.
Что дальше почитать
- Модели для чата — актуальные цены и сильные стороны.
- Токены и кредиты: как устроена оплата — почему счёт идёт за токены.
- Что такое кеш промпта — как не платить дважды за один контекст.
Сравните модели на своей задаче
Возьмите то, что делаете каждый день, и прогоните через две-три модели. Списание по каждой видно в истории расходов.
Открыть чат