tenzorНачать
Все инструкции

Что такое кэш промпта и почему повторные вопросы в чате ИИ дешевле

Кэш промпта

Если смотреть историю расходов в чате с нейросетью, видна странность: первый ответ в диалоге стоит заметно дороже, а уточнения следом — копейки. Это не ошибка и не акция. Так работает кэш промпта — механизм, из-за которого переспрашивать нейросеть выгоднее, чем кажется. Разберём его простыми словами и покажем на примере из tenzor, как это выглядит в рублях.

Кэш промпта — это «черновик в памяти» у нейросети. При каждом ответе модель заново читает весь диалог с самого начала, и именно на это чтение уходит основная часть цены. Кэш позволяет не читать уже прочитанное: начало диалога берётся из памяти со скидкой около 90%. Поэтому уточняющие вопросы подряд стоят в разы дешевле первого. Память эта короткая, около пяти минут, так что после долгого перерыва первый вопрос снова идёт по полной цене.

Главное

  • У нейросети нет памяти между ответами: каждый раз она перечитывает весь диалог заново — и это чтение стоит денег.
  • Кэш промпта — короткая память на уже прочитанное: повторное чтение начала диалога идёт со скидкой около 90%.
  • Кэш живёт примерно пять минут и продлевается каждым новым вопросом. Спрашивайте подряд — выйдет заметно дешевле.
  • После перерыва в час кэш пуст, и первый вопрос снова стоит как «первый». Это нормально, а не двойное списание.
  • Скидку даёт провайдер модели, но многие сервисы-агрегаторы её не учитывают и списывают по полной. Она доходит до вас, только когда сервис считает по фактической стоимости.

Почему нейросеть каждый раз перечитывает весь диалог

Кажется, что чат «помнит» разговор: вы спрашиваете «а короче можно?», и модель понимает, о чём речь. На самом деле никакой памяти между ответами у неё нет. Перед каждым ответом сервис отправляет модели весь диалог целиком: системные настройки, приложенные файлы, все ваши сообщения и все её собственные ответы. Модель прочитывает это заново — и только потом пишет продолжение.

Платится и за чтение, и за написанное. И в длинном диалоге чтение быстро становится главной статьёй: сам вопрос «а можно короче?» занимает одну строчку, но вместе с ней модель заново читает, скажем, пятьдесят страниц переписки и вложенного документа. Без кэша десятый вопрос в длинном чате стоил бы почти столько же, сколько первый, — хотя нового в нём три слова.

Что такое кэш промпта простыми словами

Провайдеры моделей заметили очевидное: в диалоге от вопроса к вопросу меняется только хвост, последнее сообщение. Всё, что до него, совпадает байт в байт с тем, что модель уже читала минуту назад. Пересчитывать это заново — пустая работа.

Кэш промпта (prompt cache) — способ эту работу не повторять. При первом ответе модель читает диалог и сохраняет «выжимку» прочитанного у себя. Когда приходит следующий вопрос, она сверяет начало: совпадает с тем, что уже читала? Тогда готовая выжимка достаётся из памяти, а целиком читается только новое: ваш свежий вопрос. За «достать из памяти» провайдеры берут примерно десятую часть обычной цены чтения.

Есть одна тонкость: совпадение должно быть точным. Если в начале диалога поменялось хоть одно слово, кэш с этого места не сработает и чтение пойдёт по полной. Поэтому сервисы, которые следят за экономией, держат историю диалога неизменной между запросами.

Сколько экономит кэш и сколько он живёт

Правила у провайдеров чуть различаются, но картина общая:

Что происходитЦена относительно обычного чтения
Первое чтение диалога (с сохранением в кэш)100% или чуть дороже (примерно +25%)
Повторное чтение из кэшаоколо 10%
Ваш новый вопрос и ответ моделикак обычно, без скидок

Живёт кэш недолго, порядка пяти минут. Но у него есть приятное свойство: каждое попадание продлевает жизнь ещё на пять минут. Пока вы активно переписываетесь, кэш не гаснет — хоть полчаса, хоть час подряд. А вот если отвлеклись на кофе и вернулись через двадцать минут, память уже очищена: первый вопрос после паузы снова прочитает весь диалог по полной цене, зато следующие опять пойдут со скидкой.

Отсюда простой вывод: серия уточнений подряд — самый дешёвый режим работы с нейросетью.

Пример в рублях: чат с приложенным документом

Возьмём житейский случай: вы приложили к чату длинный договор и попросили разобрать его по пунктам. Цифры округлённые, но пропорции реальные:

  • Первый ответ — около 6 ₽. Модель прочитала весь документ и написала разбор. Дороже всего здесь именно чтение документа.
  • Уточнение через минуту («а что с пунктом про неустойку?») — около 60 копеек. Документ и прошлый разбор взялись из кэша за десятую часть цены, по-настоящему прочитан только ваш вопрос.
  • Тот же вопрос, но без кэша, стоил бы около 5 ₽ — почти как первый ответ, потому что модель перечитала бы всё заново.

Разница на одном вопросе — рублей пять. На живой рабочей сессии, где уточнений десяток, кэш экономит десятки рублей, хотя вы вообще ничего для этого не делали.

Задавайте уточнения сразу

Появились вопросы к ответу — задавайте их подряд, не откладывая. Пять уточнений в течение десяти минут пройдут по кэшу почти целиком. Те же пять вопросов, разнесённые по одному в час, каждый раз оплатят полное чтение диалога.

Как задавать вопросы, чтобы платить меньше

Кэш работает сам, но пара привычек помогает ему работать на вас:

  1. Уточняйте сериями. Пока диалог активен, каждый следующий вопрос — почти даром. «Короче», «а пример?», «перепиши официальнее»: это как раз тот случай.
  2. Не бойтесь коротких вопросов. Интуиция подсказывает «спрошу всё одним большим сообщением, чтобы не платить дважды» — с кэшем это уже не нужно. Дробить вопрос на шаги дешевле, чем кажется, а ответы выходят точнее.
  3. Новую тему — в новый чат. Если разговор о договоре закончен, а теперь нужен план поездки, не продолжайте тот же диалог: модель будет заново читать договор при каждом ответе, пусть и со скидкой. Чистый чат — чистая цена.
  4. Вернулись после перерыва — первый вопрос дороже, и это нормально. Не сбой и не двойное списание: просто кэш успел очиститься, и модель прочитала диалог заново.

У всех ли нейросетей есть кэш

Кэш промпта поддерживают все основные семейства моделей, но по-разному. У GPT и Gemini он включается автоматически: провайдер сам замечает повторяющееся начало диалога. У Claude кэш не автоматический — его должен явно включить сервис, через который вы работаете с моделью, иначе скидки просто не будет.

Доходит ли скидка кэша до пользователя

Не всегда, и это стоит знать. Скидку даёт провайдер модели, а сколько списать с вас — решает сервис, через который вы работаете. И большинство агрегаторов нейросетей считают цену не по факту, а по прайсу: фиксированная цена за сообщение или тариф «столько-то за объём текста». При таком подсчёте кэш просто не учитывается — уточняющий вопрос списывается так, будто модель заново прочитала весь диалог по полной цене. Провайдер скидку дал, но до пользователя она не дошла: разница осталась сервису.

Проверить это просто: задайте в длинном чате два уточнения подряд и посмотрите историю расходов. Если оба стоили примерно как первый ответ — кэш вам не достаётся.

В tenzor списание идёт по фактической стоимости у провайдера, поэтому скидка кэша попадает прямо в ваше списание: уточнение за 60 копеек так и стоит 60 копеек. Для этого соблюдены и технические условия — история диалога между запросами держится неизменной, а для Claude кэширование включено явно. О том, как вообще устроена оплата за токены и кредиты, есть отдельный разбор.

Частые вопросы

Почему первый ответ в чате стоит дороже следующих?+

Первый ответ читает весь диалог и приложенные файлы по полной цене и сохраняет прочитанное в кэш. Следующие вопросы берут это из кэша со скидкой около 90%, а полную цену вы платите только за новое: свой вопрос и ответ модели.

Сколько живёт кэш промпта?+

Порядка пяти минут, но каждый новый вопрос продлевает его ещё на столько же. Пока вы активно переписываетесь, кэш не гаснет. После долгой паузы он очищается, и первый вопрос снова идёт по полной цене.

Почему после перерыва вопрос в том же чате снова дорогой?+

Кэш успел очиститься, и модель перечитала весь диалог заново — как в самый первый раз. Это не двойное списание и не ошибка, а обычная работа механизма. Следующие вопросы подряд снова пойдут со скидкой.

Нужно ли что-то включать, чтобы кэш работал?+

Пользователю ничего включать не нужно, всё происходит само. Важно лишь, чтобы сервис на своей стороне держал историю диалога неизменной, а для моделей Claude включал кэширование явно — без этого скидки не будет.

Кэш промпта — это память нейросети?+

Нет. Память в привычном смысле означает, что модель помнит вас между разными чатами. Кэш же — техническая заначка на несколько минут внутри одного диалога: она экономит деньги и ускоряет ответ, но ничему модель не учит.

Работает ли кэш с приложенными файлами?+

Да, и именно там он заметнее всего: большой документ читается по полной цене один раз, а дальше все вопросы по нему идут через кэш. Разбор длинного файла серией вопросов — самый выгодный сценарий.

Почему длинный чат вообще становится дороже?+

Каждый ответ заново читает всю историю, и она растёт с каждым сообщением. Кэш смягчает это в разы, но не отменяет: когда тема закончена, выгоднее начать новый чат, чем таскать за собой старую переписку.

Почему в некоторых сервисах уточняющие вопросы стоят столько же, сколько первый?+

Потому что сервис считает цену по прайсу, а не по факту: кэш провайдера в таком подсчёте не участвует, и скидка остаётся сервису. Проверяется историей расходов: если уточнения в длинном чате стоят как первый ответ, кэш до вас не доходит.

У каких моделей есть кэширование промпта?+

У всех основных: GPT, Claude, Gemini и большинства других современных моделей. Разница в том, что у GPT и Gemini оно автоматическое, а у Claude его должен включить сервис, через который идёт запрос.

Проверьте на своём документе

Приложите длинный файл, задайте по нему серию вопросов — и посмотрите в истории расходов, сколько стоили уточнения.

Открыть чат