● Концепция / Уровень: средний / Q2 · 2026 / 124 из 127

Максимум токенов.

параметр, который ограничивает длину ответа модели сверху
Короткий
ответ
↳
Максимум токенов (max tokens) — это параметр запроса, который ограничивает длину ответа модели сверху: сколько токенов модель может сгенерировать, прежде чем ответ обрывается независимо от того, закончена мысль или нет.

01 Простыми словами

Модель готова написать сколь угодно длинный ответ, если тема того требует. Параметр максимума токенов ставит жёсткий потолок: как только счётчик сгенерированных токенов достигает заданного числа, генерация останавливается на текущем месте — даже посреди предложения.

В одной фразе — максимум токенов задаёт потолок длины ответа модели, и при достижении этого потолка генерация останавливается сразу, независимо от смысла.

02 Как это работает

Технически это число, которое передают вместе с запросом к модели вместе с текстом промпта и другими параметрами.

  1. Разработчик указывает предельное число токенов ответа при настройке запроса — например, 500 или 2000.
  2. Модель генерирует ответ токен за токеном и на каждом шаге сверяет счётчик с заданным пределом.
  3. Как только счётчик достигает предела, генерация останавливается сразу же, без довершения текущей мысли или предложения.
Отдельно от максимума токенов ответа существует общий лимит контекстного окна — он включает и вопрос, и всю историю переписки, и сам ответ вместе.

03 Где применяется

  • Юристы. Резюме длинного договора ограничивают по токенам, чтобы получить короткую выжимку вместо полного пересказа документа.
  • Поддержка клиентов. Ответ бота ограничивают небольшим числом токенов, чтобы сообщения оставались короткими и удобными для чата.
  • Бухгалтерия. Разбор большого отчёта делят на части с достаточным запасом токенов под таблицы и цифры в каждой части.
  • Маркетинг. Заголовок или короткий слоган ограничивают жёстким пределом токенов, чтобы удержать текст в нужной длине без разрастания.
  • HR. Черновик вакансии ограничивают по объёму, чтобы получить компактное описание вместо длинного текста на разворот.
  • Разработка. Генерацию кода ограничивают достаточным запасом токенов, которого хватает на целую функцию целиком, без обрыва посреди блока.

04 Строки одного вызова API

Юрист просит подготовить резюме договора аренды через API, разработчик присылает на согласование два варианта одного и того же вызова — отличается только одна строка с числом.

  • max_tokens: 300 — жёсткий потолок в 300 токенов, это примерно один короткий абзац; для длинного договора аренды такого объёма хватает едва на пересказ первого раздела.
  • max_tokens: 900 — тот же запрос с потолком втрое выше, резюме укладывается целиком вместе с разделом про штрафы и порядок расторжения.
  • prompt: "составь резюме договора аренды по разделам" — сам текст запроса в обоих вызовах одинаковый, разница только в числе после max_tokens.
  • temperature: 0.3 — низкое значение держит формулировки резюме предсказуемыми независимо от лимита длины, эту строку в обоих вызовах оставили нетронутой.

Юрист получает: первая версия обрывается на полуслове ровно там, где заканчиваются 300 токенов, вторая доходит до конца документа. Разработчик поднимает лимит до 900 и присылает файл на повторное согласование, приложив короткий комментарий про выбор именно этого числа вместо максимума, который вообще допускает вендор.

Предельно допустимое вендором значение разработчик бережёт про запас на будущее, а сейчас поднимает лимит ровно настолько, насколько требует конкретный документ, — слишком щедрый запас на каждый запрос увеличивает счёт за токены и время ожидания ответа без реальной пользы для качества резюме — а разница в 600 лишних токенов на каждый из сотен ежедневных запросов складывается в заметную сумму к концу месяца.

05 Ограничения и ошибки

  • Слишком маленький лимит обрывает мысль на полуслове — особенно опасно для юридических и финансовых текстов, где важен именно конец документа.
  • Слишком большой лимит без реальной необходимости повышает счёт за токены на выходе и время ожидания ответа без пользы для качества.
  • Лимит ответа и лимит контекстного окна — разные вещи: длинный вопрос и длинная история переписки съедают часть общего окна ещё до генерации самого ответа.
  • Для задач с непредсказуемой длиной ответа — резюме документов разного объёма — лучше давать запас с большим отступом, чем считать точный минимум наперёд.
  • Часть моделей начинает терять качество к самому концу длинного ответа при завышенном лимите — важные выводы стоит выносить ближе к началу текста на всякий случай.
Правило — понаблюдайте обычную неделю работы бота и запомните лимит, при котором ответы перестали обрываться на полуслове; держите итоговое значение чуть выше этой отметки.

Как рассчитать бюджет запроса с учётом длины ответа — в статье про получение API-ключа YandexGPT. Как провести аудит настроек модели под задачи компании — в разделе про консалтинг по внедрению ИИ.

// 06 · от практики

Как мы применяем Максимум токенов в работе с клиентами

В практике «Зинин × Штурбин» мы разбираем Максимум токенов на практике вашего бизнеса — это часть формата личное обучение фаундера. На реальных задачах это обрезанный на середине ответ, лимит для короткого резюме и подобное. Рядом разбираем Токены — термины в словаре связаны так же, как в работе.

Не консультируем абстрактно: команда уходит с навыком и рабочим процессом, который применяет сама. Посмотреть программы и цены →

// 08

Частые вопросы

01 Чем максимум токенов отличается от лимита контекстного окна?

Контекстное окно — общий предел на вопрос, историю переписки и ответ вместе. Максимум токенов ограничивает только сам ответ модели сверху, отдельным параметром запроса.

02 Нужно ли настраивать максимум токенов малому бизнесу?

Стоит проверить значение по умолчанию у вендора хотя бы раз — заниженный лимит незаметно обрезает часть ответов бота, особенно на длинных вопросах клиентов.

03 Что будет с ответом, который превышает заданный лимит токенов?

Генерация останавливается ровно на достигнутом пределе, даже посреди предложения — текст обрывается буквально на середине без автоматической переписки или сокращения самой моделью.

04 Как подобрать нужный лимит токенов для задачи?

Прогоните реальные примеры задачи без ограничения и посмотрите, сколько токенов реально уходит на полный ответ, — лимит ставьте с запасом сверх этого числа.

05 Влияет ли максимум токенов на цену запроса?

Да, счёт за выход считают по фактически сгенерированным токенам — высокий лимит лишь открывает возможность для более длинного и более дорогого ответа, а сама цена зависит от того, сколько токенов модель реально использует.

06 Можно ли менять лимит токенов на лету между запросами?

Да, это обычный параметр каждого отдельного запроса — можно ставить разный лимит под разную задачу даже внутри одного и того же бота.

Понимаем — учим
работать с Максимум токенов
внутри команды.

Час бесплатной диагностики: разбираем 2–3 ваших процесса и говорим прямо, где AI окупится за квартал, а где брать рано. Знания остаются у вашей команды.

Готовы поговорить?
@Aleksei_Shturbin Бот →