01 Простыми словами
Top-p (nucleus sampling) — способ ограничить список кандидатов для следующего слова по суммарной вероятности вместо фиксированного числа вариантов. Модель для каждого следующего слова составляет список кандидатов по убыванию вероятности: «отчёт» — 40%, «документ» — 25%, «файл» — 10%, и дальше длинный хвост редких слов с долями процента. Top-p 0,9 значит: берут кандидатов сверху списка ровно до суммарной вероятности в 90% и выбирают случайно из этого укороченного набора.
02 Как это работает
Технически top-p — параметр запроса к модели на этапе инференса: число от 0 до 1, которое передают вместе с самим текстом промпта.
- Модель для каждого следующего токена сначала считает вероятность всех возможных вариантов продолжения.
- Варианты сортируют по убыванию вероятности и складывают их одна за другой до достижения заданного порога p.
- Из получившегося укороченного набора модель выбирает следующий токен — обычно с добавлением случайности внутри этого набора вместо строгого выбора по одной лишь вероятности.
03 Где применяется
- Маркетинг. Более высокий top-p даёт разнообразные варианты рекламных заголовков вместо одного предсказуемого штампа.
- Юристы. Низкий top-p держит формулировки договора внутри стандартных и предсказуемых оборотов.
- Поддержка клиентов. Средний top-p балансирует между живым тоном ответа и предсказуемостью формулировок по регламенту.
- Разработка. Низкий top-p снижает разброс при генерации кода — модель реже предлагает странный, но формально вероятный синтаксис.
- HR. Более высокий top-p полезен при генерации черновиков вакансий в разных тональностях для А/Б-теста объявления.
- Логистика. Низкий top-p держит формулировки статусов доставки в строгих стандартных рамках без творческих вариаций.
04 Разные top-p, один запрос
Один и тот же промпт — «напиши короткий ответ клиенту, который спрашивает про статус возврата денег» — прогоняют через одну и ту же модель три раза подряд, меняя только top-p.
- top-p 0,3. Ответ выходит сухим и почти шаблонным: «Ваш возврат обрабатывается, ожидайте зачисления в течение пяти рабочих дней» — предсказуемо, и почти одинаково при каждом повторном запуске.
- top-p 0,7. Формулировка становится живее: модель добавляет короткую фразу сочувствия задержке и уточняет, куда именно смотреть статус, — тон уже похож на живого оператора вместо шаблона.
- top-p 0,95. Ответ получается разнообразным по формулировкам от запуска к запуску, но иногда добавляет необязательную деталь — например, предполагает точную причину задержки, которой в данных о заказе вообще нет.
Команда поддержки выбирает 0,7 как рабочее итоговое значение: тон получается человечным, а лишние выдуманные подробности остаются редкостью, в отличие от значения 0,95.
05 Ограничения и ошибки
- Top-p близкий к 1 почти отключает фильтр хвоста — модель получает доступ ко всем маловероятным продолжениям сразу, и качество ответа становится непредсказуемым.
- Слишком низкий top-p делает ответы монотонными и предсказуемыми — для творческих задач такое значение обычно избыточно строгое.
- Top-p и temperature меняют разные части одного и того же механизма выбора — включать оба параметра на максимум одновременно обычно избыточно и портит предсказуемость ответа сильнее, чем каждый параметр по отдельности.
- Единого верного значения для всех задач нет — правильное число зависит от типа текста и находится методом проб на живом черновике вместо общей рекомендации из документации.
- Часть API ограничивает доступ к top-p отдельно от temperature — стоит проверить документацию конкретного вендора перед настройкой.
Как формулировать промпт под конкретную задачу — в статье про промпт для разбора квартального отчёта. Как подобрать настройки модели под свою компанию — в разделе про внедрение ИИ в бизнес.