Kimi K2 — семейство открытых моделей Moonshot, собранных под агентные задачи: модель сама выбирает инструмент, вызывает его и продолжает рассуждение. Для компании в России у семейства два рабочих контура — платформа Moonshot по API и собственный сервер с открытыми весами; терминальный агент Kimi Code и общий обзор API остаются за кадром. Материал поможет выбрать версию под задачу, оценить ресурсы и выстроить проверку результата сотрудником до запуска пилота.

Архитектура семейства

TL;DR

По данным репозитория MoonshotAI, Kimi K2 — модель смеси экспертов с 1 трлн общих и 32 млрд активных параметров на токен, контекстом 128K и весами под лицензией Modified MIT; архитектура задумана для работы с инструментами.

Kimi K2 вырос из исследовательского проекта Moonshot в открытую линейку: веса лежат на Hugging Face в формате block-fp8, а репозиторий на GitHub описывает и базовую модель, и пост-обученную версию для диалога. Лицензия Modified MIT разрешает коммерческое использование и доработку, поэтому компания может развернуть конкретный открытый весовой файл в собственном контуре. Для коммерческого продукта условия Modified MIT стоит прочитать целиком. Репозиторий публикует результаты отдельных тестов кодирования и работы с инструментами. Это результаты вендора на конкретных наборах; пригодность к процессу компании проверяют на своих данных.

В архитектуре смеси экспертов лишь часть параметров активируется для обработки очередного токена. По карточке исходной Kimi K2, общая численность составляет триллион параметров, а активная часть — 32 миллиарда. Эти параметры описывают архитектуру; скорость и стоимость требуют отдельного расчёта: реальную задержку определяют оборудование, длина запроса, число пользователей и настройки сервера. Движение в ту же сторону — у других открытых семейств: разбор архитектуры смеси экспертов лежит в глоссарии.

Акцент семейства — агентность. Модель умеет вызывать внешние инструменты по схеме, держать многошаговый диалог и работать с длинным контекстом. Как Kimi справляется с длинными документами в повседневных рабочих сценариях, разобрано в материале про Kimi для работы с длинными документами.

Линейка обновляется: помимо исходной K2, Moonshot опубликовала карточки Kimi-K2-Thinking и Kimi-K2.6, а также Kimi-K2.7-Code для задач разработки. Доступность конкретного идентификатора через API сверяйте в каталоге платформы в день запуска. Имя модели в коде, версия открытых весов и режим рассуждения требуют отдельной фиксации в журнале проверки.

Версии и режимы

Выбор версии начинается с типа задачи. Пост-обученная Kimi-K2-Instruct отвечает быстро и уверенно ведёт диалог с инструментами: репозиторий называет такое поведение рефлексным, модель действует сразу, без длинной внутренней проработки. Для задач, где важна глубина рассуждения, есть отдельная открытая модель Kimi-K2-Thinking и режимы рассуждения в некоторых API-моделях. Возможность переключения зависит от модели: отдельные версии работают только с включённым рассуждением. Сверьте карточку выбранного идентификатора и формат ответа до интеграции.

ВерсияПоведениеКогда брать
Kimi-K2-BaseПродолжает текст, базовые навыкиСобственное дообучение и эксперименты
Kimi-K2-InstructБыстрый ответ, вызов инструментовЧат-боты, классификация, потоковые операции
Kimi-K2-ThinkingРассуждение с вызовом инструментовМногошаговый анализ и проверка цепочки действий
Kimi-K2.7-CodeСпециализация на задачах кодаРабота с репозиторием и патчами

Документация по развёртыванию Kimi-K2.7-Code описывает режим рассуждения как обязательный для этой версии. Для многошагового диалога сохраняйте историю сообщений и ответы инструментов в формате, который предписывает выбранный API. Передачу внутреннего reasoning_content и режим сохранения рассуждений проверяйте по текущей документации конкретной модели; самовольная подстановка поля может вызвать ошибку запроса.

Базовую модель берут для исследований и дообучения. Для диалога без дополнительной настройки подходит постобученная версия Instruct; собственная настройка базовой модели требует специалистов и инфраструктуры. Параллели с выбором Instruct-версии у других открытых семейств удобно смотреть в разборе Instruct и базовой модели на примере Qwen.

Сравнивайте название модели и конкретный файл весов. Исходный Kimi-K2-Instruct и Kimi-K2-Thinking имеют разные режимы работы и контекстные настройки в официальных карточках Moonshot. При локальном развёртывании сохраните идентификатор файла, версию движка вывода и параметры запуска. Для API сохраните имя модели, адрес сервиса и поддерживаемые функции. Это защищает пилот от скрытой смены поведения после обновления алиаса.

Сервер против API

Первый контур — платформа Moonshot. Moonshot описывает совместимые с OpenAI и Anthropic способы обращения к API. У каждого способа свой формат сообщений; поддержку вызова инструментов и потоковой выдачи сверяйте для выбранной модели и метода. Кэширование запросов и структурированный ответ проверяйте по актуальной документации платформы до расчёта стоимости. Условия оплаты для компании из России проверяйте напрямую на платформе Moonshot до пилота. Тарификация за миллион токенов на входе и на выходе; актуальные цифры смотрите на странице цен Moonshot на дату старта.

Второй контур — открытые веса на своём или арендованном сервере. Исходные веса Kimi K2 в block-fp8 занимают порядка терабайта до учёта накладных расходов развёртывания. Объём памяти для работы зависит от выбранной версии, квантования, контекста и параллельной нагрузки. Проверьте требования к оборудованию для конкретного файла весов. Возможна гибридная схема: движок KTransformers смещает часть слоёв в оперативную память ценой скорости ответа. Репозиторий рекомендует vLLM, SGLang и TensorRT-LLM; практику запуска больших открытых моделей на своём железе разбираем в материале про vLLM для компаний и в гайде по локальному запуску DeepSeek.

Третий критерий выбора — нагрузка. Для редких пакетных задач API может сократить подготовку инфраструктуры; расходы зависят от тарифа и фактического числа токенов. Для постоянного потока свой сервер имеет смысл оценить через полный расчёт: оборудование, электричество, администрирование, резервирование и загрузка. Экономический порог выводят из собственных измерений, универсального порога нет.

API-контур позволяет начать без своего сервера. Если правила компании запрещают передачу материалов в облако вендора, проверяйте возможность развёртывания конкретных открытых весов в собственном контуре. Какая агентная задача первой встанет на Kimi K2 в вашей компании?

Если компания выбирает свой сервер ради контроля данных, проверьте весь путь запроса: входное приложение, очередь, журналы, хранилище ответов и резервные копии. Закрытость контура зависит от настройки всей инфраструктуры. Права доступа, сетевые правила и срок хранения закрепляют в настройках инфраструктуры и внутренних процедурах. Для сравнения с API зафиксируйте одинаковый тестовый набор и считайте как прямые расходы, так и время сотрудников на сопровождение.

● Discovery · 1 час · бесплатно

Какая агентная задача первой встанет на Kimi K2 в вашей компании?

Прийти на Discovery →

Проверка на задачах

Бенчмарки вендора показывают результат на отдельных наборах задач; результат отдела проверяют отдельно. Соберите набор реальных обращений: вопросы клиентов, типовые правки, отчёты, которые сотрудники разбирают каждую неделю. Прогоняйте каждую версию в одинаковых условиях и фиксируйте результат в журнале.

  1. Выпишите задачи и критерии приёмки: что считается верным ответом, какие данные допустимы в запросе.
  2. Прогоните набор через текущую рабочую модель и через выбранную версию K2 с одинаковым системным промптом.
  3. Проверьте вызов инструментов: какой инструмент выбран, верные ли аргументы, что происходит при ошибке.
  4. Проверьте код на репозитории: запустите тесты проекта против предложенных правок до принятия патча.
  5. Считайте формулы и полные выгрузки парсером или скриптом: модель объясняет цифры и строит гипотезы, человек сверяет итог.
  6. Оформите протокол: где модель права, где ошибается, какие случаи уходят к сотруднику полностью.

Модель уверенно звучит и там, где ошибается, поэтому журнал проверки важнее впечатления от демо. Права доступа и подтверждения критичных действий проверяет сервер вашего сервиса. Промпт помогает описать порядок работы, а допуск к действию задаётся серверными правилами. Включите в протокол разбор спорных случаев целиком силами сотрудника.

Дальше — предложение пилота: один контур, один отдел, каждый результат модели проходит через руки сотрудника до появления автоматики. Опыт агентного контура с человеком в цикле описан в статье про ИИ-агентов для бизнеса.

Включите в тест два отказа: недоступный инструмент и источник с противоречивым ответом. При ошибке агент передаёт ситуацию сотруднику. Сервер оставляет действие в состоянии ожидания до подтверждения. В журнале отмечайте выбор инструмента, аргументы, ответ сервиса и итоговое решение сотрудника. Так проверяется именно агентный сценарий, ради которого рассматривают K2. Гладкий текст по готовому фрагменту служит отдельной задачей.

Первый запуск

Начните с вопроса о данных: где они живут и кому разрешено их обрабатывать. Публичные потоки и черновики удобнее гонять через платформенный API, персональные данные и коммерческая тайна — в разрешённом компанией контуре с проверенными правами и договорными условиями. Собственный сервер может быть одним из таких вариантов. Сравните доступные версии по каждому контуру отдельно: открытый файл весов и модель платформы могут отличаться. Свой сервер даёт контроль над настройками развёртывания, а API сокращает подготовку инфраструктуры.

Типичная ошибка на старте — менять версию посреди проверки. Зафиксируйте алиас модели в заголовке журнала и меняйте его только между циклами сравнения: иначе журнал смешает две разные модели, и выводы рассыплются. Вторая ошибка — гнаться за свежим алиасом вместо проверки на своих задачах: новая версия обязана пройти тот же набор, что и предыдущая.

«Открытые веса дают контроль, API даёт скорость старта — выбор контура важнее выбора алиаса.» подход команды Зинин × Штурбин к пилотам моделей
// с чего начать

Выберите одну агентную задачу с измеримым результатом. Соберите тестовый набор из реальных запросов отдела, прогоните Instruct и Thinking на одинаковых заданиях. Решение о развёртывании принимайте по журналу проверки, расходам и требованиям к данным.

Частые вопросы

Kimi K2 — одна модель или семейство?
Kimi K2 — семейство моделей Moonshot. Исходный репозиторий описывает Kimi-K2-Base и Kimi-K2-Instruct. Отдельные официальные карточки есть у Kimi-K2-Thinking, Kimi-K2.6 и Kimi-K2.7-Code. Доступность через API сверяйте в каталоге платформы перед запуском.
Можно ли запустить Kimi K2 на своём сервере?
Да. Исходные веса Kimi K2 открыты под лицензией Modified MIT и доступны на Hugging Face в формате block-fp8. Файл занимает порядка терабайта до учёта накладных расходов; требования к памяти зависят от версии, квантования и нагрузки. Репозиторий описывает развёртывание через vLLM, SGLang и другие движки.
Чем Instruct отличается от Thinking?
Исходная Kimi-K2-Instruct предназначена для диалога и вызова инструментов без длительного рассуждения. Отдельная Kimi-K2-Thinking ориентирована на многошаговый разбор и работу с инструментами. Режимы других версий сверяйте по их карточкам: некоторые требуют обязательного рассуждения.
Как подключить Kimi K2 к внутреннему сервису?
Через API платформы Moonshot с совместимым форматом запросов или на своём сервере с открытыми весами и движком вывода. Конкретные функции и идентификатор модели проверьте в документации выбранного контура.
Сколько стоит Kimi K2 для компании?
Сумма зависит от контура. API тарифицируется за миллион токенов на входе и на выходе с учётом текущих правил кэширования; актуальные цифры на странице цен Moonshot. Свой сервер — это железо, электричество и работа администратора. Полную смету под вашу задачу собираем на Discovery-созвоне.