Kimi K2 — семейство открытых моделей Moonshot, собранных под агентные задачи: модель сама выбирает инструмент, вызывает его и продолжает рассуждение. Для компании в России у семейства два рабочих контура — платформа Moonshot по API и собственный сервер с открытыми весами; терминальный агент Kimi Code и общий обзор API остаются за кадром. Материал поможет выбрать версию под задачу, оценить ресурсы и выстроить проверку результата сотрудником до запуска пилота.
Архитектура семейства
По данным репозитория MoonshotAI, Kimi K2 — модель смеси экспертов с 1 трлн общих и 32 млрд активных параметров на токен, контекстом 128K и весами под лицензией Modified MIT; архитектура задумана для работы с инструментами.
Kimi K2 вырос из исследовательского проекта Moonshot в открытую линейку: веса лежат на Hugging Face в формате block-fp8, а репозиторий на GitHub описывает и базовую модель, и пост-обученную версию для диалога. Лицензия Modified MIT разрешает коммерческое использование и доработку, поэтому компания может развернуть конкретный открытый весовой файл в собственном контуре. Для коммерческого продукта условия Modified MIT стоит прочитать целиком. Репозиторий публикует результаты отдельных тестов кодирования и работы с инструментами. Это результаты вендора на конкретных наборах; пригодность к процессу компании проверяют на своих данных.
В архитектуре смеси экспертов лишь часть параметров активируется для обработки очередного токена. По карточке исходной Kimi K2, общая численность составляет триллион параметров, а активная часть — 32 миллиарда. Эти параметры описывают архитектуру; скорость и стоимость требуют отдельного расчёта: реальную задержку определяют оборудование, длина запроса, число пользователей и настройки сервера. Движение в ту же сторону — у других открытых семейств: разбор архитектуры смеси экспертов лежит в глоссарии.
Акцент семейства — агентность. Модель умеет вызывать внешние инструменты по схеме, держать многошаговый диалог и работать с длинным контекстом. Как Kimi справляется с длинными документами в повседневных рабочих сценариях, разобрано в материале про Kimi для работы с длинными документами.
Линейка обновляется: помимо исходной K2, Moonshot опубликовала карточки Kimi-K2-Thinking и Kimi-K2.6, а также Kimi-K2.7-Code для задач разработки. Доступность конкретного идентификатора через API сверяйте в каталоге платформы в день запуска. Имя модели в коде, версия открытых весов и режим рассуждения требуют отдельной фиксации в журнале проверки.
Версии и режимы
Выбор версии начинается с типа задачи. Пост-обученная Kimi-K2-Instruct отвечает быстро и уверенно ведёт диалог с инструментами: репозиторий называет такое поведение рефлексным, модель действует сразу, без длинной внутренней проработки. Для задач, где важна глубина рассуждения, есть отдельная открытая модель Kimi-K2-Thinking и режимы рассуждения в некоторых API-моделях. Возможность переключения зависит от модели: отдельные версии работают только с включённым рассуждением. Сверьте карточку выбранного идентификатора и формат ответа до интеграции.
| Версия | Поведение | Когда брать |
|---|---|---|
| Kimi-K2-Base | Продолжает текст, базовые навыки | Собственное дообучение и эксперименты |
| Kimi-K2-Instruct | Быстрый ответ, вызов инструментов | Чат-боты, классификация, потоковые операции |
| Kimi-K2-Thinking | Рассуждение с вызовом инструментов | Многошаговый анализ и проверка цепочки действий |
| Kimi-K2.7-Code | Специализация на задачах кода | Работа с репозиторием и патчами |
Документация по развёртыванию Kimi-K2.7-Code описывает режим рассуждения как обязательный для этой версии. Для многошагового диалога сохраняйте историю сообщений и ответы инструментов в формате, который предписывает выбранный API. Передачу внутреннего reasoning_content и режим сохранения рассуждений проверяйте по текущей документации конкретной модели; самовольная подстановка поля может вызвать ошибку запроса.
Базовую модель берут для исследований и дообучения. Для диалога без дополнительной настройки подходит постобученная версия Instruct; собственная настройка базовой модели требует специалистов и инфраструктуры. Параллели с выбором Instruct-версии у других открытых семейств удобно смотреть в разборе Instruct и базовой модели на примере Qwen.
Сравнивайте название модели и конкретный файл весов. Исходный Kimi-K2-Instruct и Kimi-K2-Thinking имеют разные режимы работы и контекстные настройки в официальных карточках Moonshot. При локальном развёртывании сохраните идентификатор файла, версию движка вывода и параметры запуска. Для API сохраните имя модели, адрес сервиса и поддерживаемые функции. Это защищает пилот от скрытой смены поведения после обновления алиаса.
Сервер против API
Первый контур — платформа Moonshot. Moonshot описывает совместимые с OpenAI и Anthropic способы обращения к API. У каждого способа свой формат сообщений; поддержку вызова инструментов и потоковой выдачи сверяйте для выбранной модели и метода. Кэширование запросов и структурированный ответ проверяйте по актуальной документации платформы до расчёта стоимости. Условия оплаты для компании из России проверяйте напрямую на платформе Moonshot до пилота. Тарификация за миллион токенов на входе и на выходе; актуальные цифры смотрите на странице цен Moonshot на дату старта.
Второй контур — открытые веса на своём или арендованном сервере. Исходные веса Kimi K2 в block-fp8 занимают порядка терабайта до учёта накладных расходов развёртывания. Объём памяти для работы зависит от выбранной версии, квантования, контекста и параллельной нагрузки. Проверьте требования к оборудованию для конкретного файла весов. Возможна гибридная схема: движок KTransformers смещает часть слоёв в оперативную память ценой скорости ответа. Репозиторий рекомендует vLLM, SGLang и TensorRT-LLM; практику запуска больших открытых моделей на своём железе разбираем в материале про vLLM для компаний и в гайде по локальному запуску DeepSeek.
Третий критерий выбора — нагрузка. Для редких пакетных задач API может сократить подготовку инфраструктуры; расходы зависят от тарифа и фактического числа токенов. Для постоянного потока свой сервер имеет смысл оценить через полный расчёт: оборудование, электричество, администрирование, резервирование и загрузка. Экономический порог выводят из собственных измерений, универсального порога нет.
API-контур позволяет начать без своего сервера. Если правила компании запрещают передачу материалов в облако вендора, проверяйте возможность развёртывания конкретных открытых весов в собственном контуре. Какая агентная задача первой встанет на Kimi K2 в вашей компании?
Если компания выбирает свой сервер ради контроля данных, проверьте весь путь запроса: входное приложение, очередь, журналы, хранилище ответов и резервные копии. Закрытость контура зависит от настройки всей инфраструктуры. Права доступа, сетевые правила и срок хранения закрепляют в настройках инфраструктуры и внутренних процедурах. Для сравнения с API зафиксируйте одинаковый тестовый набор и считайте как прямые расходы, так и время сотрудников на сопровождение.
Какая агентная задача первой встанет на Kimi K2 в вашей компании?
Проверка на задачах
Бенчмарки вендора показывают результат на отдельных наборах задач; результат отдела проверяют отдельно. Соберите набор реальных обращений: вопросы клиентов, типовые правки, отчёты, которые сотрудники разбирают каждую неделю. Прогоняйте каждую версию в одинаковых условиях и фиксируйте результат в журнале.
- Выпишите задачи и критерии приёмки: что считается верным ответом, какие данные допустимы в запросе.
- Прогоните набор через текущую рабочую модель и через выбранную версию K2 с одинаковым системным промптом.
- Проверьте вызов инструментов: какой инструмент выбран, верные ли аргументы, что происходит при ошибке.
- Проверьте код на репозитории: запустите тесты проекта против предложенных правок до принятия патча.
- Считайте формулы и полные выгрузки парсером или скриптом: модель объясняет цифры и строит гипотезы, человек сверяет итог.
- Оформите протокол: где модель права, где ошибается, какие случаи уходят к сотруднику полностью.
Модель уверенно звучит и там, где ошибается, поэтому журнал проверки важнее впечатления от демо. Права доступа и подтверждения критичных действий проверяет сервер вашего сервиса. Промпт помогает описать порядок работы, а допуск к действию задаётся серверными правилами. Включите в протокол разбор спорных случаев целиком силами сотрудника.
Дальше — предложение пилота: один контур, один отдел, каждый результат модели проходит через руки сотрудника до появления автоматики. Опыт агентного контура с человеком в цикле описан в статье про ИИ-агентов для бизнеса.
Включите в тест два отказа: недоступный инструмент и источник с противоречивым ответом. При ошибке агент передаёт ситуацию сотруднику. Сервер оставляет действие в состоянии ожидания до подтверждения. В журнале отмечайте выбор инструмента, аргументы, ответ сервиса и итоговое решение сотрудника. Так проверяется именно агентный сценарий, ради которого рассматривают K2. Гладкий текст по готовому фрагменту служит отдельной задачей.
Первый запуск
Начните с вопроса о данных: где они живут и кому разрешено их обрабатывать. Публичные потоки и черновики удобнее гонять через платформенный API, персональные данные и коммерческая тайна — в разрешённом компанией контуре с проверенными правами и договорными условиями. Собственный сервер может быть одним из таких вариантов. Сравните доступные версии по каждому контуру отдельно: открытый файл весов и модель платформы могут отличаться. Свой сервер даёт контроль над настройками развёртывания, а API сокращает подготовку инфраструктуры.
Типичная ошибка на старте — менять версию посреди проверки. Зафиксируйте алиас модели в заголовке журнала и меняйте его только между циклами сравнения: иначе журнал смешает две разные модели, и выводы рассыплются. Вторая ошибка — гнаться за свежим алиасом вместо проверки на своих задачах: новая версия обязана пройти тот же набор, что и предыдущая.
«Открытые веса дают контроль, API даёт скорость старта — выбор контура важнее выбора алиаса.» подход команды Зинин × Штурбин к пилотам моделей
Выберите одну агентную задачу с измеримым результатом. Соберите тестовый набор из реальных запросов отдела, прогоните Instruct и Thinking на одинаковых заданиях. Решение о развёртывании принимайте по журналу проверки, расходам и требованиям к данным.