Qwen3 ASR переводит речь в текст на десятках языков, включая русский, и подходит для расшифровки встреч на собственном сервере, но разделять говорящих и сверять термины приходится отдельными шагами. Модель выпущена с открытой лицензией, поэтому записи разговоров остаются внутри вашего контура. Для протокола планёрки её хватает, а для юридически значимой стенограммы текст обязательно читает человек.

Что распознаёт модель

TL;DR

Qwen3-ASR — семейство открытых моделей распознавания речи от Qwen под лицензией Apache-2.0: два размера, 52 языка и диалекта, включая русский, режимы потоковой и обычной обработки, поддержка длинных записей. Разделения по говорящим в описании проекта нет.

По описанию на GitHub, модели узнают язык записи сами и поддерживают распознавание речи, а также пения с фоновой музыкой. Отдельная модель выравнивания расставляет временные метки на слова и фразы для одиннадцати языков, среди них русский, в пределах записи до пяти минут. Для длинной встречи это значит, что её режут на фрагменты и собирают обратно.

От мультимодальной модели Qwen Omni, которую мы разбирали в статье про Qwen Omni для голоса, видео и текста, эта линейка отличается узкой задачей: только речь в текст. Генерацию речи, то есть обратное направление, мы обсуждали в отдельных материалах про озвучку.

Для расшифровки встреч существенны три свойства семейства. Открытая лицензия позволяет держать записи внутри компании. Потоковый режим пригоден для живых субтитров на созвоне, а обычный режим — для пакетной обработки накопленных записей. Два размера дают выбор между скоростью на скромном оборудовании и запасом по качеству, и подбирать размер надо на тестовых записях, а рейтинги служат лишь отправной точкой.

Сравнение с другими вариантами, например с Whisper, и общие принципы распознавания речи в компании описаны в статье про Whisper для компании. Актуальные размеры, языки и способы запуска смотрите на странице проекта на GitHub.

Прогон записи

Установка и запуск описаны в проекте, а рабочий процесс расшифровки встречи удобно разложить на пять шагов с проверкой на каждом.

  1. Подготовьте запись: сохраните оригинал, сделайте рабочую копию, уберите длинные паузы и проверьте, что звук слышен на обоих концах разговора.
  2. Разрежьте длинную запись на фрагменты разумной длины по паузам, чтобы сохранить слова на стыках и уложиться в ограничение модели выравнивания.
  3. Запустите распознавание через пакет qwen-asr или поднимите сервер на vLLM, если записей много и нужна очередь.
  4. Склейте фрагменты в один текст, добавьте временные метки и пометьте места, где модель сомневалась или звук был плохим.
  5. Передайте текст на ручную сверку и сохраните исходный звук рядом: любое сомнительное место проверяется на слух.

Условный пример: отдел продаж проводит по пять встреч с клиентами в день и хочет получать краткий протокол к вечеру. Записи уходят на расшифровку ночью, утром менеджер читает текст с включённым звуком в местах с цифрами и обещаниями клиенту, правит и отправляет. Проверка, как правило, идёт быстрее набора протокола с нуля, но читать приходится каждый документ.

Для автоматизации под регулярные встречи эти шаги собирают в цепочку: запись, фрагменты, расшифровка, сверка, публикация протокола. Похожую схему для звонков описывает статья про ИИ для звонков.

Спикеры, термины, шум

Три проблемы встречаются в любой расшифровке деловой встречи, и модель распознавания решает их по-разному.

  • Спикеры. В описании семейства разделения по говорящим нет, поэтому реплики идут сплошным текстом. Метки «кто говорит» добавляют отдельным инструментом диаризации либо вручную по звуку.
  • Термины и названия. Редкие слова, названия продуктов и фамилии распознаются с ошибками. Заведите список терминов проекта и сверяйте текст по нему поиском.
  • Шум и перебивания. Вендор заявляет устойчивую работу в сложных акустических условиях, но заявление проверяйте на своих записях: гул переговорной и общий разговор снижают качество любой модели.
  • Числа и даты. Суммы, сроки и номера договоров сверяйте по звуку в первую очередь, потому что ошибка в числе меняет смысл решения.

Качество записи влияет на результат сильнее, чем выбор модели. Внешний микрофон на столе, отдельные дорожки для разных участников и тихая комната дают выигрыш больше, чем переход на модель крупнее. Если встречи проходят в шумном помещении, инвестируйте сначала в запись, потом в распознавание, иначе придётся вычитывать каждую страницу.

Проще всего проверить модель на трёх своих записях разного качества: чистая запись в наушниках, запись в общей комнате, телефонный разговор. Различие в результатах покажет, какие записи можно отдавать на расшифровку без опасения, а какие потребуют усиленной сверки.

● Discovery · 1 час · бесплатно

Какие встречи вам нужно расшифровывать регулярно?

Прийти на Discovery →

Типы ошибок

Ошибки распознавания полезно классифицировать: так видно, где поможет словарь, где лучший микрофон, а где придётся читать глазами.

Тип ошибкиКак выглядитЧто помогает
Подмена похожего словаНазвание продукта заменено на созвучноеСписок терминов и поиск по нему
Пропуск фразыКороткая реплика на фоне шума исчезлаПрослушивание сомнительных мест, лучшая запись
Склейка говорящихДва человека слиты в один абзацДиаризация или ручная разметка
Ошибка в числеЦифры и даты перепутаны или записаны словомСверка по звуку, повторное чтение вслух
Лишний текстМодель дописала фразу, которой в записи нетСравнение с оригиналом, проверка тишины в записи

Для борьбы с накоплением ошибок ведите журнал правок: что исправили, на какой записи, в чём причина. Через месяц журнал покажет закономерности: определённые термины, конкретного говорящего или конкретную комнату. Каждая закономерность превращается в простое действие: слово в словарь, микрофон поближе, дорожка отдельно.

Последняя строка встречается реже, но опаснее прочих: уверенно записанная фраза, которой в записи нет, выглядит как реальное высказывание. Поэтому в протоколах, на которые кто-то будет ссылаться, ключевые цитаты всегда сверяют со звуком.

Ручная сверка

// порядок сверки

Читайте текст с включённой записью: сначала места с числами, датами и именами, затем решения и поручения, и только потом остальное. Отметьте исправления и сохраните исходную версию, чтобы видеть, где ошибалась модель.

Качество измеряют долей исправленных мест на страницу текста по десятку записей. Если правок мало, сверку сокращают до выборочной. Если много, меняют запись, размер модели или добавляют словарь терминов. Типичная ошибка — доверять чистому на вид тексту и рассылать протокол участникам без прослушивания спорных мест.

Заранее договоритесь, кто получает доступ к записям и текстам и сколько времени они хранятся. Расшифровка встречи содержит имена, обещания и коммерческие условия, поэтому права просмотра ограничивают так же строго, как у самой записи, а по истечении срока хранения удаляют и звук, и текст.

Конфиденциальность тоже входит в проверку. Запись встречи содержит сведения, которые нельзя отдавать внешним сервисам, поэтому открытая модель на своём сервере решает часть вопросов. Как запускать модели Qwen у себя, мы описываем в статье про локальный запуск Qwen, а построение процесса расшифровки встреч — на странице про автоматизацию бизнес-процессов.

Частые вопросы

Что такое Qwen3-ASR?
Это семейство открытых моделей распознавания речи от Qwen под лицензией Apache-2.0. Оно переводит речь в текст на десятках языков и диалектов, умеет работать с длинными записями и потоковым режимом.
Поддерживает ли Qwen3-ASR русский язык?
Да, русский указан в списке поддерживаемых языков в описании проекта на GitHub. Качество на ваших записях, терминах и акцентах проверяйте до запуска в работу.
Умеет ли Qwen3-ASR разделять спикеров?
В описании проекта разделения по говорящим нет, поэтому метки «кто говорит» добавляют отдельным инструментом диаризации или вручную по звуку записи.
Как получить временные метки в расшифровке?
Для этого у семейства есть отдельная модель выравнивания, которая ставит метки на слова для одиннадцати языков, включая русский, в пределах записи до пяти минут. Длинные записи режут на фрагменты.
Как проверить расшифровку встречи?
Читайте текст с включённой записью: сначала числа, даты и имена, затем решения и поручения. Ключевые цитаты сверяйте со звуком, а исходную версию сохраняйте для сравнения.