DeepSeek Vision против текстовой версии той же модели — разница ровно в одном: на вход добавляется картинка вместе со строкой текста, и модель отвечает на вопрос по содержимому фото так же, как отвечала бы по абзацу документа. Фото счёта, скриншот переписки, схема на доске — с какого из них сотрудник чаще всего вручную переносит данные в таблицу? Модель справляется с частью этой рутины, а точность на конкретных документах компании проверяют на своём наборе образцов, прежде чем доверить задачу целиком.

Картинка на входе

TL;DR

DeepSeek Vision принимает изображение вместе с текстовым вопросом и отвечает по содержимому фото — описывает картинку, вытаскивает конкретные поля из документа на снимке или отвечает на вопрос про то, что на нём изображено.

Задача сотрудника чаще всего выглядит одинаково: снять телефоном фото документа, счёта или экрана — и получить с этого фото готовый текст или конкретное значение поля, вместо того чтобы перепечатывать данные руками.

Разница между DeepSeek Vision и обычной текстовой DeepSeek — именно в первом шаге: текстовая модель ждёт на входе только текст, а версия с распознаванием картинок принимает ещё и изображение, обрабатывая оба типа входа в одном запросе.

Формат фото на входе остаётся свободным для практических целей — скан, фото с телефона, скриншот экрана — модель работает с обычным изображением без специальной подготовки файла перед отправкой.

Что распознаёт модель

Модель на входе с картинкой закрывает несколько типовых задач сотрудника — общий образ у всех один: на входе фото или скриншот, где чистого текста нет вовсе.

  • Фото счёта или акта — модель читает сумму, дату, реквизиты и другие поля, которые сотрудник обычно переносит в таблицу вручную
  • Скриншот переписки или экрана программы — модель пересказывает содержимое или вытаскивает конкретный кусок текста с картинки
  • Схема или диаграмма на доске — модель описывает структуру и связи, которые видит на фото, словами
  • Товар на полке или фото упаковки — модель описывает, что изображено, и отвечает на вопрос про конкретную деталь снимка

Общий приём один и тот же для всех четырёх сценариев: сотрудник присылает фото и вопрос к нему, а модель отвечает по содержимому картинки — без отдельного шага распознавания текста заранее.

Четыре сценария выше — типовой список вместо исчерпывающего перечня: модель отвечает на любой вопрос по картинке, который сотрудник в состоянии сформулировать словами, и граница здесь скорее в качестве самого снимка, чем в теме вопроса.

Картинка и токены

Отдельный сервис OCR читает буквы на изображении и превращает их в текстовый слой, vision-модель отвечает на вопрос по смыслу картинки — разбор этой развилки с примером промпта уже есть в статье Qwen VL для распознавания документов и фото в компании, и для DeepSeek он повторяется без изменений. Здесь важнее другое отличие DeepSeek Vision от текстовой версии — цена картинки в токенах.

Изображение на входе разбивается на фрагменты, и каждый фрагмент занимает место в контексте запроса наравне с текстом: фото документа расходует токены ещё до того, как сотрудник задал вопрос. Чем крупнее снимок и чем больше картинок в одном запросе, тем тяжелее счётчик — принцип тот же, что у длинной истории диалога.

Отсюда практическое правило для потока документов: обрезать снимок до нужной области, отправлять одну страницу за запрос и держать вопрос коротким. Как устроен сам счётчик и какие приёмы держат расход под контролем, разобрано в статье DeepSeek токены: как считать расход компании — картинка добавляет к этому списку только один пункт, размер входа.

Считать расход заранее проще всего на реальном примере: тот документ, который сотрудники сегодня чаще всего фотографируют и переносят руками, и есть первый кандидат на замер.

● Discovery · 1 час · бесплатно

Какой документ сотрудники чаще всего фотографируют и переносят вручную?

Прийти на Discovery →

Проверка на образцах

Точность модели на конкретных документах компании проверяют до того, как отдать ей задачу целиком, — общие обещания вендора про качество распознавания редко совпадают с реальным качеством на отдельном счёте или бланке компании.

  1. Собрать десять образцов — реальные фото счетов, актов или экранов, с которыми сотрудник работает каждый день, включая мятые, тёмные и косые снимки
  2. Прогнать каждый образец через модель с одним и тем же вопросом или задачей извлечения полей
  3. Сверить результат человеком построчно — сумма, дата, реквизиты, название — и отметить, где модель ошиблась
  4. Посчитать долю образцов без ошибок и решить, доверяет ли компания задаче целиком или оставляет проверку человеком на каждом документе

Где модель обычно ошибается — мелкий текст на смазанном фото, рукописные пометки поверх печатного текста, таблица со сложной вёрсткой и печать поверх подписи; десять образцов из практики компании покажут эти слабые места быстрее любого обзора модели в интернете.

Десять образцов — стартовый ориентир, который команда сама корректирует по задаче: для случая с высокой ценой ошибки, вроде сверки сумм в счёте перед оплатой, набор образцов разумно расширить, а для черновой сортировки фото хватает и меньшего числа проверок.

Результат проверки стоит сохранять — тот же набор образцов пригодится повторно, когда вендор обновит модель или компания подключит новый тип документа.

Доступ и открытые веса

Доступ к DeepSeek Vision устроен теми же двумя путями, что и к текстовой версии модели. Первый — сервис вендора напрямую, и здесь оплата российской картой напрямую недоступна, без обходных схем оплаты. Второй путь — открытые веса: у DeepSeek они традиционно публикуются на своей площадке моделей, и наличие там варианта с поддержкой изображений на момент запуска проверяют в карточке модели, прежде чем ставить контур на свой или арендованный сервер.

У Qwen похожая vision-модель тоже доступна как открытые веса — сравнение задачи между вендорами уместнее вести на собственном наборе образцов компании, а название бренда здесь — плохой ориентир.

Карточка модели на площадке, откуда её скачивают, обычно перечисляет размеры доступных вариантов и формат входа — перед установкой на сервер компании эту карточку полезно открыть и свериться, подходит ли конкретный вариант под объём задач команды.

// с чего начать

Прежде чем выбирать модель для распознавания насовсем, соберите десять образцов документов компании, задайте каждому один и тот же вопрос и сверьте результат человеком.

Похожая задача целиком, от загрузки документа до проверки полей человеком, разобрана в статье ИИ для распознавания счетов и актов. Контур для работы с документами компании собирают на этапе внедрения нейросетей для документов — там же считают, сколько типов документов в компании подходят под такую задачу.

Частые вопросы

Что умеет DeepSeek Vision?
Принимает изображение вместе с текстовым вопросом и отвечает по содержимому фото — описывает картинку, вытаскивает конкретные поля из документа на снимке или отвечает на вопрос про то, что на нём изображено.
Чем DeepSeek Vision отличается от OCR?
OCR читает буквы на изображении и превращает их в текстовый слой, а vision-модель понимает контекст картинки и отвечает на вопрос по смыслу — задача глубже простого копирования текста построчно.
Как проверить качество распознавания на своих документах?
Собрать десять образцов реальных документов компании, прогнать каждый через модель с одним вопросом и сверить результат человеком построчно — так видно долю образцов без ошибок.
Есть открытые веса у DeepSeek Vision?
Да — у DeepSeek есть открытые веса, и версию с распознаванием картинок можно поставить на свой или арендованный сервер; конкретный список вариантов смотрят в карточке модели.
Где модель чаще ошибается при распознавании фото?
На мелком тексте смазанного снимка, рукописных пометках поверх печатного текста, таблицах со сложной вёрсткой и печати поверх подписи — эти случаи лучше проверять отдельно на своих образцах.