DeepSeek Vision против текстовой версии той же модели — разница ровно в одном: на вход добавляется картинка вместе со строкой текста, и модель отвечает на вопрос по содержимому фото так же, как отвечала бы по абзацу документа. Фото счёта, скриншот переписки, схема на доске — с какого из них сотрудник чаще всего вручную переносит данные в таблицу? Модель справляется с частью этой рутины, а точность на конкретных документах компании проверяют на своём наборе образцов, прежде чем доверить задачу целиком.
Картинка на входе
DeepSeek Vision принимает изображение вместе с текстовым вопросом и отвечает по содержимому фото — описывает картинку, вытаскивает конкретные поля из документа на снимке или отвечает на вопрос про то, что на нём изображено.
Задача сотрудника чаще всего выглядит одинаково: снять телефоном фото документа, счёта или экрана — и получить с этого фото готовый текст или конкретное значение поля, вместо того чтобы перепечатывать данные руками.
Разница между DeepSeek Vision и обычной текстовой DeepSeek — именно в первом шаге: текстовая модель ждёт на входе только текст, а версия с распознаванием картинок принимает ещё и изображение, обрабатывая оба типа входа в одном запросе.
Формат фото на входе остаётся свободным для практических целей — скан, фото с телефона, скриншот экрана — модель работает с обычным изображением без специальной подготовки файла перед отправкой.
Что распознаёт модель
Модель на входе с картинкой закрывает несколько типовых задач сотрудника — общий образ у всех один: на входе фото или скриншот, где чистого текста нет вовсе.
- Фото счёта или акта — модель читает сумму, дату, реквизиты и другие поля, которые сотрудник обычно переносит в таблицу вручную
- Скриншот переписки или экрана программы — модель пересказывает содержимое или вытаскивает конкретный кусок текста с картинки
- Схема или диаграмма на доске — модель описывает структуру и связи, которые видит на фото, словами
- Товар на полке или фото упаковки — модель описывает, что изображено, и отвечает на вопрос про конкретную деталь снимка
Общий приём один и тот же для всех четырёх сценариев: сотрудник присылает фото и вопрос к нему, а модель отвечает по содержимому картинки — без отдельного шага распознавания текста заранее.
Четыре сценария выше — типовой список вместо исчерпывающего перечня: модель отвечает на любой вопрос по картинке, который сотрудник в состоянии сформулировать словами, и граница здесь скорее в качестве самого снимка, чем в теме вопроса.
Картинка и токены
Отдельный сервис OCR читает буквы на изображении и превращает их в текстовый слой, vision-модель отвечает на вопрос по смыслу картинки — разбор этой развилки с примером промпта уже есть в статье Qwen VL для распознавания документов и фото в компании, и для DeepSeek он повторяется без изменений. Здесь важнее другое отличие DeepSeek Vision от текстовой версии — цена картинки в токенах.
Изображение на входе разбивается на фрагменты, и каждый фрагмент занимает место в контексте запроса наравне с текстом: фото документа расходует токены ещё до того, как сотрудник задал вопрос. Чем крупнее снимок и чем больше картинок в одном запросе, тем тяжелее счётчик — принцип тот же, что у длинной истории диалога.
Отсюда практическое правило для потока документов: обрезать снимок до нужной области, отправлять одну страницу за запрос и держать вопрос коротким. Как устроен сам счётчик и какие приёмы держат расход под контролем, разобрано в статье DeepSeek токены: как считать расход компании — картинка добавляет к этому списку только один пункт, размер входа.
Считать расход заранее проще всего на реальном примере: тот документ, который сотрудники сегодня чаще всего фотографируют и переносят руками, и есть первый кандидат на замер.
Какой документ сотрудники чаще всего фотографируют и переносят вручную?
Проверка на образцах
Точность модели на конкретных документах компании проверяют до того, как отдать ей задачу целиком, — общие обещания вендора про качество распознавания редко совпадают с реальным качеством на отдельном счёте или бланке компании.
- Собрать десять образцов — реальные фото счетов, актов или экранов, с которыми сотрудник работает каждый день, включая мятые, тёмные и косые снимки
- Прогнать каждый образец через модель с одним и тем же вопросом или задачей извлечения полей
- Сверить результат человеком построчно — сумма, дата, реквизиты, название — и отметить, где модель ошиблась
- Посчитать долю образцов без ошибок и решить, доверяет ли компания задаче целиком или оставляет проверку человеком на каждом документе
Где модель обычно ошибается — мелкий текст на смазанном фото, рукописные пометки поверх печатного текста, таблица со сложной вёрсткой и печать поверх подписи; десять образцов из практики компании покажут эти слабые места быстрее любого обзора модели в интернете.
Десять образцов — стартовый ориентир, который команда сама корректирует по задаче: для случая с высокой ценой ошибки, вроде сверки сумм в счёте перед оплатой, набор образцов разумно расширить, а для черновой сортировки фото хватает и меньшего числа проверок.
Результат проверки стоит сохранять — тот же набор образцов пригодится повторно, когда вендор обновит модель или компания подключит новый тип документа.
Доступ и открытые веса
Доступ к DeepSeek Vision устроен теми же двумя путями, что и к текстовой версии модели. Первый — сервис вендора напрямую, и здесь оплата российской картой напрямую недоступна, без обходных схем оплаты. Второй путь — открытые веса: у DeepSeek они традиционно публикуются на своей площадке моделей, и наличие там варианта с поддержкой изображений на момент запуска проверяют в карточке модели, прежде чем ставить контур на свой или арендованный сервер.
У Qwen похожая vision-модель тоже доступна как открытые веса — сравнение задачи между вендорами уместнее вести на собственном наборе образцов компании, а название бренда здесь — плохой ориентир.
Карточка модели на площадке, откуда её скачивают, обычно перечисляет размеры доступных вариантов и формат входа — перед установкой на сервер компании эту карточку полезно открыть и свериться, подходит ли конкретный вариант под объём задач команды.
Прежде чем выбирать модель для распознавания насовсем, соберите десять образцов документов компании, задайте каждому один и тот же вопрос и сверьте результат человеком.
Похожая задача целиком, от загрузки документа до проверки полей человеком, разобрана в статье ИИ для распознавания счетов и актов. Контур для работы с документами компании собирают на этапе внедрения нейросетей для документов — там же считают, сколько типов документов в компании подходят под такую задачу.