Qwen safetensors — формат, в котором веса модели хранятся у вендора, а GGUF — сжатая версия под запуск на обычном ноутбуке: первый держит полную точность для сервера с видеокартой и для дообучения, второй уменьшает файл ценой части точности ответа. Разница решает, какой файл компания качает под свою задачу — сервер с GPU или рабочий ноутбук сотрудника. Проверка источника и подписи файла остаётся общим правилом для обоих форматов, вместо доверия первой ссылке из поиска.

Зачем нужен формат

TL;DR

Safetensors — формат хранения весов модели, который вендор Qwen публикует по умолчанию: файл содержит только числа модели, без исполняемого кода внутри, — в отличие от старых форматов сериализации, где загрузка чужого файла могла незаметно запустить произвольный скрипт.

Старые форматы хранения весов позволяли зашить внутрь файла произвольный код — при загрузке модели этот код мог выполниться на сервере компании без предупреждения. Safetensors решает эту проблему структурой файла: внутри лежат только числа и метаданные, а исполняемого кода там попросту нет.

Вендор Qwen публикует модели в safetensors как основной формат — это исходные веса без сжатия, с полной точностью вычислений, которую дальше при необходимости урезают под задачу компании.

Полную точность safetensors используют как базу для дообучения через адаптеры — разбор устроен в статье LoRA для Qwen: лёгкое дообучение.

Формат стал стандартом у большинства открытых моделей примерно по одной причине: движки инференса и инструменты дообучения ждут именно его на входе, и файл в safetensors подключается к готовому стеку без промежуточной конвертации.

Safetensors против GGUF

Оба формата хранят одну и ту же модель Qwen — выбор между ними решает железо и задача компании, вместо личных предпочтений инженера.

ФорматГде живётДля чего
Safetensorsсервер с видеокартой, полная точностьдообучение через адаптеры, серверный инференс без потери качества
GGUFноутбук или рабочая станция сотрудникаповседневный диалог с моделью без выделенного сервера
LoRA-адаптеротдельный маленький файл поверх safetensorsдообучение модели под задачу компании без переобучения всех весов

Разбор самого формата GGUF и того, как квантование влияет на качество ответа, собран в статье Qwen в формате GGUF — здесь речь про исходный файл, из которого GGUF вообще получают.

Путаница между форматами чаще возникает у сотрудника, который скачивает модель впервые: название файла отличается расширением, а карточка модели на странице вендора обычно перечисляет оба варианта рядом, с пометкой, для какой задачи каждый предназначен.

Когда нужен именно он

Дообучение через LoRA-адаптер требует именно safetensors — адаптер настраивается поверх полной точности исходных весов, а сжатая версия GGUF для этой задачи непригодна.

Серверный инференс с полной точностью — второй повод: там, где ответ модели идёт в задачу с высокой ценой ошибки, полная точность safetensors выигрывает у сжатой версии по стабильности ответа.

Третий повод — тест новой версии модели перед закупкой железа под неё: инженер разворачивает safetensors на арендованном сервере, прогоняет задачи компании и только после этого решает, какая конфигурация нужна на постоянной основе.

Такой тест обходится дешевле, чем закупка сервера под модель, которая на задачах компании покажет себя слабее ожиданий — аренда снимает этот риск на время проверки, а решение о постоянном железе принимают уже на живых цифрах.

  • Дообучение под задачу компании — адаптер LoRA ставится поверх safetensors
  • Сервер с видеокартой и запасом памяти — полная точность оправдана, когда железо её вытягивает
  • Задачи с высокой ценой ошибки — юридическая проверка, финансовый расчёт, где сжатие рискует потерей качества ответа

Выбор формата под конкретный сервер решают вместе с инженером, который поднимает контур, — вопрос сюда попадает раньше покупки железа, вместо запоздалой правки уже готового сервера.

Дообучение остаётся главной причиной держать safetensors на сервере даже там, где сотрудники параллельно работают с GGUF-копией на ноутбуках: адаптер обучают на полной точности, а раздают уже сжатую версию той же модели.

● Discovery · 1 час · бесплатно

Какую задачу вы дообучили бы на своём Qwen первой?

Прийти на Discovery →

Проверка перед загрузкой

  1. Скачивайте safetensors из официального репозитория вендора модели или проверенного зеркала, указанного в карточке модели
  2. Сверяйте контрольную сумму файла с той, что опубликована рядом с весами — совпадение подтверждает целостность загрузки
  3. Читайте карточку модели перед установкой — там указаны версия, лицензия и известные ограничения конкретного релиза
  4. Держите загруженный файл в отдельной папке проекта до полной проверки и переносите на рабочий сервер только после неё

Проверка занимает меньше времени, чем восстановление сервера после файла из сомнительного источника, — привычка сверять контрольную сумму окупается уже на первой ошибке скачивания.

Подробный разбор источников весов и проверки карточки модели — в статье Qwen download: где брать веса модели.

Четыре шага выше складываются в привычку буквально за пару загрузок — инженер компании проходит их автоматически, и отдельная инструкция на стене перестаёт быть нужной уже к третьему файлу.

Путь в GGUF команде

Компании редко останавливаются на одном формате: safetensors остаётся на сервере для дообучения и точного инференса, а копию модели конвертируют в GGUF для ноутбуков сотрудников, которым сервер с видеокартой без надобности.

Решение о конвертации обычно принимает тот же инженер, что разворачивал safetensors на сервере, — он же выбирает степень сжатия под задачи конкретного отдела и объясняет команде, какого падения точности ждать на практике.

Конвертация — отдельный шаг локальными инструментами: встроенной функции внутри самого файла safetensors нет.

Разбор адаптеров LoRA, которые ставят поверх safetensors под задачу компании, — там же типичные ошибки дообучения, которых нет смысла повторять на своих данных.

Вывод команде проще формулировать одним правилом: сервер держит safetensors как источник истины, а любая копия в GGUF на стороне остаётся расходным файлом, который в любой момент пересобирают из оригинала заново.

// с чего начать

Контрольная сумма файла и карточка модели — две проверки перед скачиванием весов для дообучения; обе занимают пару минут и снимают риск сломанной или подменённой сборки.

Полную схему хранения, проверки и дообучения весов под контур компании разбирают на странице внедрения ИИ под задачи компании, а термин из словаря — Qwen — поясняет, откуда вообще берётся семейство моделей за обоими форматами.

Частые вопросы

Чем Qwen safetensors отличается от GGUF?
Safetensors хранит исходные веса с полной точностью для сервера с видеокартой и дообучения, а GGUF — сжатая версия под запуск на обычном ноутбуке без выделенного сервера.
Нужен ли safetensors для дообучения через LoRA?
Да — адаптер LoRA настраивается поверх полной точности исходных весов, и сжатая версия GGUF под эту задачу непригодна.
Безопасен ли формат safetensors?
Да, для этого он и придуман: файл содержит только числа и метаданные модели, без исполняемого кода внутри, в отличие от старых форматов сериализации.
Как проверить файл safetensors перед загрузкой?
Скачать из официального репозитория вендора или проверенного зеркала, сверить контрольную сумму и прочитать карточку модели с версией и лицензией.
Можно ли конвертировать safetensors в GGUF для сотрудников?
Да, это отдельный шаг локальными инструментами — исходный файл остаётся на сервере для дообучения, а копию в GGUF ставят на ноутбук без видеокарты.