В каталоге Hugging Face Datasets набор для пилота выбирают по карточке: сначала смотрят состав, происхождение и лицензию, и только потом тему. Файлы в каталоге открыты, однако право применять их в коммерческом проекте зависит от лицензии, и карточка набора это различие обычно показывает. Если пилот строится на собранных вами данных, материал пригодится для сторонних наборов; если своих данных нет, начинайте с него.
Что в наборе
Датасет на Hugging Face описывает карточка: откуда данные, на каких языках, какие поля, какая лицензия и какие ограничения; без её прочтения выбирать набор для пилота рано.
Набор данных на платформе — это git-репозиторий с файлами и описанием, который загружают в код библиотекой datasets или смотрят прямо на странице набора; у многих наборов есть и просмотрщик данных. Описание, то есть карточка, лежит в файле README.md: вверху блок метаданных с лицензией, языками, категориями задач и тегами, ниже свободный текст о составе и ограничениях. Если лицензия указана допустимым идентификатором, платформа показывает её на странице набора. Читать нужно оба слоя, потому что метаданные заполняет автор, и полнота зависит от его добросовестности. Обратите внимание и на историю изменений набора: если автор правил состав или менял лицензию, это видно в журнале коммитов репозитория. Чем подробнее карточка, тем выше шанс, что автор отнёсся к набору серьёзно.
Выбор набора отличается от выбора весов модели, о котором мы писали в статье про открытые модели на Hugging Face. Веса можно заменить за вечер, а на набор данных опирается и метрика, и поведение системы, и юридическая позиция компании. Ошибка здесь дороже, и тратить на выбор стоит больше времени.
- Состав: какие поля, сколько примеров, как они поделены на обучающую и проверочную части.
- Язык и предметная область: совпадают ли они с вашими задачами.
- Период сбора: актуальны ли данные для вашей отрасли.
- Способ создания: люди, программа или другая модель.
Откуда данные
Происхождение набора определяет и качество, и риски, поэтому вопрос «откуда это взялось» задают первым, а метрики обсуждают потом. Данные собирали с публичных сайтов, брали из открытых архивов, размечали вручную, получали от другой модели или выгружали из чьей-то системы. У каждого варианта свои слабые места: сайты тянут шум и рекламу, ручная разметка зависит от инструкции, синтетические примеры повторяют ошибки генератора.
Три вопроса к любому набору: кто собрал данные, как и когда, на каких условиях автор разрешает их использовать. Набор без ответа хотя бы на один остаётся непроверенным, и для пилота ищут замену или пишут автору.
Отдельное внимание уделите наборам, сделанным другой моделью. Ответы моделей часто наследуют условия использования вендора, и ограничения могут распространяться на обученные на них системы. Общие принципы подготовки обучающих данных описаны в материале про данные для обучения ИИ, там же разобрана разница между своими данными и найденными в сети.
Лицензия набора
Лицензия указывается в карточке и определяет, что разрешено: хранить, изменять, использовать в коммерческом продукте, распространять результат. Что указано в карточке, нужно прочитать до загрузки данных в проект, до получения первых метрик, пока отказаться от набора легко.
| Что указано в карточке | Что обычно разрешает | Что проверить |
|---|---|---|
| Разрешающая (MIT, Apache 2.0, CC BY) | Коммерческое использование с указанием авторства | Требования к упоминанию автора в продукте |
| С оговоркой о некоммерческом применении (CC BY-NC) | Исследования и внутренние эксперименты | Допустим ли платный пилот для клиента |
| С условием на производные работы (CC BY-SA) | Использование при открытой лицензии на результат | Совместимость с вашей политикой раскрытия |
| Набор с запросом доступа (gated) | Файлы выдаются после запроса: вы делитесь именем пользователя и почтой, автор вправе отозвать доступ в любой момент | Какие условия приняли и кто в компании отправил запрос |
| Лицензия отсутствует | Прав на использование заранее нет | Написать автору или заменить набор |
Лицензия на набор и лицензия на модель, обученную на нём, живут отдельно, но влияют друг на друга. Пилот для клиента и внутренний эксперимент требуют разных проверок, и юрист нужен в обоих случаях. Заведите таблицу учёта: название набора, ссылка, дата скачивания, тип лицензии, кто проверил. Через год, когда клиент или аудитор спросит, откуда взялись данные, ответ найдётся за минуту. Если сомнение остаётся, выбирайте набор с разрешающей лицензией и понятным автором.
На каких данных вы планируете запускать свой пилот?
Персональные данные
Открытый набор может содержать персональные данные: имена, адреса, телефоны, фрагменты переписки, отзывы с именами. Публичность источника оставляет обязанности оператора на месте, если оператор использует эти сведения в проекте. Вы отвечаете за данные, попавшие в ваш контур, а ссылка на каталог защитой от претензий служить нельзя.
- Просмотрите случайную выборку из нескольких сотен записей и отметьте всё, что похоже на сведения о людях.
- Проверьте поиском по шаблонам: телефоны, почта, номера документов, адреса.
- Уточните в карточке, делал ли автор обезличивание и каким способом.
- Решите, что делать с найденным: удалить записи, заменить значения или отказаться от набора.
Правила и способы обезличивания разобраны в статье про анонимизацию данных для нейросети, а граница допустимого — в материале о том, можно ли загружать персональные данные в нейросеть. Отдельный случай — наборы, собранные из чужих обращений в поддержку и форумов: даже с удалёнными именами такие тексты нередко содержат детали, по которым человека узнают. При сомнениях набор лучше заменить: выигрыш от удобной тематики редко окупает риск.
Проверка качества
Качество набора проверяют на вашей задаче, и число скачиваний критерием служить нельзя. Популярность говорит лишь об удобстве набора для учебных примеров, а о пригодности для вашего отдела молчит.
- Откройте просмотрщик данных на странице набора или скачайте небольшую часть и пролистайте глазами несколько десятков примеров подряд.
- Отметьте типичные дефекты: дубли, пустые поля, перепутанные метки, обрезанные тексты, посторонний язык.
- Соберите контрольный набор из примеров вашей отрасли и сравните распределение тем с найденным набором.
- Проверьте разметку выборочно: два человека размечают одни и те же записи, и вы смотрите, насколько их ответы расходятся.
- Зафиксируйте хеш коммита репозитория набора и дату скачивания, чтобы результаты пилота можно было повторить.
- Запишите решение: берём, берём после очистки или отказываемся, с причиной.
Зафиксированная версия важна: репозиторий набора могут обновить, и метрики пилота перестанут воспроизводиться. Новички обычно оценивают набор по средним метрикам и пропускают редкие, но дорогие случаи, а ломают продукт у клиента именно они. Поэтому в контрольный набор добавляйте сложные и спорные примеры, даже если их мало. Когда эксперимент перерастает в проект, выбор источников, проверку юридической чистоты и правила хранения данных можно вынести в формат консалтинга по внедрению ИИ.