01 Простыми словами
Синтетические данные — это вымышленные примеры, которые генератор или симулятор создаёт с нуля вместо того, чтобы брать их из реальной практики компании. Так получают примеры для сценариев, которые в реальной практике компании случаются редко или закрыты для доступа по соображениям конфиденциальности, — вместо того чтобы ждать, пока наберётся достаточно настоящих случаев. Синтетические данные для модели работают именно так: заменяют редкие или закрытые реальные случаи статистически похожими искусственными примерами.
02 Как это работает
Синтетические данные обычно готовят одним из нескольких способов.
- Генеративная модель создаёт новые примеры на основе статистических свойств небольшого реального набора — похожие статистически, при этом отличающиеся от каждого исходного примера буквально.
- Симулятор создаёт данные по заданным физическим или бизнес-правилам — например, рисует изображение детали с заданным типом дефекта в заданном месте.
- Полученный набор проверяют через evals на то, насколько он статистически похож на реальные данные, прежде чем использовать его для обучения или теста.
Отдельно от синтетики стоит аугментация — она видоизменяет существующий реальный пример (поворот изображения, замена имён и сумм в тексте, шум в аудиозаписи) вместо создания нового случая с нуля. После аугментации исходный реальный случай остаётся узнаваем в изменённом виде, тогда как удачная синтетика создаёт случай, отсутствовавший в реальности вовсе.
Для генерации изображений дефектов подходят модели вроде Stable Diffusion или Kandinsky, обученные рисовать заданный класс объектов с нужными искажениями; для табличных и текстовых данных чаще берут языковую модель вроде GigaChat, которая по описанию правила генерирует правдоподобные строки счетов или диалогов. Выбор способа зависит от типа данных: для изображений обычно берут генеративную модель, для структурированных таблиц — симулятор по бизнес-правилам, а для текста — оба подхода комбинируют.
03 Где применяется
- Производство. Изображения редких видов брака генерируют искусственно, когда реальных фотографий дефекта накопилось слишком мало для обучения модели.
- Медицина. Синтетические истории болезни используют для теста модели без риска раскрыть настоящие данные пациентов.
- Банки и страхование. Синтетические транзакции и заявления имитируют редкие случаи мошенничества, которых в реальных данных почти нет.
- Служба поддержки. Смоделированные диалоги клиентов используют для теста нового промпта бота до его подключения к настоящей переписке.
- Разработка ПО. Синтетические логи ошибок используют для теста модели диагностики сбоев без доступа к реальной инфраструктуре клиента.
- Образование. Синтетические примеры решений задач используют для теста модели проверки домашних работ до подключения к настоящим тетрадям учеников.
04 Четыре недели внедрения
Неделя первая. Производственная линия запускает генератор синтетических изображений дефектов — реальных фотографий редкого брака накопилось слишком мало, чтобы обучить на них модель контроля качества. Генератор настраивают на нескольких типах трещин и сколов, первую партию картинок проверяют глазами технолога.
Неделя вторая. Модель, обученную на синтетике вперемешку с имеющимися реальными снимками, подключают на двух участках линии из трёх. Точность на обоих участках держится стабильно высокой с первого дня.
Неделя третья. Модель подключают на третьем участке — и там точность заметно проседает именно на одном виде скола. Разбор показывает причину: конкретная лампа освещения на этом участке даёт блик, маскирующий трещину, а генератор синтетики этот блик пропустил ещё на этапе настройки, обучаясь на слишком ровном освещении остальных участков.
Неделя четвёртая. Синтетический набор пересобирают с добавлением бликов от этой лампы, модель дообучают заново — точность на третьем участке сравнивается с двумя другими. Заодно закрепляют правило для будущих проектов: любой генератор синтетики проверять сразу на всех реальных условиях участка вместо усреднённой картинки по всей линии.
05 Ограничения
- Синтетика хороша ровно настолько, насколько точно она воспроизводит редкие реальные условия, — упущенная деталь вроде освещения или ракурса переносится в слепое пятно модели, поэтому итоговый датасет лучше в любом случае перепроверить на реальных примерах.
- Слишком «чистые» синтетические примеры без реального шума и вариативности дают модели ложную уверенность, которая на реальных данных нередко рассыпается при первой же проверке.
- Смешивать синтетику и реальные данные стоит в контролируемой пропорции — избыток искусственных примеров способен сместить модель в сторону шаблонов генератора.
- Юридический статус синтетических данных о людях иногда остаётся спорным — стоит заранее проверить генератор на предмет случайного воспроизведения узнаваемых черт конкретного реального человека.
- Обучение модели преимущественно на данных, сгенерированных другой моделью, без регулярной подпитки реальными примерами, рискует накопить деградацию качества с каждым новым поколением — это явление называют коллапсом модели (model collapse).
Как ИИ помогает с анализом дефектов на производстве на практике — в статье про анализ дефектов на производстве. Как выстроить такой проект под задачи компании — в разделе про ИИ-консалтинг.