Блог

Синтетические респонденты и цифровые двойники: где работают и где врут

ИИ в исследованиях
Синтетические респонденты и цифровые двойники: где работают и где врут

Что это такое

Синтетический респондент — языковая модель, которой задают профиль («женщина, 34 года, Шымкент, двое детей, покупает детское питание онлайн») и просят ответить на вопросы анкеты от его лица. Запусков сотни или тысячи, у каждого свой профиль, ответы складываются в таблицу, похожую на результаты опроса.
Цифровой двойник — модель, которую настраивают на данные конкретного реального человека или группы: его интервью, прошлые ответы на опросы, историю покупок. Двойник должен отвечать так, как ответил бы именно этот человек.
Разница важная. Синтетический респондент знает о профиле только то, что было в текстах, на которых училась модель. Двойник знает то, что рассказали реальные люди. Поэтому качество двойника упирается в качество исходного исследования.

Что показали опубликованные исследования

Ниже — работы с открытой методикой, которые чаще всего цитируют в споре о синтетических данных. Все они сделаны не на рынке Казахстана, а в основном на американских данных. Это важно: даже там, где результаты хорошие, они не переносятся автоматически на другую страну и другой язык.
Работа
Что проверяли
Что нашли
Argyle и соавторы, Political Analysis, 2023
Может ли модель воспроизводить ответы групп американского электората
Авторы описали «алгоритмическую верность»: при правильной настройке модель воспроизводит распределения ответов многих групп
Bisbee и соавторы, Political Analysis, 2024
Оценки социальных групп по шкале отношения от лица «персон» против реального электорального опроса
Средние близки к реальным, но разброс ответов меньше, связи между переменными часто отличаются, результат меняется от небольших правок запроса и от времени: тот же запрос через три месяца дал другие результаты
Santurkar и соавторы, ICML 2023
Совпадают ли мнения моделей с мнениями демографических групп США
Значительные расхождения, которые сохраняются, даже когда модели прямо указывают, от лица какой группы отвечать
Brand, Israeli, Ngwe, Harvard Business School, 2023
Готовность платить за товары и характеристики по ответам модели
Оценки иногда сопоставимы с исследованиями на людях, но часто неточны, а в некоторых случаях имеют обратный знак. Дообучение на прошлых опросах улучшает результат в той же категории, но не для новых категорий и не для различий между сегментами. Авторы называют модели дополнением к исследованиям на людях, а не заменой
Park и соавторы, 2024
Двойники более чем тысячи реальных людей, построенные по их подробным качественным интервью
Двойники воспроизводили ответы участников на вопросы General Social Survey на 85% так же точно, как сами участники повторяли свои ответы через две недели
Общая картина: синтетика неплохо угадывает среднее по широкой, хорошо описанной в текстах аудитории на известные темы. Хуже всего — там, где нужен разброс, различия между группами, новые продукты и цены. А лучший результат в таблице получили двойники, за которыми стоят интервью с реальными людьми.

Где синтетика работает

Пилот анкеты. Прогон анкеты через синтетические профили до поля помогает найти непонятные и двусмысленные формулировки, а также варианты ответа, которые не покрывают возможные ситуации. Логику показа так не проверяют: её проверяют прохождением уже запрограммированной анкеты по тестовой ссылке. И это не заменяет пилот на живых людях, но ловит часть ошибок в тексте раньше. О типовых ошибках анкеты — в статье о том, как составить анкету.
Поиск непонятных формулировок. Попросите модель объяснить своими словами, что спрашивает вопрос. Если пересказ расходится с замыслом, формулировку стоит переписать. Это проверка текста, а не мнения аудитории.
Генерация гипотез. Список причин, по которым человек может отказаться от покупки, или вариантов ответа на открытый вопрос. Гипотезы потом проверяются опросом. Как использовать нейросеть на этом этапе и как сверить её ответы с реальными, разобрано в статье о том, можно ли спросить ChatGPT, чего хотят клиенты.

Где синтетика врёт

Задача
Годится ли синтетика
Почему
Доля знающих марку, доля покупателей
Нет
Нужна доля с базой и погрешностью; у синтетики меньше разброс, и результат зависит от запроса
Цена и готовность платить
Нет
В проверке на ценах оценки бывали неточными и даже с обратным знаком
Размер рынка, потенциал спроса
Нет
Считается от реальных долей и частоты покупки, а ошибка в доле умножается на всё население
Новые продукты и категории
Нет
Реакции на то, чего ещё нет, в обучающих текстах нет; дообучение не помогло для новых категорий
Редкие и узкие аудитории
Нет
О группе, которой мало в интернете, модель знает мало, а уверенности в ответе от этого не меньше
Различия между регионами и сегментами
Нет
Различия между группами синтетика воспроизводит хуже, чем средние
Казахоязычная аудитория
Нет
Казахский язык и локальный контекст недостаточно представлены в данных для моделей
Пилот анкеты, поиск непонятных вопросов
Да
Проверяется текст анкеты, а не мнение людей
Гипотезы для анкеты
Да, как черновик
Результат потом проверяется на людях
Три строки стоит пояснить.
Размер рынка. Потенциал спроса считается цепочкой: численность аудитории, умноженная на вероятность покупки, знание о продукте и доступность на полке. Вероятность покупки берётся из ответов людей, и если синтетика ошиблась в ней, ошибка переносится на весь расчёт. Как считается потенциал на реальных данных, разобрано в статье о потенциале спроса.
Узкие аудитории. Владельцы кофеен в Актобе, мамы детей до трёх лет, те, кто делает ремонт прямо сейчас, — каждую такую группу в реальном опросе находят адресно и считают выборку от неё. Синтетический профиль «владелец кофейни» строится из того, что модель читала о владельцах кофеен вообще. Как искать такие группы среди людей — в статье о сложной аудитории.
Казахоязычная аудитория. Авторы бенчмарка KazMMLU (ACL 2025) пишут, что казахский язык и культура недостаточно представлены в обработке естественного языка, а модели заметно отстают в их тестах на казахском и русском от результатов на языках с большим объёмом данных. Синтетический «житель аула в Туркестанской области» будет ещё дальше от реального человека, чем синтетический американец в работах из таблицы. Поэтому для опросов по Казахстану мы рекомендуем казахскую версию анкеты, особенно для общенациональной выборки, регионов и сёл; добавляем её по решению заказчика, и пишут её казахоязычные исследователи, а не переводит словарь или нейросеть. Как меняются ответы, когда у людей есть казахская версия анкеты, — в статье об опросе на казахском.

Чек-лист: что спросить подрядчика, который продаёт синтетические данные

  1. На чём построены респонденты? Только на общей языковой модели или на данных реальных людей? Если на данных — каких, из какой страны, какого года и сколько человек за ними стоит?
  2. Есть ли сравнение с реальным опросом в моей категории? Не в «похожем проекте», а в той же категории и стране. Какое было расхождение по долям и по различиям между группами?
  3. Как вы проверяете разброс, а не только средние? Покажите распределение ответов рядом с реальным.
  4. Что будет, если немного изменить формулировку запроса? Повторяемы ли результаты через месяц на той же модели?
  5. Какая погрешность у результата и как она посчитана? Тысяча синтетических ответов — это не выборка в тысячу человек: все ответы из одного источника.
  6. Как синтетика отвечает за казахоязычную часть аудитории и за регионы? Есть ли проверка на реальных данных по Казахстану?
  7. Какие задачи вы сами не берёте? Подрядчик, который готов синтетикой оценить цену нового продукта и размер рынка, берёт на себя больше, чем подтверждают открытые проверки.
  8. Можно ли увидеть сырые ответы и запросы, по которым их получили? Без этого результат нельзя перепроверить.
Эти вопросы можно задать любому подрядчику, включая нас: к классическому опросу применимы те же пункты про происхождение ответов, погрешность и сырые данные. Общие признаки того, что исследование не выдержит проверки, собраны в статье о признаках плохого исследования.

Что это значит для вашего решения

Если решение зависит от доли, цены, размера рынка или различий между группами, его источник — опрос реальных людей из нужной аудитории. Синтетика может сократить подготовку: поймать ошибки в анкете и набросать гипотезы. Но измерение она не заменяет, и открытые проверки это пока подтверждают. Место ИИ на каждом этапе исследования разобрано в опорной статье «Заменит ли ИИ маркетинговые исследования».
Отдельный риск — синтетика, которая попадает в обычный опрос: когда респондент вставляет в открытый ответ текст из нейросети. Поэтому при программировании анкеты вставку скопированного текста в открытые поля стоит запрещать. Как ещё отсечь такие ответы, — в статье об ответах, написанных ИИ. Требования к данным, которые стоит предъявлять любому исследованию, — на странице о качестве данных, а устройство онлайн-опроса — в разделе «Методы».

Источники

  • Argyle L. P. et al. Out of One, Many: Using Language Models to Simulate Human Samples // Political Analysis, 2023. Препринт: arxiv.org
  • Bisbee J. et al. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models // Political Analysis, 2024. cambridge.org
  • Santurkar S. et al. Whose Opinions Do Language Models Reflect? // ICML 2023. proceedings.mlr.press
  • Brand J., Israeli A., Ngwe D. Using LLMs for Market Research // Harvard Business School Working Paper 23-062, 2023. papers.ssrn.com
  • Park J. S. et al. Generative Agent Simulations of 1,000 People, 2024. arxiv.org
  • Togmanov M. et al. KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of Kazakhstan // ACL 2025. aclanthology.org

По теме

Обсудим ваше исследование. Расскажите, какое решение нужно принять, — предложим метод, выборку и сроки.