Что это такое
Синтетический респондент — языковая модель, которой задают профиль («женщина, 34 года, Шымкент, двое детей, покупает детское питание онлайн») и просят ответить на вопросы анкеты от его лица. Запусков сотни или тысячи, у каждого свой профиль, ответы складываются в таблицу, похожую на результаты опроса.
Цифровой двойник — модель, которую настраивают на данные конкретного реального человека или группы: его интервью, прошлые ответы на опросы, историю покупок. Двойник должен отвечать так, как ответил бы именно этот человек.
Разница важная. Синтетический респондент знает о профиле только то, что было в текстах, на которых училась модель. Двойник знает то, что рассказали реальные люди. Поэтому качество двойника упирается в качество исходного исследования.
Что показали опубликованные исследования
Ниже — работы с открытой методикой, которые чаще всего цитируют в споре о синтетических данных. Все они сделаны не на рынке Казахстана, а в основном на американских данных. Это важно: даже там, где результаты хорошие, они не переносятся автоматически на другую страну и другой язык.
Общая картина: синтетика неплохо угадывает среднее по широкой, хорошо описанной в текстах аудитории на известные темы. Хуже всего — там, где нужен разброс, различия между группами, новые продукты и цены. А лучший результат в таблице получили двойники, за которыми стоят интервью с реальными людьми.
Где синтетика работает
Пилот анкеты. Прогон анкеты через синтетические профили до поля помогает найти непонятные и двусмысленные формулировки, а также варианты ответа, которые не покрывают возможные ситуации. Логику показа так не проверяют: её проверяют прохождением уже запрограммированной анкеты по тестовой ссылке. И это не заменяет пилот на живых людях, но ловит часть ошибок в тексте раньше. О типовых ошибках анкеты — в статье о том, как составить анкету.
Поиск непонятных формулировок. Попросите модель объяснить своими словами, что спрашивает вопрос. Если пересказ расходится с замыслом, формулировку стоит переписать. Это проверка текста, а не мнения аудитории.
Генерация гипотез. Список причин, по которым человек может отказаться от покупки, или вариантов ответа на открытый вопрос. Гипотезы потом проверяются опросом. Как использовать нейросеть на этом этапе и как сверить её ответы с реальными, разобрано в статье о том, можно ли спросить ChatGPT, чего хотят клиенты.
Где синтетика врёт
Три строки стоит пояснить.
Размер рынка. Потенциал спроса считается цепочкой: численность аудитории, умноженная на вероятность покупки, знание о продукте и доступность на полке. Вероятность покупки берётся из ответов людей, и если синтетика ошиблась в ней, ошибка переносится на весь расчёт. Как считается потенциал на реальных данных, разобрано в статье о потенциале спроса.
Узкие аудитории. Владельцы кофеен в Актобе, мамы детей до трёх лет, те, кто делает ремонт прямо сейчас, — каждую такую группу в реальном опросе находят адресно и считают выборку от неё. Синтетический профиль «владелец кофейни» строится из того, что модель читала о владельцах кофеен вообще. Как искать такие группы среди людей — в статье о сложной аудитории.
Казахоязычная аудитория. Авторы бенчмарка KazMMLU (ACL 2025) пишут, что казахский язык и культура недостаточно представлены в обработке естественного языка, а модели заметно отстают в их тестах на казахском и русском от результатов на языках с большим объёмом данных. Синтетический «житель аула в Туркестанской области» будет ещё дальше от реального человека, чем синтетический американец в работах из таблицы. Поэтому для опросов по Казахстану мы рекомендуем казахскую версию анкеты, особенно для общенациональной выборки, регионов и сёл; добавляем её по решению заказчика, и пишут её казахоязычные исследователи, а не переводит словарь или нейросеть. Как меняются ответы, когда у людей есть казахская версия анкеты, — в статье об опросе на казахском.
Чек-лист: что спросить подрядчика, который продаёт синтетические данные
- На чём построены респонденты? Только на общей языковой модели или на данных реальных людей? Если на данных — каких, из какой страны, какого года и сколько человек за ними стоит?
- Есть ли сравнение с реальным опросом в моей категории? Не в «похожем проекте», а в той же категории и стране. Какое было расхождение по долям и по различиям между группами?
- Как вы проверяете разброс, а не только средние? Покажите распределение ответов рядом с реальным.
- Что будет, если немного изменить формулировку запроса? Повторяемы ли результаты через месяц на той же модели?
- Какая погрешность у результата и как она посчитана? Тысяча синтетических ответов — это не выборка в тысячу человек: все ответы из одного источника.
- Как синтетика отвечает за казахоязычную часть аудитории и за регионы? Есть ли проверка на реальных данных по Казахстану?
- Какие задачи вы сами не берёте? Подрядчик, который готов синтетикой оценить цену нового продукта и размер рынка, берёт на себя больше, чем подтверждают открытые проверки.
- Можно ли увидеть сырые ответы и запросы, по которым их получили? Без этого результат нельзя перепроверить.
Эти вопросы можно задать любому подрядчику, включая нас: к классическому опросу применимы те же пункты про происхождение ответов, погрешность и сырые данные. Общие признаки того, что исследование не выдержит проверки, собраны в статье о признаках плохого исследования.
Что это значит для вашего решения
Если решение зависит от доли, цены, размера рынка или различий между группами, его источник — опрос реальных людей из нужной аудитории. Синтетика может сократить подготовку: поймать ошибки в анкете и набросать гипотезы. Но измерение она не заменяет, и открытые проверки это пока подтверждают. Место ИИ на каждом этапе исследования разобрано в опорной статье «Заменит ли ИИ маркетинговые исследования».
Отдельный риск — синтетика, которая попадает в обычный опрос: когда респондент вставляет в открытый ответ текст из нейросети. Поэтому при программировании анкеты вставку скопированного текста в открытые поля стоит запрещать. Как ещё отсечь такие ответы, — в статье об ответах, написанных ИИ. Требования к данным, которые стоит предъявлять любому исследованию, — на странице о качестве данных, а устройство онлайн-опроса — в разделе «Методы».
Источники
- Argyle L. P. et al. Out of One, Many: Using Language Models to Simulate Human Samples // Political Analysis, 2023. Препринт: arxiv.org
- Bisbee J. et al. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models // Political Analysis, 2024. cambridge.org
- Santurkar S. et al. Whose Opinions Do Language Models Reflect? // ICML 2023. proceedings.mlr.press
- Brand J., Israeli A., Ngwe D. Using LLMs for Market Research // Harvard Business School Working Paper 23-062, 2023. papers.ssrn.com
- Park J. S. et al. Generative Agent Simulations of 1,000 People, 2024. arxiv.org
- Togmanov M. et al. KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of Kazakhstan // ACL 2025. aclanthology.org
По теме
Обсудим ваше исследование. Расскажите, какое решение нужно принять, — предложим метод, выборку и сроки.