Блог

Можно ли спросить ChatGPT, чего хотят клиенты

ИИ в исследованиях
Можно ли спросить ChatGPT, чего хотят клиенты

Для чего это годится

У нейросети есть сильная сторона: она быстро выдаёт много правдоподобных вариантов. В начале проекта это ценно.
Гипотезы. «Какие причины могут быть у человека, который перестал заказывать доставку еды?» Модель назовёт десяток причин за минуту. Часть вы бы и так назвали, часть — нет. Этот список — материал для анкеты, а не ответ.
Черновик гайда интервью. Модель может предложить структуру разговора и вопросы, которые не подталкивают к ответу. Черновик потом правит тот, кто будет вести интервью. Как устроен сам метод, разобрано на странице глубинных интервью.
Список вопросов к анкете. Модель поможет не забыть очевидное: варианты ответа «другое», вопрос о частоте покупки, вопрос о том, где покупают. Но анкета собирается под решение, и выбирать, какие вопросы остаются, придётся вам. Типовые ошибки — в статье о том, как составить анкету.
«Адвокат дьявола». Полезный ход: попросить модель найти слабые места в вашей гипотезе. «Мы уверены, что покупатели уходят из-за цены. Какие ещё объяснения совместимы с падением повторных покупок?» Такой запрос помогает частично снизить угодливость модели.

Почему ответ модели — не данные

1. Усреднение

Модель выдаёт самый вероятный ответ, а исследованию нужны распределения и различия. В работе Bisbee и соавторов модель отвечала на вопросы американского опроса от лица разных людей: средние получились близкими к реальным, но ответы разбросаны меньше, чем у настоящих респондентов, а связи между переменными отличались. Для вас это значит: модель может правильно угадать «в среднем», но пропустить группу, ради которой вы запускаете продукт.

2. Угодливость

Модели склонны соглашаться с тем, кто задаёт вопрос. Исследование Sharma и соавторов показало, что пять популярных ИИ-ассистентов систематически подстраивали ответы под взгляды пользователя. Спросите «правда ли, что клиенты хотят экологичную упаковку» — и получите аргументированное «да». Поэтому формулировка вопроса к модели — уже половина её ответа: в упомянутой выше работе Bisbee и соавторов распределение ответов менялось от небольших правок запроса.

3. Выдуманная уверенность

Модель редко говорит «не знаю» и редко называет погрешность: Kalai и соавторы показывают, что обучение и оценка моделей поощряют уверенную догадку, а не признание неуверенности. Фраза «около 60% покупателей обращают внимание на состав» звучит как результат исследования, но за ней нет выборки, даты и базы. Если в ответе есть процент, спросите себя: кого и когда опросили? Ответа не будет. О том, как модели придумывают статистику и источники, — в статье о кабинетном исследовании с нейросетью.

4. Нет вашей аудитории и контекста Казахстана

Модель не знает, что стоит на полке рядом с вашим товаром, какие у вас цены и кто ваш покупатель. Она знает тех, кто много пишет в интернете. Исследование Santurkar и соавторов нашло значительные расхождения между мнениями моделей и разных групп населения США, и они сохранялись, даже когда модели прямо указывали, от чьего лица отвечать. Для Казахстана это ограничение, скорее всего, сильнее: авторы бенчмарка KazMMLU пишут, что казахский язык и культура недостаточно представлены в обработке естественного языка, а модели заметно слабее справляются с их тестами на казахском и русском. Насколько модель ошибается именно в вашей категории, надо проверять, а не предполагать. Почему казахоязычная аудитория отвечает иначе, чем русскоязычная, — в статье об опросе на казахском.
Есть и более простая проблема: часто компании нужны не «клиенты вообще», а узкая группа — те, кто сейчас выбирает школу для ребёнка, или владельцы кофеен. Как описывать и находить таких людей, разобрано в статье о сложной аудитории. Модель о такой группе знает ещё меньше.

Как проверить самому: сравнить ответ модели с опросом

Самый честный способ понять, насколько нейросеть знает ваших клиентов, — задать ей те же вопросы, что и людям, и сравнить. Проверка стоит почти ничего, если опрос вы и так проводите.
  1. Возьмите 5–10 закрытых вопросов из согласованной анкеты. Лучше те, от которых зависит решение: главный фактор выбора, частота покупки, готовность платить, знание марок.
  2. Опишите модели аудиторию так же, как в отборе респондентов. Не «жители Казахстана», а «жители Алматы 25–45 лет, заказывавшие доставку готовой еды за последний месяц».
  3. Задайте вопрос много раз в новых диалогах. Один ответ модели — один «респондент». Запустите вопрос 30–50 раз и посчитайте, как распределились ответы. Отдельно можно попросить модель сразу назвать ожидаемое распределение — это второй вариант прогноза.
  4. Запишите ответы модели до поля. Иначе, увидев реальные цифры, легко решить, что модель «в целом угадала».
  5. Проведите опрос и сравните. Смотрите на три вещи: совпадает ли порядок ответов, больше ли расхождение, чем погрешность опроса, и нет ли групп, где модель ошиблась сильнее.
  6. Сделайте вывод только для этой категории и этого момента. Совпадение в одной теме не значит, что модель знает ваших клиентов в другой.

Условный пример

Условный пример. Сервис доставки готовой еды в Алматы решает, во что вложить бюджет: в скидки или в качество кухни. Главный вопрос анкеты: «Что для вас главное при выборе сервиса доставки?» — один ответ. Модели задали этот вопрос 40 раз в новых диалогах с описанием аудитории. Опрос прошли 600 человек из той же аудитории.
Главный фактор выбора
Модель, ответов из 40
Модель, %
Опрос, человек из 600
Опрос, %
Разница, п. п.
Цена
16
40
168
28
−12
Скорость доставки
10
25
132
22
−3
Вкус и качество блюд
8
20
204
34
+14
Ассортимент
2
5
60
10
+5
Отзывы и рейтинг
4
10
36
6
−4
Итого
40
100
600
100
—
Как читать. Погрешность опроса для доли 34% на 600 ответах — примерно ±3,8 п. п. (1,96 × √(0,34 × 0,66 / 600)), для доли 28% — примерно ±3,6 п. п. Расхождения по цене и по вкусу в три-четыре раза больше, то есть это не случайность. Модель поставила на первое место цену — ответ, который звучит правдоподобно почти для любой категории. Реальная аудитория поставила на первое место вкус. Решение «вкладываться в скидки», принятое по ответу модели, было бы ошибкой для этой аудитории. По скорости доставки модель попала в пределы погрешности, но это не делает её прогноз надёжным в целом.
Заметьте ещё одно: 40 ответов модели — это не 40 разных людей. Это 40 раз один и тот же источник, поэтому погрешность «как у выборки 40» к ним неприменима. Их можно сравнивать с опросом, но нельзя считать маленьким опросом.
Если хотите пойти дальше, разнесите результаты опроса по группам — город и село, русскоязычная и казахоязычная анкета, возраст. Если результаты опроса лежат в дашборде, эти разрезы открываются в нём без отдельного запроса. В работе Santurkar и соавторов мнения моделей расходились с мнениями разных групп населения неодинаково — с одними заметно сильнее, чем с другими, — и расхождение сохранялось, даже когда модели прямо указывали, от чьего лица отвечать. Поэтому ошибку модели стоит смотреть по группам, а не только в среднем. О том, почему нейросеть вообще не заменяет опрос и где её место в каждом этапе исследования, — в разборе заменит ли ИИ маркетинговые исследования. А про сервисы, которые продают такие ответы как «синтетических респондентов», — в статье о синтетических респондентах.

Что это значит для вашего решения

Если нужно понять, какие вопросы вообще задавать, нейросеть сэкономит день работы. Если нужно понять, что ответят ваши клиенты, её ответ стоит записать как прогноз и проверить на людях. Если бюджета на большой опрос нет, лучше сузить вопрос до одного решения и опросить нужную аудиторию, чем заменить опрос ответом модели: прогноз без проверки не становится дешевле, он просто откладывает цену ошибки до запуска. Для этого подходит онлайн-опрос по той аудитории, которая принимает решение о покупке: не «все жители», а те, кто описан поведением. Описать такую аудиторию на данных помогает статья о целевой аудитории.
И ещё одна практическая деталь. Если вы проводите опрос, в открытых вопросах лучше запретить вставку скопированного текста. Иначе часть ответов о том, «чего хотят клиенты», окажется текстом той же нейросети, только вставленным респондентом. Больше о методах, которые дают данные от людей, — в разделе «Методы».

Источники

  • Bisbee J. et al. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models // Political Analysis, 2024. cambridge.org
  • Sharma M. et al. Towards Understanding Sycophancy in Language Models // ICLR 2024. arxiv.org
  • Santurkar S. et al. Whose Opinions Do Language Models Reflect? // ICML 2023. proceedings.mlr.press
  • Kalai A. T., Nachum O., Vempala S. S., Zhang E. Why Language Models Hallucinate // arXiv, 2025. arxiv.org
  • Togmanov M. et al. KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of Kazakhstan // ACL 2025. aclanthology.org

По теме

Обсудим ваше исследование. Расскажите, какое решение нужно принять, — предложим метод, выборку и сроки.