Блог

ИИ в кодировке открытых ответов: быстрее, но кто проверяет

ИИ в исследованиях
ИИ в кодировке открытых ответов: быстрее, но кто проверяет

Что такое кодификатор и зачем он нужен

Кодификатор — это список кодов с правилами: какие ответы относятся к коду, какие нет и что делать с пограничными случаями. Без него открытый вопрос остаётся тысячей строк текста, из которой нельзя получить ни одной доли. С ним — таблица, где видно, какая доля опрошенных назвала вашу марку первой и какая жалуется на очереди.
Главное свойство хорошего кодификатора — проверяемость. Рядом с итоговой частотой каждого кода должно быть видно, из каких исходных формулировок он собран и с какой частотой каждая. Иначе схлопывание непроверяемо, и в одну группу незаметно уезжают разные по смыслу ответы.

Два разных вида кодировки

Спонтанное знание брендов и мнения кодируются по-разному, и от этого зависит, насколько можно доверять нейросети.
Спонтанное знание брендов
Мнения, причины, пожелания
Пример вопроса
«Какие банки вы знаете?»
«Почему вы перестали пользоваться сервисом?»
Откуда коды
Справочный список брендов из анкеты
Собираются по фактическим ответам
Главная сложность
Опечатки, латиница и кириллица, казахские и русские варианты названия
Один ответ несёт две мысли, похожие слова значат разное
Правила
Первый названный бренд кодируется отдельно как top-of-mind; остальные — множественным ответом, сумма может быть больше 100%
Одна реплика может получить два кода; группы нельзя придумывать заранее
Служебные коды
«Другой бренд» и «Не знаю» — разные категории, описательный ответ («банк возле дома») идёт в «Не знаю»
«Не знаю» — служебный код, но «всего хватает» в вопросе о нехватке — содержательный и часто самый массовый
Спонтанное знание — первая ступень воронки бренда, и ошибка кодировки здесь бьёт по всем следующим шагам: неверно закодированный бренд теряет знание, а с ним и конверсии. В Brand Health Tracking, где волны сравниваются год к году, ошибка ещё и маскируется под динамику: разница в кодировании выглядит как рост или падение знания.

Где ИИ действительно помогает

Первичная группировка. Механическая нормализация — нижний регистр, «ё» на «е», лишние пробелы и знаки — схлопывает очень мало похожих ответов: формулировки «всего хватает», «всё есть», «меня всё устраивает» остаются разными строками. Нейросеть быстро предлагает смысловые группы, и с этим черновиком человеку работать быстрее, чем с сырым списком.
Сверка написаний брендов. Одна марка в открытых ответах приходит в пяти-десяти вариантах: с опечаткой, латиницей, кириллицей, по-казахски, по-русски, сокращением. Нейросеть может предложить сопоставление вариантов со справочным списком, но только если список ей дан, а не придуман ею самой, — и каждое такое сопоставление всё равно проверяется выборочно.
Разбор «прочего». В категорию «Другой бренд» почти всегда попадают бренды из основного списка, вписанные с ошибкой, и ответы «не помню». Нейросеть быстро размечает кандидатов на перенос, человек подтверждает.
Есть и внешние данные о том, что на чистой задаче модели работают близко к людям. В исследовании на данных British Election Study ответы на открытый вопрос о главной проблеме страны раскладывали по 50 категориям: лучшая из шести языковых моделей совпала с эталонной кодировкой в 93,9% случаев, человек — в 94,7%. На новом тексте, не похожем на обучающие примеры, разрыв вырос: 80,9% у модели против 88,6% у человека. Это английский язык и одна тема, на казахский и русский результат напрямую не переносится, — но направление понятное: чем необычнее ответы, тем важнее человеческая проверка.

Где ИИ рискует

Склейка разных смыслов. «Дорого» и «не стоит своих денег» нейросеть охотно сводит в один код «цена». Для решения это разные вещи: первое — про уровень цены, второе — про ценность, и лечатся они по-разному.
Выдуманные категории. Модель, которой не дали список кодов, иногда формулирует аккуратные категории, под которые реальных ответов почти нет. Правило то же, что и без ИИ: группы собираются по фактическому частотному списку, а не заранее.
«Среднее» вместо редкого. Модель может свести редкий ответ к типичному. Ответ, который встретился три раза, но описывает серьёзный провал — потерянные деньги, отказ в обслуживании, — легко растворяется в общей группе. Именно такие ответы потом оказываются самыми полезными для решения.
Потеря казахских формулировок. Ответ на казахском, смешанный ответ или название марки в казахском написании модель может отнести в «не знаю» или «прочее». Так из данных тихо выпадает часть страны, и не случайная: чаще это регионы и старшие группы. Та же логика, что и с анкетой, переведённой нейросетью: язык ответа — не шум, который можно отбросить. Поэтому казахоязычные и смешанные ответы у нас проверяют казахоязычные исследователи, а не только сверка с машинным кодом.
Чужой текст в ответах. Если поле открытого вопроса принимает вставку, в него попадает скопированный текст — из нейросетей, из отзывов, из соседнего вопроса. Кодировать такие ответы бессмысленно: это уже не голос респондента. Поэтому при программировании анкеты в открытых полях запрещают вставку скопированного текста. Как ещё отсеять такие ответы до кодировки, разобрано в статье об ответах, написанных ИИ, в онлайн-опросах.

Правила проверки, которые стоит требовать

  1. Кодификатор утверждает человек. Нейросеть может предложить черновик, но список кодов, их названия и правила пограничных случаев фиксирует аналитик, который знает задачу. Для брендов — справочный список из анкеты, а не список, который модель «знает сама».
  2. Выборочная ручная перепроверка. Случайная выборка ответов кодируется человеком независимо, без подсказки машинного кода, и сравнивается с результатом.
  3. Доля расхождений считается и имеет порог. Расхождение — ответ, у которого хотя бы один код не совпал. Доля расхождений = расхождения / проверенные ответы. Порог договаривается до кодировки.
  4. Каждое расхождение разбирается. Не «исправили и забыли», а «почему модель ошиблась»: если причина системная, правило меняется и перекодируется весь массив, а не только проверенная выборка.
  5. «Прочее» не больше заданной доли. Если в «прочем» больше оговорённой доли ответов, значит, кодификатор не описывает данные и нужен ещё один проход.
  6. Прозрачность групп. В отчёте рядом с каждым кодом — исходные формулировки и их частоты. В дашборде это работает так же: код раскрывается до формулировок, из которых он собран.

Условный пример: 1 200 ответов о знании банков

Условный пример. Вопрос «Какие банки вы знаете, хотя бы по названию?», 1 200 респондентов. Черновую кодировку по справочному списку из анкеты сделала нейросеть. Порог расхождений договорён заранее — не больше 5%, «прочее» — не больше 3% респондентов.
Первая проверка. Аналитик независимо кодирует 200 случайных ответов. Расхождений — 18, это 18 / 200 = 9%. На выборке из 200 ответов это примерно от 5,8% до 13,8% (интервал Уилсона, 95%): даже нижняя граница выше порога, то есть порог превышен уверенно. Разбор расхождений:
Причина расхождения
Ответов
Два бренда с похожими названиями склеены в один код
8
Ответ на казахском с названием банка ушёл в «Не знаю»
6
Описательный ответ («банк, где зарплатная карта») закодирован как бренд
4
Всего
18
Все три причины системные, поэтому правила уточняются и перекодируется весь массив. Вторая проверка на новых 200 случайных ответах даёт 3 расхождения — 3 / 200 = 1,5%, интервал примерно от 0,5% до 4,3%: ниже порога вся оценка, включая верхнюю границу.
Разбор «прочего». После первого прохода в «Другой бренд» попали 102 ответа — 8,5% респондентов, выше договорённых 3%. Ручной разбор:
Что оказалось в «прочем»
Ответов
Бренды из основного списка, написанные с ошибкой или латиницей
39
Новый банк, названный достаточно часто для отдельного кода
21
«Не помню» и описательные ответы
12
Остались действительно прочими
30
Всего
102
После разбора в «прочем» 30 ответов — 30 / 1 200 = 2,5%, в пределах порога. Новый банк стоит обсудить с заказчиком как кандидата в закрытый список следующей волны.
Проверка заняла часы, а не дни. Без неё отчёт показал бы заниженное знание двух брендов, лишний бренд и «пропавшую» казахоязычную аудиторию.

Что это значит для вашего решения

Вопрос «кодируете ли вы открытые ответы нейросетью» мало что даёт: ответ «да» не плохой, а «нет» не гарантия качества. Полезнее спросить у любого подрядчика, включая нас, пять вещей: кто утверждает кодификатор; сколько ответов перепроверяется вручную и как считается доля расхождений; какой порог и что происходит, если он превышен; какая доля ушла в «прочее»; как кодируются казахоязычные ответы. Если на эти вопросы есть цифры — кодировке можно доверять, чем бы она ни была сделана.
Общая логика кластера та же, что в опорной статье «Заменит ли ИИ маркетинговые исследования»: нейросеть ускоряет работу с текстом, но не заменяет ни источник данных, ни ответственность за вывод. Остальные методы, где открытые вопросы — часть анкеты, собраны в разделе «Методы».

Источники

  • Mellon J., Bailey J., Scott R. и др. Do AIs know what the most important issue is? Using language models to code open-text social survey responses at scale // Research & Politics, 2024. journals.sagepub.com

По теме

Обсудим ваше исследование. Расскажите, какое решение нужно принять, — предложим метод, выборку и сроки.