Что такое кодификатор и зачем он нужен
Кодификатор — это список кодов с правилами: какие ответы относятся к коду, какие нет и что делать с пограничными случаями. Без него открытый вопрос остаётся тысячей строк текста, из которой нельзя получить ни одной доли. С ним — таблица, где видно, какая доля опрошенных назвала вашу марку первой и какая жалуется на очереди.
Главное свойство хорошего кодификатора — проверяемость. Рядом с итоговой частотой каждого кода должно быть видно, из каких исходных формулировок он собран и с какой частотой каждая. Иначе схлопывание непроверяемо, и в одну группу незаметно уезжают разные по смыслу ответы.
Два разных вида кодировки
Спонтанное знание брендов и мнения кодируются по-разному, и от этого зависит, насколько можно доверять нейросети.
Спонтанное знание — первая ступень воронки бренда, и ошибка кодировки здесь бьёт по всем следующим шагам: неверно закодированный бренд теряет знание, а с ним и конверсии. В Brand Health Tracking, где волны сравниваются год к году, ошибка ещё и маскируется под динамику: разница в кодировании выглядит как рост или падение знания.
Где ИИ действительно помогает
Первичная группировка. Механическая нормализация — нижний регистр, «ё» на «е», лишние пробелы и знаки — схлопывает очень мало похожих ответов: формулировки «всего хватает», «всё есть», «меня всё устраивает» остаются разными строками. Нейросеть быстро предлагает смысловые группы, и с этим черновиком человеку работать быстрее, чем с сырым списком.
Сверка написаний брендов. Одна марка в открытых ответах приходит в пяти-десяти вариантах: с опечаткой, латиницей, кириллицей, по-казахски, по-русски, сокращением. Нейросеть может предложить сопоставление вариантов со справочным списком, но только если список ей дан, а не придуман ею самой, — и каждое такое сопоставление всё равно проверяется выборочно.
Разбор «прочего». В категорию «Другой бренд» почти всегда попадают бренды из основного списка, вписанные с ошибкой, и ответы «не помню». Нейросеть быстро размечает кандидатов на перенос, человек подтверждает.
Есть и внешние данные о том, что на чистой задаче модели работают близко к людям. В исследовании на данных British Election Study ответы на открытый вопрос о главной проблеме страны раскладывали по 50 категориям: лучшая из шести языковых моделей совпала с эталонной кодировкой в 93,9% случаев, человек — в 94,7%. На новом тексте, не похожем на обучающие примеры, разрыв вырос: 80,9% у модели против 88,6% у человека. Это английский язык и одна тема, на казахский и русский результат напрямую не переносится, — но направление понятное: чем необычнее ответы, тем важнее человеческая проверка.
Где ИИ рискует
Склейка разных смыслов. «Дорого» и «не стоит своих денег» нейросеть охотно сводит в один код «цена». Для решения это разные вещи: первое — про уровень цены, второе — про ценность, и лечатся они по-разному.
Выдуманные категории. Модель, которой не дали список кодов, иногда формулирует аккуратные категории, под которые реальных ответов почти нет. Правило то же, что и без ИИ: группы собираются по фактическому частотному списку, а не заранее.
«Среднее» вместо редкого. Модель может свести редкий ответ к типичному. Ответ, который встретился три раза, но описывает серьёзный провал — потерянные деньги, отказ в обслуживании, — легко растворяется в общей группе. Именно такие ответы потом оказываются самыми полезными для решения.
Потеря казахских формулировок. Ответ на казахском, смешанный ответ или название марки в казахском написании модель может отнести в «не знаю» или «прочее». Так из данных тихо выпадает часть страны, и не случайная: чаще это регионы и старшие группы. Та же логика, что и с анкетой, переведённой нейросетью: язык ответа — не шум, который можно отбросить. Поэтому казахоязычные и смешанные ответы у нас проверяют казахоязычные исследователи, а не только сверка с машинным кодом.
Чужой текст в ответах. Если поле открытого вопроса принимает вставку, в него попадает скопированный текст — из нейросетей, из отзывов, из соседнего вопроса. Кодировать такие ответы бессмысленно: это уже не голос респондента. Поэтому при программировании анкеты в открытых полях запрещают вставку скопированного текста. Как ещё отсеять такие ответы до кодировки, разобрано в статье об ответах, написанных ИИ, в онлайн-опросах.
Правила проверки, которые стоит требовать
- Кодификатор утверждает человек. Нейросеть может предложить черновик, но список кодов, их названия и правила пограничных случаев фиксирует аналитик, который знает задачу. Для брендов — справочный список из анкеты, а не список, который модель «знает сама».
- Выборочная ручная перепроверка. Случайная выборка ответов кодируется человеком независимо, без подсказки машинного кода, и сравнивается с результатом.
- Доля расхождений считается и имеет порог. Расхождение — ответ, у которого хотя бы один код не совпал. Доля расхождений = расхождения / проверенные ответы. Порог договаривается до кодировки.
- Каждое расхождение разбирается. Не «исправили и забыли», а «почему модель ошиблась»: если причина системная, правило меняется и перекодируется весь массив, а не только проверенная выборка.
- «Прочее» не больше заданной доли. Если в «прочем» больше оговорённой доли ответов, значит, кодификатор не описывает данные и нужен ещё один проход.
- Прозрачность групп. В отчёте рядом с каждым кодом — исходные формулировки и их частоты. В дашборде это работает так же: код раскрывается до формулировок, из которых он собран.
Условный пример: 1 200 ответов о знании банков
Условный пример. Вопрос «Какие банки вы знаете, хотя бы по названию?», 1 200 респондентов. Черновую кодировку по справочному списку из анкеты сделала нейросеть. Порог расхождений договорён заранее — не больше 5%, «прочее» — не больше 3% респондентов.
Первая проверка. Аналитик независимо кодирует 200 случайных ответов. Расхождений — 18, это 18 / 200 = 9%. На выборке из 200 ответов это примерно от 5,8% до 13,8% (интервал Уилсона, 95%): даже нижняя граница выше порога, то есть порог превышен уверенно. Разбор расхождений:
Все три причины системные, поэтому правила уточняются и перекодируется весь массив. Вторая проверка на новых 200 случайных ответах даёт 3 расхождения — 3 / 200 = 1,5%, интервал примерно от 0,5% до 4,3%: ниже порога вся оценка, включая верхнюю границу.
Разбор «прочего». После первого прохода в «Другой бренд» попали 102 ответа — 8,5% респондентов, выше договорённых 3%. Ручной разбор:
После разбора в «прочем» 30 ответов — 30 / 1 200 = 2,5%, в пределах порога. Новый банк стоит обсудить с заказчиком как кандидата в закрытый список следующей волны.
Проверка заняла часы, а не дни. Без неё отчёт показал бы заниженное знание двух брендов, лишний бренд и «пропавшую» казахоязычную аудиторию.
Что это значит для вашего решения
Вопрос «кодируете ли вы открытые ответы нейросетью» мало что даёт: ответ «да» не плохой, а «нет» не гарантия качества. Полезнее спросить у любого подрядчика, включая нас, пять вещей: кто утверждает кодификатор; сколько ответов перепроверяется вручную и как считается доля расхождений; какой порог и что происходит, если он превышен; какая доля ушла в «прочее»; как кодируются казахоязычные ответы. Если на эти вопросы есть цифры — кодировке можно доверять, чем бы она ни была сделана.
Общая логика кластера та же, что в опорной статье «Заменит ли ИИ маркетинговые исследования»: нейросеть ускоряет работу с текстом, но не заменяет ни источник данных, ни ответственность за вывод. Остальные методы, где открытые вопросы — часть анкеты, собраны в разделе «Методы».
Источники
- Mellon J., Bailey J., Scott R. и др. Do AIs know what the most important issue is? Using language models to code open-text social survey responses at scale // Research & Politics, 2024. journals.sagepub.com
По теме
Обсудим ваше исследование. Расскажите, какое решение нужно принять, — предложим метод, выборку и сроки.