Главное правило: доказать одной строкой
Мы делим кандидатов на две группы. Граница между ними — не «насколько подозрительно», а «можно ли доказать это одной строкой с цифрой»:
- на отбраковку — выполнен критерий, и комментарий называет то, что проверит любой человек: секунды, номер таблицы с одинаковыми оценками, дословную цитату ответа;
- под вопросом — один слабый сигнал. Решение принимает исследователь, открыв анкету целиком. Пустым решение не остаётся: непросмотренная строка не должна ни уйти в брак, ни молча остаться.
Как выглядит такая строка: «общее время 3 мин 40 с при медиане 19 мин, темп по своей ветке 31% типичного», «оценка 6 во всех строках таблиц Q12, Q15 и Q18, 24 строки», «ответ на Q7: “фывапр”». Любой, кто откроет данные, проверит её за минуту, не зная нашей логики. Строку вида «ощущение, что отвечал не глядя» проверить нельзя, поэтому такие случаи уходят в «под вопросом».
Два слабых сигнала разных типов складываются в отбраковку, только если один из них — скорость. Время записывает система, его не оспорить. Шаблон в одной таблице плюс короткий ответ — это повод посмотреть внимательнее, а не доказательство.
Спидеры: слишком быстрое заполнение
Спидер — респондент, который прошёл анкету быстрее, чем её можно прочитать.
Порог по общему времени — ниже 25% медианы полных интервью. Условный пример: медиана 20 минут, значит подозрение начинается с 5 минут.
Поправка на ветку. В анкете с ветвлением короткая ветка честно проходится за треть медианы: человеку, который не пользуется категорией, досталась половина вопросов. Поэтому мы считаем второй показатель — темп по своей ветке: сколько времени человек потратил на те вопросы, что ему достались, по сравнению с типичным временем на те же вопросы. Отбраковка по общему времени — только если и темп по ветке ниже 50% типичного. Если общее время ниже 25% медианы, а темп нормальный (от 60%), это не сигнал вовсе.
Сложные вопросы быстрее 2 секунд. Таблица из пяти и больше строк, выбор лучшего и худшего из набора, открытый вопрос с ответом. Нужны два таких вопроса, а не один: один бывает случайным двойным щелчком. Таблицу из десяти строк за секунду физически не прочитать — это и есть доказательство.
Время от 25% до 40% медианы при низком темпе по ветке — «под вопросом».
За долгое заполнение не отбраковываем. Человек, который отвлёкся на час, отвечал не хуже того, кто прошёл анкету за медиану.
Прямые линии и другие шаблоны в таблицах
Прямая линия — одна и та же оценка во всех строках таблицы: 6-6-6-6-6-6. Бывают и другие шаблоны: чередование 1-2-3-1-2-3, только крайние значения шкалы.
Проверяем таблицы, где отвечено не меньше четырёх строк. Таблица, где осталось три бренда из тех, что человек знает, — не материал для вывода.
На отбраковку — шаблон минимум в двух таблицах, минимум в половине подходящих и минимум в 12 строках суммарно. Две короткие таблицы «6-6-6-6» — частый честный ответ на шкале важности: в коротком списке всё действительно может быть важным.
Чередование ищем только в таблицах без перемешивания строк. Если строки показывались в случайном порядке, «1-2-3-1-2-3» в выгрузке — совпадение: выгрузка хранит строки по кодам, а не по порядку на экране.
Только крайние значения — отбраковка при трёх таблицах и больше, при двух — под вопросом. Шаблон в одной длинной таблице от восьми строк — тоже под вопросом.
Где прямая линия — честный ответ. В таблицах фактов «было / не было» — например, «пришлось звонить повторно», «заказ привезли вовремя» — ответ «да» во всех строках означает, что у клиента всё прошло без нарушений. Если отбраковать таких людей, сервис в отчёте выйдет хуже, чем есть на самом деле. Поэтому таблицы фактов на шаблон не проверяем вовсе. Скорость на них по-прежнему считается: пять строк за секунду не читаются ни в какой таблице.
Лучшая защита от шаблона — анкета, которую не хочется пролистывать: таблицы до 8–10 строк, понятные формулировки, никаких пятнадцатистрочных батарей. После восьмой строки человек перестаёт читать и начинает ставить одну оценку всей колонке — и тогда виноват не он.
Мусор в открытых ответах
Что считать мусором, зависит от вопроса.
Набор символов — клавиатурные прогоны вроде «asdf» или «фыва», одна буква подряд, слово без гласных, строка без букв. Середину клавиатуры проверяем осторожно: там живут настоящие слова и начала имён.
Мат ищем по корням с привязкой к началу слова: иначе «рубля» и «страхуем» попадут в брак.
Вставку текста закрываем ещё в анкете. При программировании анкеты в открытых полях запрещаем вставлять скопированный текст. Иначе туда попадают ответы из нейросетей и чужие формулировки, и открытые ответы искажаются так, что чистка уже не отличит их от честных. Запрет не ловит перепечатку руками, поэтому проверки ниже остаются. Подробнее — в статье «Ответы, написанные ИИ, в онлайн-опросах».
Ответ не по теме автоматически не ловим. Для этого нужно понимать смысл, а цена ошибки — выброшенный честный человек. Открытые ответы всех кандидатов исследователь читает глазами, ответы на казахском — казахоязычный исследователь.
Дубли и боты
Совпадение одного длинного ответа ничего не доказывает: «не хватает парковки» честно пишет каждый двадцатый. Сигнал — когда два респондента дословно совпали в двух и более развёрнутых ответах на разные вопросы. Так выглядят фермы и боты. Вопросы на вспоминание сюда не входят: слоган рекламы люди честно пишут дословно.
Повторное участие одного человека ловим по совпадению ответов, открытых текстов и времени заполнения: две анкеты с почти одинаковыми ответами, заполненные подряд с похожей скоростью, разбираем вручную. Техническая проверка устройства доступна не всегда, поэтому полагаться только на неё нельзя.
Сколько выбрасывать — нормально
Если под отбраковку попадает больше 10% полных интервью, почти всегда дело в анкете, а не в людях: длинная однотипная таблица или вопрос, на который честный ответ короткий. Такую долю мы разбираем, прежде чем отправлять.
Условный пример: 600 полных интервью, 27 на отбраковку — 4,5%. Из них 15 по скорости, 8 по шаблону в таблицах, 4 по мусору в открытых. Ещё 11 под вопросом: после чтения анкет отбраковали 4, оставили 7. Итого 31 интервью, 5,2%, и квоты по городам добираются до закрытия проекта.
Логические противоречия — например, человек назвал бренд сам, но не узнал его в списке — не повод для отбраковки. У них бывают честные объяснения, и это разговор с данными внутри отчёта.
Как мы это делаем
Чистку запускаем по ходу поля и сразу после него, пока проект открыт: чем раньше отправлен брак, тем раньше панель добирает квоту. Данные попадают в дашборд и отчёт только после того, как отбраковка принята и квоты добраны. Отбракованные интервью исключаются из данных явно, по списку.
По запросу вы получаете обезличенные сырые данные и список отбракованных с причиной у каждого. Как мы работаем с качеством на всех этапах, от отбора до чистки, описано на странице «Качество данных». Остальные методы — в разделе «Методы».
Половина проблем с качеством закладывается ещё в анкете — об этом 12 ошибок при составлении анкеты. Если вы собираете опрос сами, прочитайте, чем рискует опрос в гугл-формах: там чистка ложится на вас. Как отличить хорошую работу подрядчика от плохой, разобрано в статье «Как понять, что исследование сделано плохо».
Спросите у любого подрядчика, включая нас: по каким правилам вы отбраковываете анкеты, какая доля ушла в брак в прошлом проекте и можно ли увидеть список с причинами.
По теме
Обсудим ваше исследование. Расскажите, какое решение нужно принять, — предложим метод, выборку и сроки.