Зачем не шкала
Если спросить «насколько важен каждый из этих двенадцати параметров» по шкале от одного до шести, почти всё получит пять и шесть. Отвечать «неважно» на разумно выглядящий параметр мало кто хочет, а различать двенадцать позиций по шестибалльной шкале человек и не пытается.
Дальше позиции идут в отчёте с разницей в три десятых балла, и эта разница ложится в основу решения о том, что доделывать. Она же на следующей волне переворачивается.
MaxDiff заставляет выбирать: респонденту показывают по четыре-пять позиций из списка и просят отметить самую важную и самую неважную, несколько раз с новыми наборами. Шкала позволяет согласиться со всем, выбор — нет. Ещё один эффект: у шкалы есть культурная и индивидуальная составляющая — кто-то ставит шестёрки, кто-то четвёрки, и в разных странах по-разному. У выбора её почти нет, поэтому MaxDiff сопоставим между странами и сегментами лучше, чем средний балл. Когда брать MaxDiff, а когда Кано или конджойнт, — в статье Кано, MaxDiff или конджойнт.
Что должно быть решено до расчёта
Расчёт не исправит дизайн, поэтому три вещи проверяются до программирования анкеты.
Число экранов — тождество. Экранов = позиции × показы ÷ размер набора. Двенадцать позиций по три показа наборами по четыре дают ровно девять экранов. Если делится не нацело, такой конфигурации не существует, и менять надо одно из трёх чисел.
Баланс. Каждая позиция показана одинаковое число раз, внутри набора нет повторов, и пары позиций встречаются как можно ровнее. Последнее забывают чаще всего, а именно оно определяет, различит ли метод две соседние позиции: если A и B ни разу не попали в один набор, между ними нет прямого сравнения, и расстояние восстанавливается только косвенно.
Длина списка. Рабочий диапазон — от 12 до 25 позиций. На списке короче 10 хватит ранжирования. Списки на 40–60 позиций делают разреженным дизайном, где каждый респондент видит только часть списка, — об этом ниже.
Подробнее о списке, формулировках и таблице «позиции — наборы — экраны» — в гайде по составлению MaxDiff.
Пять способов провести
Классический MaxDiff. Наборы по плану, все респонденты видят один и тот же сбалансированный дизайн или его версии. Базовый вариант, к которому применимо всё остальное.
С якорем (anchored MaxDiff). У обычного MaxDiff есть ограничение, о котором забывают: он даёт только относительный порядок. Из результата видно, что A важнее B, но не видно, важны ли они вообще. Список, в котором все позиции неважны, даст такой же аккуратный порядок, как список, где важны все.
Это исправляет якорь. Простейший способ — после каждого набора спрашивать: «эти позиции важны для вас все, ни одна или некоторые». Второй — отдельный прямой вопрос по каждой позиции: важна или нет. Оба привязывают относительную шкалу к порогу, и тогда можно говорить не только «что важнее», но и «что вообще проходит порог значимости».
Стоит это одного дополнительного вопроса на экран или одной батареи. Берут якорь, когда решение звучит как «что убрать из продукта»: без него последние позиции рейтинга нельзя отличить от просто менее важных.
Разреженный (express). Для длинных списков: респондент видит не весь список, а его часть. Групповой результат считается нормально, индивидуальный — нет. Ограничение существенное: без индивидуального результата невозможны ни сегментация, ни расчёт набора позиций.
Адаптивный. Наборы подбираются по ходу: позиции, которые человек уже уверенно отверг, показываются реже. Экономит экраны, но усложняет оценку и делает дизайн неодинаковым между респондентами — со всеми последствиями для сопоставимости.
MaxDiff по поведенческим режимам. Тот же метод, другой объект: сравниваются не свойства продукта, а способы вести себя — «важнее, чтобы сделали за меня, даже дороже» против «важнее контролировать каждый параметр, пусть это дольше». Результат читается не как рейтинг, а как признак сегментации: одинаковый набор критериев в разном порядке означает разных людей. Требование к формулировкам жёстче обычного: каждая строка обязана называть, чем человек платит за то, что ему важнее. Строка без цены — «удобное приложение» — меряет вежливость, потому что с хорошим согласны все.
Четыре способа посчитать
Подсчёт (counting). Для каждой позиции: сколько раз выбрана важной, минус сколько раз неважной, делённое на число показов. Получается число от минус единицы до плюс единицы. Знаменатель — показы, а не респонденты.
Годится для рейтинга по выборке и считается в две строки. Два ограничения. Первое: величина не переводится в вероятность выбора — сказать «эта позиция вдвое важнее» по ней нельзя. Второе: индивидуальная величина очень грубая. При трёх показах на позицию она принимает семь значений, от −3 до +3 выборов, и у многих респондентов несколько позиций получают одинаковый счёт.
Агрегатная логит-модель. Полезности оцениваются по всей выборке одной моделью выбора и переводятся в шкалу вероятностей, где «как все» — это сто, делённое на число позиций. Если позиций двенадцать, то 8,3 означает среднюю позицию, а 20 — что позицию выбирают почти в два с половиной раза чаще ожидаемого. Такую шкалу читают в отчёте; исходные значения логита не читает никто.
Ограничение одно, и оно серьёзное: агрегат описывает среднего респондента. Если в выборке два сегмента с противоположными приоритетами, агрегат покажет их обоих посередине — то есть опишет человека, которого нет.
Латентные классы (latent class). Модель находит несколько групп, у каждой свой порядок приоритетов, и вероятность принадлежности каждого респондента к каждой группе. Это прямой ответ на проблему агрегата и способ получить из MaxDiff сегментацию, а не рейтинг.
Число групп — содержательное решение. Формальные критерии (BIC, CAIC) дают подсказку, но регулярно указывают на решение, где одна группа составляет четыре процента выборки. Такая группа не бывает адресатом решения, поэтому число групп выбирают вместе с заказчиком: по формальным критериям, по размеру наименьшей группы и по тому, читается ли каждая группа как узнаваемый тип людей.
Иерархический байес (hierarchical Bayes, HB). Даёт непрерывную индивидуальную оценку полезностей для каждого респондента. Нужен там, где результат используется поштучно: расчёт набора позиций, симуляция выбора, соединение с данными о покупках. Считается дольше и требует проверки — о ней ниже.
Как проверить, что расчёт не врёт
Здесь главная опасность метода. Любая из четырёх моделей выдаст правдоподобный результат на любых данных, включая испорченные. Порядок позиций будет выглядеть осмысленно, сумма сойдётся, отчёт соберётся.
Интервалы у рейтинга. Разница между соседними местами бывает меньше погрешности. Интервалы строят повторными выборками респондентов (бутстрэп): если места 3 и 4 меняются местами в заметной доле повторов, это одна ступень, а не две. Без этой проверки в отчёт уходит порядок, которого в данных нет.
Отложенные задания. Часть заданий не отдают модели, а оставляют на проверку: модель предсказывает выбор, предсказание сравнивают с фактом. Долю угаданных выборов читают только рядом с двумя другими числами — что даёт случайное угадывание (при наборе из четырёх это 25%) и что даёт простая агрегатная модель. Модель сложнее агрегата, но не точнее его, в отчёт не идёт: она обходится дороже, потому что в неё верят.
Откладывать надо задания, а не людей. Если сложная модель приписывает группу человеку, то, отложив людей целиком, мы проверяем не качество оценки, а способность угадать группу по нулю ответов.
Совпадение дизайна. Расчёт использует состав наборов. Если на платформе опроса запрограммирован свой план вместо согласованного, модель посчитает по неверному дизайну — и не пожалуется. Это сверяется при приёмке анкеты, до поля, и дополнительно проверяется в данных: выбор позиции, которой в наборе не было, означает расхождение.
Что с результатом делают дальше
Рейтинг приоритетов. Базовое применение: что важно, что нет и насколько расстояние между позициями больше погрешности.
Расчёт набора позиций (TURF). Задача другая, чем кажется: не «какие позиции лучшие», а «какой набор из трёх покрывает больше всего людей». Лучшие три позиции по рейтингу часто нравятся одним и тем же людям, и набор из первой, четвёртой и девятой может покрыть больше. Считается только по индивидуальным оценкам — на подсчёте и на агрегате не считается вовсе.
Сегментация. По латентным классам или по индивидуальным оценкам. Обязательная проверка: группы должны различаться ещё в чём-то, кроме своего порядка приоритетов — в поведении, в тратах, в канале, в марке. Группы, построенные по порядку приоритетов, различаются по порядку приоритетов всегда, и это тавтология, а не находка. Как сегменты становятся целевой аудиторией на данных, — в отдельной статье.
Сравнение волн. Работает, но с оговоркой: результат относительный, поэтому сравнивается позиция в порядке, а не абсолютная величина. И список должен быть дословно тем же: добавленная позиция меняет величины у всех остальных, потому что делится одно и то же целое.
Пять ошибок, которые доходят до отчёта
Сравнение величин между двумя разными списками. Величина показывает вес внутри своего списка. Два блока MaxDiff в одной анкете дают две шкалы, и «7,2 в первом блоке против 9,1 во втором» не значит ничего. Сравнивать можно позицию в порядке, а не число. Если сравнение нужно, в оба списка ставят несколько дословно одинаковых якорных позиций и сравнивают через них.
«В два раза важнее». По результату подсчёта так сказать нельзя. По шкале вероятности выбора — можно, и это одна из причин считать моделью, а не подсчётом.
Абсолютный вывод из относительной шкалы. «Последние три позиции неважны» — это вывод, которого в обычном MaxDiff нет. Без якоря известно только, что они менее важны, чем остальные.
Порядок на малой базе. На срезе из шестидесяти человек порядок соседних позиций обычно неразличим. Величина при этом печатается с одним знаком после запятой и выглядит точной, но разница в пару пунктов на такой базе неотличима от шума. Какая база нужна для среза, считается заранее — см. сколько человек нужно опросить.
Вывод по сегменту, который сам построен по этому же вопросу. Сегменты по приоритетам различаются по приоритетам. Содержательным признаком они становятся только после того, как разошлись в чём-то внешнем.
Что выбрать под задачу
Если нужна не важность позиций, а выбор между готовыми вариантами продукта с ценой, это задача конджойнт-анализа, а не MaxDiff.
Как мы это делаем
План наборов мы проверяем до поля — на повторы, чужие позиции и баланс показов — и ещё раз по данным, после поля. Результат вы получаете в интерактивном дашборде: у каждой позиции оценка, число выборов в обе стороны, число показов, ранг и интервал, посчитанный повторными выборками, — по нему видно, какие соседние места различимы, а какие — одна ступень. Срезы открываются там же, следующие волны доливаются туда же. Презентация с выводами — по запросу.
Опрос по Казахстану может идти на двух языках — для общенациональной выборки это рекомендуем, — и для MaxDiff это не формальность: если позиция на казахском звучит сильнее или слабее, чем на русском, её оценка сдвигается, и сравнение языковых групп ломается. Поэтому, если казахская версия нужна, казахский список пишут казахоязычные исследователи как второй оригинал, а не перевод, и сверяют его с русским до поля.
Когда MaxDiff ставится на поведенческих режимах, мы берём порядок у каждого респондента и делим выборку по ведущему режиму. Сегментом такая группа становится, только если она отличается от остальных в чём-то внешнем — канале, тратах, марке — и отличие сильнее формальной значимости. Если две ветки анкеты получают разные списки, в обеих стоят дословно одинаковые якорные позиции, и ветки сравниваются по месту в порядке, а не по числу.
Спросите у любого подрядчика, включая нас: каким способом посчитан MaxDiff, различимы ли соседние места в рейтинге и чем модель лучше простого подсчёта на отложенных заданиях. Подробнее о продукте — на странице исследования MaxDiff, остальные задачи продукта — в разделе «Продукт и jobs to be done».
По теме
Обсудим ваше исследование. Расскажите, какое решение нужно принять, — предложим метод, выборку и сроки.