Ответы модели слишком предопределены, чтобы считать их распределением мнений
Давно известно, что человек отвечает по-разному в зависимости от того, какой вопрос шёл первым. У этого эффекта есть точное предсказание без подгоняемых параметров — так называемое QQ-равенство. Автор превращает его в инструмент проверки: если модель используют как источник ответов на анкету, её ответы должны вести себя так же.
Теоретическая часть разбирает, какие классы механизмов удовлетворяют равенству, а какие нарушают его предсказуемым образом. Практическая — предлагает заранее описанную процедуру проверки для любой модели, отдающей вероятности следующего слова, с полной перестановкой вариантов и контрольными прогонами.
А дальше самое интересное. На пилоте с открытой моделью все служебные проверки прошли, но проверить главное не удалось: в 17 парах вопросов из 18 при одной формулировке и в 7 из 8 при другой ответы оказались почти детерминированными. Модель не колеблется — она выдаёт один и тот же вариант.
Почему это важно. Когда вероятности следующего слова берут за распределение мнений аудитории, молча предполагается, что там есть разброс. Здесь видно, что его может не быть вовсе, и тогда красивые проценты — это одно и то же мнение, помноженное на количество прогонов.
Отсюда практическая мера, которую автор и рекомендует: прежде чем считать распределение, проверять, не насыщены ли ответы. Проверка дешёвая и делается до всякой аналитики.
Ограничение названо честно: это пилот на одной открытой модели при двух формулировках. Вывод здесь не «модели всегда детерминированы», а «эту проверку надо ставить всегда, потому что иначе можно измерять пустоту».