Тысяча независимых персонажей сваливается в один и тот же ответ
Модный способ собрать синтетическую популяцию — запустить каждого человека отдельным агентом. Автор показывает, что у этого способа есть системная поломка, и проверяет её на данных, которые обычно не берут: не на американцах, а на турецкой части World Values Survey, 2414 реальных респондентов.
Поломка называется коллапсом. Независимые агенты, каждый со своей биографией, всё равно сваливаются на один самый вероятный ответ. В четырёх сценариях с пятью повторами скученность растёт с 0.36 до 0.69, разнообразие ответов падает, расхождение с настоящим распределением достигает 0.44. И это не случайность: насколько сильно схлопнется популяция, предсказывается по устройству самого вопроса.
Есть приём, который чинит хроническую нехватку разброса, — попросить модель проговорить распределение ответов. Он работает во всех трёх семействах моделей, но ровно так же стабильно перелетает: разброс становится больше человеческого. То есть это не настройка, а другое смещение.
Отдельный результат — про перенос. Даже когда популяция хорошо воспроизводит ответы анкеты, её поведение в задаче ведёт себя иначе: в сценарии бронирования персонажи в основном выбирают самое дешёвое (около 80%), и доход эту привычку лишь слегка сдвигает. Хорошая анкета не означает правдоподобного поведения.
Почему это важно. Тем, кто примеряет синтетические панели, стоит держать в голове два разных вопроса: воспроизводится ли распределение и воспроизводится ли поведение. Здесь показано, что первое не влечёт второго.
Вывод автора умеренный и потому убедительный: он не утверждает, что смоделированная популяция реалистична. Он измеряет внутреннюю несогласованность привычного способа и условия, при которых альтернатива хотя бы откалибрована.