Модель угадывает 52% ответов на вопросы, которых не видела, — почти как обученный алгоритм
Обычно силиконовую выборку проверяют по распределениям: похоже ли среднее по синтетической группе на среднее по живой. Авторы считают это слишком мягкой проверкой — совпасть можно и без всякого понимания респондента. Они предлагают перенос между частями анкеты: модель получает ответы конкретного человека на один набор вопросов и должна предсказать его же ответы на совершенно другой.
Данные — тайваньское исследование выборов и демократизации 2024 года, три модели с открытыми весами (от 27 до 120 миллиардов параметров), для сравнения обученные алгоритмы машинного обучения.
Результат: без всякого обучения модели дают 52% точности на действительно новых вопросах — это в шести процентных пунктах от случайного леса, обученного на той же популяции. Для метода, который ничего не знал об этих людях, разрыв небольшой.
Гораздо полезнее второй результат: предсказуемость по темам выстраивается в устойчивую лестницу. Партийные симпатии угадываются на 67%, а отношение к суверенитету — на 23%. То есть вопрос «работают ли синтетические респонденты» поставлен неверно; работает или нет — свойство темы, а не метода.
Почему это важно. Если тема из верхней части лестницы, синтетическая панель экономит деньги. Если из нижней, она даст уверенные цифры, которых нет. Отличать одно от другого по внешнему виду ответа невозможно.
Заодно авторы аккуратно осадили две расхожие претензии к силиконовым выборкам. Сжатие разброса ответов есть и у обычных обученных моделей, а эффекты выравнивания сильно зависят от семейства моделей. Обе проблемы реальны, но устроены сложнее, чем принято повторять.