22.07.2026
интервью инструмент
arXiv, препринт (Max Planck Institute for Human Development)
ИИ-интервьюер, собранный вместе с автором метода, задаёт по одному ненаводящему вопросу

Йона Кармон, Клара Берш, Чарльз Фернихаф, Расселл Хёрлберт, Симона Кюн

Метод описательной выборки опыта требует редких обученных интервьюеров, поэтому выборки крошечные. Авторы перевели его в явную архитектуру: одиннадцать признаков качества реплики, консервативный учёт установленного и один ненаводящий вопрос за ход.

21.07.2026
доверие препринт
arXiv, препринт
Справедливым решение ИИ считают те, кто верит врачу, а не технологии

Леони Вестербек, Эрнесто де Леон, Юлия ван Верт

3915 респондентов, структурное моделирование: отношение к автоматическим решениям в медицине сильнее всего объясняется уверенностью, что врач отличит текст ИИ от человеческого.

19.07.2026
опросы препринт
arXiv, препринт
Ответы модели слишком предопределены, чтобы считать их распределением мнений

Пильсун Кан

У людей ответ зависит от порядка вопросов, и на этот счёт есть проверяемое равенство. Попытка применить его к модели упёрлась в другое: в 17 парах из 18 ответы почти детерминированы, распределения там попросту нет.

17.07.2026
опросы препринт
arXiv, препринт
Тысяча независимых персонажей сваливается в один и тот же ответ

Гюркан Озкан

На 2414 реальных респондентах World Values Survey видно, как независимые агенты кучкуются вокруг модального ответа: расхождение с настоящим распределением 0.44. Приём, который чинит эту скученность, тут же перелетает в другую сторону.

17.07.2026
продукт бенчмарк
arXiv, препринт
Результат теста рассыпается, если вокруг вопроса появляется обычный разговор

Эмма Кондруп, Закари Ян, Анна Имуза, Рейхане Раббани

Обычные тесты устроены как один вопрос и один ответ. Если превратить их в многоходовой диалог с намёками на пользователя и лестью, качество падает на трёх бенчмарках из четырёх у девяти моделей.

12.07.2026
опросы инструмент
arXiv, препринт
Анкету можно испытать на выдуманной популяции до того, как платить живой

Сон-Цзэ Юй, Джозеф Су, Серина Чан, Дэвид Чан

Открытая платформа, где анкету можно прогнать на смоделированной аудитории. На двух проверках — сегменты панели Pew и конкурс подписей The New Yorker — распределения ближе к реальным, чем у обычного промпта с персоной.

11.07.2026
продукт бенчмарк
arXiv, препринт
Лучший агент понимает, когда действовать не надо, в 59.5% случаев

Сюнь Лю, И Ивэй Чжан, Вира Каспрова и соавторы

263 парные задачи в 42 песочницах: в каждой паре одна требует действия, вторая — воздержаться. Лучший из 17 агентов проходит обе стороны в 59.5% случаев, и умение остановиться почти не связано с общей силой модели.

08.07.2026
разметка бенчмарк
arXiv, препринт
Двадцать один судья вместо человека: согласие с экспертом 95%

Андреа Скаринчи, Вирджиния Негри, Браян Импата и соавторы

12 726 товаров, 229 типов, 792 атрибута, четыре языка. Отдельная модель-судья совпадает с экспертом умеренно, но большинство голосов из 21 конфигурации даёт согласие 95.2%.

03.07.2026
опросы препринт
arXiv, препринт
Модель угадывает 52% ответов на вопросы, которых не видела, — почти как обученный алгоритм

Чань-Тун Ку, Чань Сюй, Пэй-Цин Хуан и соавторы

Строгая проверка: модели показывают ответы человека на одну часть анкеты и просят предсказать другую. Партийные установки угадываются на 67%, отношение к суверенитету — на 23%.

01.07.2026
опросы препринт
arXiv, препринт
На Mechanical Turk моделью пользуется больше 80% участников, на Prolific — меньше 10%

Зейн Сюй, Нейтан Малкин

Серия опросов на 250 участниках: доля ответов, написанных с моделью, зависит прежде всего от площадки. Меры защиты использование снижают, а качество данных — не обязательно.

29.06.2026
лента препринт
arXiv, препринт
1120 агентов прожили в ленте X и показали, что она усиливает

Алессандро Морозини, Сара Цен, Эндрю Ильяс и соавторы (MIT)

Каждому агенту дали устойчивый характер на основе демографии и политических взглядов, а признаки, видимые платформе, меняли отдельно. 200 000 показов: алгоритмическая лента усиливает токсичное, поляризующее и политическое по сравнению с хронологической.

29.06.2026
рынок препринт
arXiv, препринт
Индекс потребительской уверенности удалось собрать из смоделированных домохозяйств

Иси Хуан, Юньлу Инь, Цзяюй Линь и соавторы

Синтетическая популяция, откалиброванная по микроданным, читает новости и макропоказатели и отвечает как в опросе. По США, ЕС и Японии реконструкция обходит базовые методы, особенно вокруг заметных событий.

29.06.2026
опросы препринт
arXiv, препринт
Синтетическим респондентам нравится всё подряд, и структура вкусов у них рассыпается

Сянъюй Ма, Мэнми Чжан, Шеннон Ан, Минне Чэнь

277 470 цифровых двойников респондентов на каждой из трёх моделей, сверка с американским опросом об участии в культуре. Систематический перекос в сторону «нравится», а связи между вкусами теряются полностью.

26.06.2026
разметка препринт
arXiv, препринт
Разметка совпала с человеческой — это ещё не значит, что измерили то самое

Мануэль Пита

Совпадение с живым кодировщиком показывает надёжность, а не валидность: модель могла прийти к верному коду по признаку, к сути понятия отношения не имеющему. Автор предлагает разбирать понятие на части и требовать под каждую цитату из текста.

Под этот фильтр ничего не подходит.