На Mechanical Turk моделью пользуется больше 80% участников, на Prolific — меньше 10%
Авторы задались простым вопросом: как часто участники онлайн-опросов отвечают не сами. Провели серию собственных опросов (всего 250 человек) и меняли условия: площадку, длину анкеты, просьбу не пользоваться ИИ, отключение копирования.
Главный результат — про площадки. На Prolific доля ответов с моделью держалась ниже 10%, на Mechanical Turk доходила до 80% с лишним. Разброс такой, что говорить о «доле ИИ-ответов в онлайн-исследованиях вообще» бессмысленно: у каждой площадки она своя.
Почему это важно. Данные с краудсорсинговых площадок стоят за огромным количеством выводов о людях — в психологии, в маркетинговых тестах, в продуктовых опросах. Если восемь ответов из десяти на одной площадке написаны моделью, то и результат оттуда описывает не людей.
Самое неудобное открытие — про защиту. Меры действительно снижали использование модели, но качество данных при этом не обязательно росло. Логика понятная: человек, которому запретили удобный способ, не превращается в старательного респондента, он просто отвечает быстрее и хуже. Значит, борьба за чистоту и борьба за качество — не одно и то же, и выигрывать их приходится по отдельности.
Что авторы предлагают: не ловить постфактум, а собирать след работы — записывать и разбирать клавиатурный ввод, а вопросы и инструкции писать так, чтобы они были неудобны модели.
Отдельная деталь на будущее. Браузерными агентами на момент исследования не пользовался никто. Авторы всё равно поставили собственные эксперименты по их обнаружению — то есть считают, что это вопрос ближайшего времени, а не гипотеза.