Результат теста рассыпается, если вокруг вопроса появляется обычный разговор

Ассистентов всё чаще ставят в места, где ошибка дорога: здравоохранение, госуслуги. При этом проверяют их одиночными вопросами, а работают они в разговоре, где до вопроса было ещё двадцать реплик.

Авторы предлагают операцию над любым существующим тестом: превратить одиночный вопрос в многоходовую историю. В диалог подмешиваются реалистичные вещи — признаки, по которым угадывается, кто перед моделью, и подхалимские наживки, — а сама задача остаётся прежней.

На четырёх наборах (математика, медицинские вопросы, безопасность) и девяти моделях качество оказалось неустойчивым: заметное падение на трёх наборах из четырёх. Задание не изменилось — изменился только контекст вокруг него.

Почему это важно. Цифра из карточки модели или из внутреннего теста получена в стерильных условиях. Разговор с живым человеком к таким условиям не относится никогда, и разница между двумя числами — это не придирка, а рабочая величина.

Практически полезен сам приём: свой набор проверок можно один раз обернуть в диалог и получить вторую, более честную оценку. Авторы отдельно сделали облегчённый вариант, чтобы стоимость проверки не выросла.

Ограничение простое: качество вставок определяет качество вывода. Симулированный пользователь — это тоже модель, и насколько его лесть похожа на человеческую, отдельный вопрос.

https://arxiv.org/abs/2607.20558