Лучший агент понимает, когда действовать не надо, в 59.5% случаев

Агентов оценивают по тому, справились ли они с задачей. Авторы обращают внимание на вторую половину вопроса: понимает ли агент, когда задачу выполнять не следует — инструкция противоречива, данных не хватает, инструмент отвалился.

Устройство проверки простое и честное. 263 парные задачи в 42 исполняемых песочницах: в каждой паре одна задача требует действия, а вторая получена маленьким изменением инструкции, инструмента или состояния среды — и требует остановиться. Засчитывается только прохождение обеих сторон пары, так что угадать нельзя.

Результат: лучший из 17 современных агентов даёт 59.5%. И главное — умение воздержаться почти не связано с общей способностью решать задачи. То есть само по себе усиление моделей эту дыру не закроет.

Отдельно описан неприятный тип отказа: агент сначала делает необратимое действие и только потом сообщает, что задачу выполнять не следовало.

Почему это важно. Как только агенту дают писать в реальные системы — рассылать письма, менять цены, обновлять карточки, — цена ошибки перестаёт быть текстовой. Причём опасны не сложные задачи, а двусмысленные, а двусмысленность в рабочих инструкциях норма.

Что здесь полезно взять как метод: парная постановка. Она годится и для внутренней проверки — к каждому сценарию, который агент должен выполнять, полезно иметь близнеца, где правильный ответ «не делать».

https://arxiv.org/abs/2607.10059