Разметка совпала с человеческой — это ещё не значит, что измерили то самое

Когда модель размечает тексты так же, как человек, это принято считать доказательством, что ею можно пользоваться. Автор аккуратно разводит два разных свойства. Согласие с человеком означает надёжность инструмента. Валидность — это про то, измеряет ли инструмент именно то понятие, которое заявлено. Второе из первого не следует.

Разница не схоластическая. Модель может ставить верный код, опираясь на побочный признак: слово-маркер, тон, длину, тему. Пока признак и понятие ходят вместе, согласие высокое. Как только они расходятся — на новой аудитории, в новой категории, в другой год — разметка ломается, и по метрике согласия этого не видно.

Предложение автора: разобрать понятие на составляющие, каждую проверять по тексту с обязательной цитатой-подтверждением, а итоговый код собирать по явно записанному правилу, выведенному из теории. Правило снаружи, а не внутри одного непрозрачного прохода.

Что это даёт практически. Когда код неверен, видно, из-за чего именно: пропущена составляющая или спутано соседнее понятие. Ошибку становится возможно чинить, а не просто пересчитывать точность.

Почему это важно за пределами академии. Любая рабочая рубрика — «недовольство доставкой», «сомнение в цене», «риск оттока» — это понятие с теорией внутри, пусть и не записанной. Ровно та же подмена признаком происходит в отчётах по отзывам, и обнаруживается она обычно на следующем квартале.

Чего в работе нет: измерения того, как часто подмена случается на практике. Это метод, а не оценка масштаба проблемы, и его ещё предстоит приложить к большим корпусам.

https://arxiv.org/abs/2606.28574