Двадцать один судья вместо человека: согласие с экспертом 95%
Задача скучная и очень денежная: вытащить из описаний товаров значения атрибутов — размер, материал, состав, совместимость. Тысячи типов товаров, сотни атрибутов, несколько языков — вручную это миллионы разметок.
Авторы собрали проверяемый набор: 12 726 товаров, 229 типов, 792 атрибута, четыре языка (испанский, французский, итальянский, немецкий). Синтетические метки проверяются не одной моделью, а ареной из 21 конфигурации судей — семь семейств моделей по три варианта промпта, — и решение принимается большинством.
Цифры показательны именно парой. Отдельные судьи согласны между собой умеренно: показатель Фляйса 0.76. А их большинство совпадает с живыми экспертами на 0.92 по Коэну, то есть 95.2% совпадений. Разные и по одиночке не блестящие судьи в сумме дают качество ручной проверки.
Почему это важно. Это редкий случай, когда ансамбль моделей описан как производственное решение, а не как трюк: считать 21 голос дорого, но несопоставимо дешевле ручной разметки, и качество измерено на людях.
Что стоит помнить, примеряя это на себя. Атрибуты товара — задача с проверяемым ответом: материал либо указан, либо нет. Там, где ответ зависит от суждения (тональность, намерение, причина возврата), согласие судей между собой будет ниже, и голосование не спасёт.
Открытый вопрос — про разнообразие. Работает ли схема потому, что судьи независимы, или потому, что их много? Ответ определяет, можно ли сэкономить, взяв семь конфигураций вместо двадцати одной.