Cohere вытащила на свет RCP-nDCG@10 — новую метрику для проверки корпоративного поиска. Не чат-бот, не кнопка «сделать красиво», а способ понять, правда ли поиск нашёл нужный документ, а не просто угадал старый ответ из benchmark-таблички.
Проблема у старого nDCG простая и довольно житейская. Он оценивает выдачу по заранее размеченным документам — qrels. Когда-то люди посмотрели часть корпуса, отметили релевантное, и дальше метрика живёт на этой карте. Но карта неполная. Новый поиск может достать нормальный документ из дальнего ящика, а старая разметка его не знает. Значит, балл не растёт. Бумажка правильная, дверь закрыта.
Cohere предлагает другой ход: для каждого запроса найденные документы прогоняются через явные критерии релевантности, а оценку даёт откалиброванный AI-судья. Важная деталь — это всё равно оценочная методика, а не волшебный детектор истины. Просто вместо «в старом списке есть / нет» появляется попытка заново проверить сам документ против запроса.
В тексте есть хороший пример из ViDoRe v3: запрос спрашивает цветовой код для азотных баллонов. В ключе размечены только два документа, в топ-пять попадает один из них, а документ на третьем месте прямо цитирует ответ — но старые qrels его не считали релевантным, потому что его вообще не оценивали. Вот так benchmark и начинает ругать систему за то, что она нашла лишнее правильное.
Cohere проверяла подход на человеческих оценках: в исследовании участвовали 46 аннотаторов. Отдельно подчёркнуто, что старые qrels в такой задаче оказались лишь умеренно лучше случайного угадывания при предсказании слепых человеческих оценок. Для корпоративного поиска это больное место: в компаниях документы пухнут годами, и полный ручной обход всего архива стоит как маленький ремонт с заменой подъезда.
Граница тоже понятная. RCP-nDCG@10 не даёт пользователю нового интерфейса и не говорит, что любой поиск Cohere теперь безошибочный. Это линейка для разработчиков retrieval-систем и команд, которые сравнивают модели на внутренних базах, PDF и прочей офисной геологии. Cohere пишет, что под эту метрику уже оптимизирует следующие поисковые модели. Про цену, регионы и конкретный релиз продукта в исходном тексте ничего не раскрыто.
