Умная лента · Россия и мир Новости
Коробка с кухонной техникой застряла на складе с красным courier exception, пока рядом зелёный штамп SOLVED спорит с разъехавшимися полями базы.

Агент сказал «готово», а база показала: опять накосячил

Microsoft и Hugging Face выкатили ThinkingBox — бенчмарк для AI-агентов, где смотрят не на красивый финальный ответ, а на то, что агент реально оставил в базе. То есть не «он уверенно сказал клиенту, что всё решил», а статус тикета, лишние записи, пропущенные действия и прочая бухгалтерия, от которой потом у живых людей дёргается глаз.

Логика простая. Агенту дают бизнес-задачу: магазин, страховка, поездка, необанк или внутренний IT/HR. Он общается с симулированным пользователем, ходит в инструменты через изолированные MCP-сессии, меняет записи. Потом проверка лезет в конечное состояние бэкенда и спрашивает: нужное поле на месте? лишнего не наделал? ответ пользователю не врёт тому, что реально произошло?

Масштаб уже не игрушечный: 507 stateful-сценариев, каждый гоняют по 20 раз с чистого старта. В отдельной выборке на 121 680 валидных прогонов у 12 моделей провалились 79 853 попытки. Самое неприятное: 67,24% этих провалов внешне выглядели прилично — агент завершился без ошибки, вызвал инструмент, что-то записал и не споткнулся в финале. А база всё равно сказала: мимо. У таких провалов находили неправильные значения полей в 77,61% случаев, лишние побочные эффекты — в 43,30%, недостающие действия — в 25,36%. Эти категории пересекаются, потому что один агент может одновременно и не доделать, и наломать.

Показательный пример из блога — клиентка с кухонной техникой за $745, которая застряла у перевозчика в Nashville на 15 дней сверх срока. Агент сделал девять нормальных tool calls, завёл тикет, прочитал правила компенсации и закрыл обращение как solved. Только посылка всё ещё висела в courier exception, а правильный статус должен был быть hold. На витрине — «всё решил». В базе — «брат, нет».

По привычной метрике pass@1 лидирует Claude Opus 5.5 с 67,16%. Kimi-K3 — самый сильный среди open-weight моделей в таблице, 57,37%. Но ThinkingBox специально давит на больное место: один удачный заход ничего не доказывает. Kimi-K3 хотя бы раз решает 476 из 507 задач, то есть 93,89%, но все 20 попыток подряд выдерживает только на 68 задачах — 13,41%. Для продакшена это не «почти умеет», а «иногда повезёт».

Практический вывод тут не про очередную корону в лидерборде. Если агент трогает заказы, выплаты, страховки или банковские записи, проверять надо не уверенный текст и не сам факт tool call. Надо сверять конечное состояние системы. ThinkingBox как раз про это: меньше магии в чате, больше ревизии в базе.

Источник: Hugging Face Blog

← Ко всем новостям