Умная лента · Россия и мир Новости
Закрытый экзаменационный сейф с приватными тестами, весами справедливости и обезличенными листами проверок показывает Vals как арбитра AI-бенчмарков, а не продавца красивых баллов.

Vals хочет быть арбитром AI-бенчмарков — и продаёт не красивые баллы, а закрытый экзамен

Vals лезет в самое нервное место AI-рынка: кто вообще решает, какая модель сильнее, если старые тесты уже выучили почти как шпаргалку перед контрольной.

Стартап появился в 2024 году, а в августе поднял $40 млн в раунде Series A во главе с Andreessen Horowitz. Рост тоже не декоративный: выручка стала в восемь раз больше, команда с начала года выросла с 8 до 25 человек. Для компании, которая продаёт не чат-бота, а проверку чужих чат-ботов, это неплохой намёк: рынок устал верить только табличкам от самих разработчиков моделей.

Главный ход Vals — не светить все задания наружу. В обычных публичных бенчмарках есть старая беда: если тест лежит в интернете, модель могла видеть его в обучающих данных или вокруг него могли специально натренироваться. Получается не экзамен, а репетиция с ответами. У Vals часть наборов закрытая: тестовый сет остаётся приватным, а для прозрачности компания показывает публичные и приватные валидационные наборы там, где это возможно.

Проверяют не «знает ли модель умные слова», а может ли она делать работу. Юридический поиск, финансы, кодинг, файлы, таблицы, инструменты, длинные задачи — ближе к офисной кухне, где всё ломается не в теории, а в процессе. В методологии Vals отдельно считает не только точность, но и задержку, стоимость, сбои и качественные ошибки. То есть вопрос не «кто красивее набрал проценты», а «сколько стоит получить нормальный ответ и где оно развалится».

Есть и подвох. Vals зарабатывает на оценке моделей, а клиенты платят за проверку собственных систем. Это не делает тест автоматически фальшивым, но конфликт интересов тут надо держать в голове. Доверие в такой истории держится на методике, закрытости тестовых сетов от обучения и понятной статистике, а не на красивом слове «независимый».

Отдельный поворот — госрынок. Vals запустила направление Public Sector: оценки для ведомств и задач с высоким риском, включая публичные услуги, кибербезопасность и сценарии, где ошибка модели стоит дороже неловкого ответа в чате. В Вашингтоне компания уже открыла офис. Логика простая: если государство покупает AI на миллиарды, кому-то придётся проверять не презентации продавцов, а реальную работу.

Чего пока нет: полной картины клиентов, цен и того, насколько широко покупатели увидят сырые результаты тестов. Так что Vals пока не «золотой стандарт», а заявка на роль экзаменатора. Но заявка в момент, когда всем надоело мериться бенчмарками, которые модели могли заранее подсмотреть.

Источник: TechCrunch

← Ко всем новостям