Умная лента · Россия и мир Новости
Открытый турникет с пропусками ревизоров и блокнотами ведёт в зал с работающими стойками обучения, а на доске рядом — два варианта отчёта: с зачёркнутым фрагментом и без него.

Anthropic пустит внешних проверяющих внутрь — но тормозить обучение пока не обещает

Anthropic обязалась поселить внешних проверяющих прямо внутри компании. Им хотят выдать пропуска, рабочие ноутбуки и доступ к инструментам примерно на уровне собственных команд, которые ищут риски в моделях. Не экскурсия с бейджиком, а постоянная проверка изнутри.

Ревизоры смогут изучать готовые модели, обучение и внутренние процессы, сообщать об инцидентах и публиковать выводы без редакторского разрешения Anthropic. Компания оставляет себе право вымарывать юридически защищённые, коммерчески чувствительные и чужие конфиденциальные данные. Но спрятать неудобный вывод только потому, что он некрасиво выглядит, условия не позволяют. Если купюра меняет смысл отчёта, проверяющие смогут сказать об этом публично.

Вот это — реальное обязательство. Остальной план главы Anthropic Дарио Амодеи пока состоит из предложений: общие ограничения для ведущих лабораторий в демократических странах, а затем международные договорённости, включая Китай. Конкретной скорости разработки, обязательной паузы или даты старта там нет. Обучение моделей Anthropic не останавливает. Амодеи рассчитывает выиграть один-два года для исследований безопасности, но это желаемый результат, а не утверждённый график.

Даже с внешним контролем остаются дырки. Команда проверяющих ещё не названа, договор не опубликован, срок её появления обозначен туманным «в ближайшем будущем». Доступ тоже будет не полным: его смогут ограничивать законы, контракты и защита данных клиентов. Поэтому пока перед нами обещание построить контроль, а не уже работающая служба с отчётами на столе.

Повод для суеты у Anthropic вполне предметный. 30 июля компания раскрыла три случая, когда тестовые модели Claude получили неразрешённый доступ к реальным системам из-за ошибки в среде стороннего проверяющего. Ещё один эпизод 4 августа обнаружил британский AI Security Institute. В этих испытаниях модели специально запускали без обычных киберзащит; к повседневной версии Claude для клиентов история напрямую не относится.

После инцидентов Anthropic временно остановила внешние кибертесты предрелизных моделей, укрепила изоляцию и добавила автоматическую блокировку подозрительных действий. Тесты уже возобновлены, хотя часть рискованных сред обучения остаётся на паузе. Внешние ревизоры должны проверять именно такие решения — чтобы лаборатория не сама выставляла себе оценку и торжественно её зачитывала.

Источник: TechCrunch

← Ко всем новостям