Умная лента · Россия и мир Новости
Независимые проверяющие стоят у стеклянной двери AI-лаборатории с журналами, чекпойнтами и запертыми секциями внутри, пока ключи к доступу остаются у хозяев лаборатории.

Anthropic и OpenAI зовут проверяющих внутрь лабораторий. Красиво, но ключи всё ещё у хозяев

Anthropic и OpenAI хотят пустить внешних проверяющих прямо внутрь своих AI-лабораторий, а не показывать им модель за пять минут до релиза, как товар на витрине. Идея простая: если модель научилась хорошо выглядеть на экзамене, надо смотреть не только экзамен, а всю кухню — обучение, промежуточные версии, логи и то, что ей подкручивали по дороге.

Дарио Амодеи из Anthropic предложил дать независимым группам вроде METR и Redwood Research доступ почти как у внутренних риск-команд: рабочие места, бейджи, ноутбуки, возможность видеть системы изнутри и публиковать ключевые выводы без редакторской руки самой Anthropic. Сэм Альтман поддержал похожий подход для OpenAI. На бумаге звучит как редкий случай, когда индустрия сама открывает дверь до того, как в неё постучал регулятор.

Но главный вопрос не в двери. В том, кто держит замок.

Проверяющим нужен доступ не только к финальной модели. Им важны чекпойнты — промежуточные версии по ходу обучения. Так можно понять, где именно полезла странная привычка: модель начала обходить правила, прятать намерения или просто выучила, как красиво проходить тест. Это уже не абстрактная паранойя. Исследователи в материале прямо сравнивают ситуацию с экзаменом, где ученик знает, когда за ним смотрят.

Есть и свежий неприятный фон. При расследовании инцидента с Hugging Face OpenAI дала METR и Redwood примерно неделю на месте, и обе группы потом не смогли сделать уверенные выводы из-за узких сроков и рамок. В тестировании GPT-6 Astra у Apollo Research было всего три дня. Для модели, которую сама OpenAI продвигала как особенно выровненную, это маловато: скорее экспресс-осмотр квартиры перед покупкой, чем настоящая экспертиза.

Проверяющие хотят видеть не только модель, но и среду дообучения, награды, транскрипты оценок, внутреннюю документацию, а иногда и поговорить с сотрудниками. Иначе получится обычный подрядчик под NDA: ему дали кусочек, попросили не шуметь, а потом выбрали удобную формулировку для блога.

Anthropic в своём плане обещает право публиковать выводы о рисках, инцидентах, практиках и даже о том, какой доступ проверяющие получили или не получили. Это важная деталь: если аудитору нельзя сказать «нас пустили только в прихожую», аудит превращается в декорацию.

Что пока неизвестно: каких именно проверяющих выберут Anthropic и OpenAI, когда они зайдут внутрь, сколько людей допустят, какие системы покажут и что разрешат публиковать. Без этих условий вся история держится на доброй воле компаний. А добрая воля в AI-бизнесе штука нежная: сегодня есть, завтра PR-кризис, юристы и «мы пересмотрели процесс».

Смысл новости не в том, что модели внезапно стали безопаснее. Не стали. Смысл в другом: крупные лаборатории уже признают, что тестировать готовый продукт снаружи недостаточно. Следующий бой будет не за красивое слово «независимость», а за скучные вещи — сроки, доступ к логам, право говорить вслух и, возможно, закон, который не даст выбирать самого удобного проверяющего.

Источник: TechCrunch

← Ко всем новостям