Microsoft опубликовал черновик кодекса для моделей MAI. В нём расписано, кому они подчиняются, где обязаны отказать и почему команда пользователя — не главный закон.
Наверху стоит сам кодекс. Ниже — настройки разработчика, затем запрос пользователя. Если просьба упирается в жёсткий запрет, модель должна её отклонить. Даже когда из-за этого задача останется несделанной.
Список красных линий широкий: оружие массового поражения, рабочие инструменты для кибератак, вредная массовая манипуляция и опасные дипфейки. При этом защитный аудит, поиск уязвимостей и анализ вредоносного ПО не запрещены целиком. Решает контекст и наличие разрешения. Обсудить устройство замка можно, помочь вскрыть чужую дверь — уже нет.
Особое внимание досталось агентам, которые вызывают инструменты и выполняют действия. Им предписано не расширять задачу по собственной инициативе, не повышать себе доступ, не заметать следы и останавливаться после команды пользователя. Для системных операций нужен минимальный уровень прав, а последствия необратимых действий следует показать человеку заранее. Тайный язык между агентами тоже не приветствуется: если журнал нельзя прочитать, надзор превращается в декорацию.
Но работающего защитного механизма Microsoft пока не выпустил. Нынешние модели на этом документе не обучены, а описанное поведение не гарантировано. Сам кодекс назван одновременно ориентиром и желаемым состоянием. Оценки ещё не покрывают все правила, опубликованные примеры — синтетические.
Есть и важная граница охвата. Кодекс предназначен для моделей, созданных Microsoft AI. Сторонняя модель не становится MAI только потому, что Microsoft разместил её в облаке или встроил в свой сервис.
Черновик открыт для обсуждения на шесть недель. Поэтому перед нами не обновление Copilot и не новая кнопка безопасности, а публичное техническое задание самой себе. Полезное, подробное — и пока бумажное.
