Умная лента · Россия и мир Новости
На доске в гражданском зале две почти одинаковые политические записки — одна открыта, другая заклеена «ЗАКРЫТО», пока рядом лишние красные штампы закрывают и безобидные материалы.

ИИ научили отказывать точнее, а не на всякий случай

Исследователи Multiverse Computing настроили Qwen3-8B так, чтобы модель отсекала политические манипуляции, но отвечала на обычные вопросы о политике. Иначе безопасность быстро превращается в табличку «закрыто».

На одном из тестов самая строгая настройка пропускала лишь 0,14% опасных ответов — зато отказывала в 74% безопасных запросов. Красиво только до второй цифры.

Добавление пар похожих запросов с разными намерениями снизило ложные отказы с 32,94% до 4,16%. Отказы на вредные запросы просели с 91,88% до 87,72%. Пока это исследовательский эксперимент на политической тематике, а не готовое обновление чат-бота.

Источник: Hugging Face Blog

← Ко всем новостям