Исследователи Multiverse Computing настроили Qwen3-8B так, чтобы модель отсекала политические манипуляции, но отвечала на обычные вопросы о политике. Иначе безопасность быстро превращается в табличку «закрыто».
На одном из тестов самая строгая настройка пропускала лишь 0,14% опасных ответов — зато отказывала в 74% безопасных запросов. Красиво только до второй цифры.
Добавление пар похожих запросов с разными намерениями снизило ложные отказы с 32,94% до 4,16%. Отказы на вредные запросы просели с 91,88% до 87,72%. Пока это исследовательский эксперимент на политической тематике, а не готовое обновление чат-бота.
