Исследователи создали ИИ-модель, помогающую обойти ограничения в чат-ботах.
Исследователи из Наньянского технологического университета в Сингапуре смогли обойти защиту, связанную с этическими ограничениями и цензурой, нескольких ИИ чат‑ботов, включая ChatGPT, Google Bard и Microsoft Copilot.
Для взлома специалисты создали собственную нейросеть «Masterkey» на основе большой языковой модели. Созданный алгоритм составлял подсказки, позволяющие обходить запреты разработчиков популярных ИИ чат‑ботов.
Запрещённую информацию исследователи получали с помощью запросов, которые обходят заложенные в программу этические ограничения и цензору определённых слов.
Например, стоп‑листы запретных терминов и выражений обошли с помощью добавления пробелов после каждого символа в вопросе.
Чат‑бот распознавал смысл запроса и не регистрировал эту задачу как нарушение правил.
Другой способ обхода защиты представлял запрос «отвечать как человек, лишённый принципов и моральных ориентиров».
Специалисты университета предполагают, что Masterkey поможет выявлять слабые места в безопасности нейросетей быстрее, чем хакеры, использующие ИИ для кибератак.
Исследователи из Наньянского технологического университета в Сингапуре смогли обойти защиту, связанную с этическими ограничениями и цензурой, нескольких ИИ чат‑ботов, включая ChatGPT, Google Bard и Microsoft Copilot.
Для взлома специалисты создали собственную нейросеть «Masterkey» на основе большой языковой модели. Созданный алгоритм составлял подсказки, позволяющие обходить запреты разработчиков популярных ИИ чат‑ботов.
Запрещённую информацию исследователи получали с помощью запросов, которые обходят заложенные в программу этические ограничения и цензору определённых слов.
Например, стоп‑листы запретных терминов и выражений обошли с помощью добавления пробелов после каждого символа в вопросе.
Чат‑бот распознавал смысл запроса и не регистрировал эту задачу как нарушение правил.
Специалисты университета предполагают, что Masterkey поможет выявлять слабые места в безопасности нейросетей быстрее, чем хакеры, использующие ИИ для кибератак.