Цензуру языковых моделей можно обойти с помощью ASCII-арта
Исследователи из университетов Вашингтона и Чикаго смогли обойти цензуру больших языковых моделей с помощью символов ASCII.
Они обнаружили, что, используя стоп-слова как рисунки (с помощью символов в формате ASCII), нейронные сети будут отвечать на запрещенные вопросы.
Используя этот хак, исследователи получили инструкции по изготовлению поддельных деньги от ChatGPT.
Этот метод названный «ArtPrompt» оказался более эффективным, чем все известные способы обхода фильтров.
Исследователи из университетов Вашингтона и Чикаго смогли обойти цензуру больших языковых моделей с помощью символов ASCII.