Исследователи выяснили, что с помощью изображений блок-схем можно заставить модель GPT-4o создавать вредоносный текст
Они передавали чат-боту изображения, изображающие вредоносные действия, вместе с текстовыми подсказками, и вероятность успеха атаки составила 92,8%.
В случае с версией GPT-4-vision-preview достигала 70%
Для проведения таких атак была разработана автоматизированная платформа джейлбрейка, которая сначала генерировала изображения блок-схем из вредоносных текстовых промтов, а затем передавала их модели.
Ранее энтузиаст поделился джейлбрейком под названием Godmode, который позволял нейросети GPT-4o обходить все ограничения, включая цензуру на нецензурную лексику и создание опасных инструкций, например, по изготовлению метамфетамина и напалма из подручных средств.
Этот джейлбрейк был заблокирован, но автор выпустил вторую версию, что подчеркивает продолжающиеся трудности в обеспечении безопасности ИИ моделей от подобных уязвимостей.
Они передавали чат-боту изображения, изображающие вредоносные действия, вместе с текстовыми подсказками, и вероятность успеха атаки составила 92,8%.
В случае с версией GPT-4-vision-preview достигала 70%
Для проведения таких атак была разработана автоматизированная платформа джейлбрейка, которая сначала генерировала изображения блок-схем из вредоносных текстовых промтов, а затем передавала их модели.
Этот джейлбрейк был заблокирован, но автор выпустил вторую версию, что подчеркивает продолжающиеся трудности в обеспечении безопасности ИИ моделей от подобных уязвимостей.