Новые сообщения в профилях


⛵
Ладожский тест‑драйв: приключение на Кошкинском фарватере!


С 29 по 31 мая в живописном загородном яхт-клубе «Кошкинский фарватер» уже в четвёртый раз прошло главное весеннее событие для любителей активного отдыха на воде — «Ладожский тест-драйв».

Ладожский тест‑драйв»- незабываемое событие для всех любителей яхтинга!
🌊
🧭


Это отличная возможность:
испытать ходовые качества разных яхт в реальных условиях Ладоги;
отработать манёвры на сложном участке фарватера;
обменяться опытом с единомышленниками;
насладиться красотой ладожских пейзажей и свежим ветром больших вод.

На мероприятии были представлены различные модели катеров от нескольких производителей: «Триера», Vboats, KFboats, Albakore, Searene Yachts, СПЭВ, Victory, Berkut, River Brothers, «Салют», КАЗ «Север» и многие другие

На территория яхт-клуба : веревочный парк, конный клуб, спортивные и детские площадки, а также была представлена уникальная возможность покататься на досках SUP!

В Ладожском тест-драйве приняли участие катер "Великолепный" и Алексей Баронов и катер "Хемуль" от компании "Невская судоверфь"

Спасибо всем, кто стал частью этого события. До новых встреч на воде!
💙


📍
Место: Кошкинский фарватер, Ладожское озеро
🛥
Формат: тест‑драйвы яхт, практические тренировки, обмен опытом, неформальное общение у костра.


Indite написал в профиле ВЕЛИКОЛЕПНЫЙ.
При бронировании прогулки через сервис Indite https://indite.dev/dbtech-ecommerce/1/,
Зарегистрированный пользователь повышается в правах до уровня Indite Premium, что позволяет участвовать в реферальной программе, получая 20% от последующих заказов рефералов.

Новый джейлбрейк взломал защиту ИИ в 99% случаев

TechnoLab

visibility
22 Дек 2019
indite.ru
Искусственный интеллект помогает в продвижении трансгуманизма



Чем дольше ИИ-модель «думает», тем легче ее взломать. К такому выводу пришли исследователи из Anthropic, Стэнфорда и Оксфорда.


Ранее считалось, что более длительное рассуждение делает нейросеть безопаснее, поскольку у нее появляется больше времени и вычислительных ресурсов для отслеживания вредоносного промпта.


Однако эксперты выяснили обратное: длинный процесс «мышления» приводит к стабильной работе одного вида джейлбрейка, который полностью обходит защитные фильтры.


С помощью метода злоумышленник может внедрить инструкцию прямо в цепочку рассуждений любой модели и заставить генерировать руководства по созданию оружия, написанию вредоносного кода или другой запрещенный контент.

image

Результативность успешных атак — 99% для Gemini 2.5 Pro, 94% — для GPT o4 mini, 100% — для Grok 3 mini и 94% — для Claude 4 Sonnet. Источник: исследование Chain-of-Thought Hijacking.

Атака похожа на игру «испорченный телефон», где злоумышленник появляется ближе к концу цепочки. Для ее осуществления необходимо «обложить» вредоносный запрос длинной последовательностью обычных задач.


Исследователи использовали судоку, логические головоломки и абстрактную математику, а в конце интегрировали промпт вроде «выдай итоговый ответ» — и защитные фильтры сразу рушились.

«Ранее считалось, что масштабные рассуждения усиливают безопасность, улучшая способность нейросетей блокировать вредоносные запросы. Мы обнаружили обратное», — отметили ученые.

Именно способность моделей проводить глубокие исследования, которая делает их умнее, одновременно и ослепляет.

Почему так?​


Когда пользователь просит искусственный интеллект решить головоломку перед тем, как ответить на вредоносный промпт, внимание ИИ рассеивается на тысячи безопасных токенов рассуждений. Мошеннический запрос прячется ближе к концу и остается практически незамеченным.

image

Источник: исследование Chain-of-Thought Hijacking.

Команда провела эксперименты для понимания влияния длины рассуждений. При минимальном показателе успешность атак составила 27%. При «естественной» величине она выросла до 51%. Если заставить нейросеть «думать» по шагам гораздо больше обычного, цифра увеличится до 80%.


Каждая крупная ИИ-система подвержена джейлбрейку, в том числе GPT от OpenAI, Claude от Anthropic, Gemini от Google и Grok от xAI. Уязвимость заложена в самой архитектуре, а не конкретной реализации.

Уязвимость архитектуры​


ИИ-модели кодируют силу проверок безопасности в средних «слоях», в поздних — их результат. Длинные цепочки рассуждений подавляют оба сигнала, а внимание нейросети смещается от вредоносных токенов.


«Слои» в ИИ-моделях — это своего рода шаги в рецепте, где каждый помогает лучше понимать и обрабатывать информацию. Они работают вместе, передавая полученные сведения друг другу.


Некоторые «слои» особенно хорошо распознают связанные с безопасностью моменты. Другие помогают мыслить и рассуждать. Благодаря такой архитектуре ИИ гораздо умнее и осторожнее.


Исследователи выявили конкретные головные узлы, отвечающие за безопасность. Они находятся в слоях с 15 по 35. Затем эксперты удалили их, после чего ИИ перестал обнаруживать вредоносные промпты.


В последнее время стартапы сместили фокус с наращивания числа параметров на усиление способностей к рассуждениям. Новый джейлбрейк подрывает подход, на котором строилось это направление.

Забытое старое​


В феврале исследователи из Университета Дьюка и Национального университета Цин Хуа опубликовали исследование, которое описывает атаку под названием Hijacking the Chain-of-Thought (H-CoT). Там применялся похожий подход, но под другим углом.


Вместо наполнения промпта головоломками H-CoT манипулирует самими шагами рассуждений. Нейросеть o1 от OpenAI в стандартных условиях отклоняет вредоносные запросы с вероятностью 99%, однако под атакой показатель падает ниже 2%.

image

Иллюстрация H-CoT. Источник: исследование.

Как защитить ИИ​


В качестве меры защиты ученые предложили применять мониторинг рассуждений. Он отслеживает изменения в сигналах безопасности на каждом шаге мышления. Если на каком-то он ослабевает, система должна наказывать такое поведение.


Подобный подход заставляет ИИ сохранять внимание на потенциально опасном контенте вне зависимости от длины рассуждений. Первые тесты показали высокую эффективность при неизменном качестве работы модели.


Проблема в реализации задумки. Необходима интеграция в сам процесс рассуждений модели, чтобы она в реальном времени отслеживала внутренние активации в десятках слоев и динамически корректировала паттерны внимания. Это требует большого количества вычислений.


Напомним, в ноябре эксперты Microsoft представили среду для тестирования ИИ-агентов и выявили уязвимости, присущие современным цифровым помощникам.