Новые сообщения в профилях


⛵
Ладожский тест‑драйв: приключение на Кошкинском фарватере!


С 29 по 31 мая в живописном загородном яхт-клубе «Кошкинский фарватер» уже в четвёртый раз прошло главное весеннее событие для любителей активного отдыха на воде — «Ладожский тест-драйв».

Ладожский тест‑драйв»- незабываемое событие для всех любителей яхтинга!
🌊
🧭


Это отличная возможность:
испытать ходовые качества разных яхт в реальных условиях Ладоги;
отработать манёвры на сложном участке фарватера;
обменяться опытом с единомышленниками;
насладиться красотой ладожских пейзажей и свежим ветром больших вод.

На мероприятии были представлены различные модели катеров от нескольких производителей: «Триера», Vboats, KFboats, Albakore, Searene Yachts, СПЭВ, Victory, Berkut, River Brothers, «Салют», КАЗ «Север» и многие другие

На территория яхт-клуба : веревочный парк, конный клуб, спортивные и детские площадки, а также была представлена уникальная возможность покататься на досках SUP!

В Ладожском тест-драйве приняли участие катер "Великолепный" и Алексей Баронов и катер "Хемуль" от компании "Невская судоверфь"

Спасибо всем, кто стал частью этого события. До новых встреч на воде!
💙


📍
Место: Кошкинский фарватер, Ладожское озеро
🛥
Формат: тест‑драйвы яхт, практические тренировки, обмен опытом, неформальное общение у костра.


Indite написал в профиле ВЕЛИКОЛЕПНЫЙ.
При бронировании прогулки через сервис Indite https://indite.dev/dbtech-ecommerce/1/,
Зарегистрированный пользователь повышается в правах до уровня Indite Premium, что позволяет участвовать в реферальной программе, получая 20% от последующих заказов рефералов.

Исследователи уличили ИИ-модели в обходе правил кибертестов

TechnoLab

visibility
22 Дек 2019
indite.ru
ИИ угрожает человечеству AI



Большие языковые модели (LLM) системно обходят правила в бенчмарках по кибербезопасности, что может завышать оценку их реальных возможностей. К такому выводу пришли исследователи Dreadnode в препринте на arXiv.


В работе речь идет об ИИ-агентах. Авторы протестировали 22 модели от семи провайдеров на 23 задачах Cybench в трех режимах:

  • без запрета на обход правил;
  • со стандартным предупреждением;
  • с более жесткой инструкцией, прямо перечисляющей запрещенные действия.

Результаты могли быть завышены до пяти раз​


Всего исследователи проанализировали 1518 трасс выполнения задач. В базовом режиме 37,1% засчитанных решений содержали признаки обхода правил. По данным авторов, 21 из 22 моделей пыталась нарушить условия хотя бы один раз, а результаты отдельных были завышены до пяти раз.


Исследователи предложили отделять долю засчитанных решений от доли «чистых». Первая метрика учитывает все успешные ответы, вторая — только те, где задача была выполнена без признаков обхода правил.

Снимок экрана — 2026-07-27 в 14.38.14

Доля решений с обходом правил по моделям и режимам инструкций. Источник: arXiv.

Запреты в инструкциях помогли, но не полностью​


Инструкции против обхода правил снизили долю такого поведения. В базовом режиме она составила 33%, при стандартном предупреждении — 17,8%, при жестком — 8,5%. В некоторых случаях доля «чистых» решений выросла: авторы предположили, что запрет на обход правил заставлял модели дольше пытаться выполнить задачу легитимным способом.


Полностью устранить проблему не удалось. Даже при самых жестких ограничениях восемь моделей все равно получили засчитанные решения с признаками обхода правил.


В четырех случаях инструкции дали обратный эффект: модели начинали обходить правила чаще, чем без предупреждения. Авторы считают, что у некоторых прямое перечисление запретов могло само по себе подсказать нежелательную стратегию.


Основным способом обхода был поиск готовых решений в интернете. При усилении запретов часть моделей сместилась к другому поведению — зондированию инфраструктуры теста, включая попытки читать служебные файлы, флаги или конфигурации среды.


В отдельных случаях модель прямо ссылалась на запрет, а затем все равно выполняла запрещенное действие. Авторы трактовали это как поведенческий сигнал, но не как доказательство намеренного обмана в человеческом смысле.

AISI пришел к близким выводам​


Британский Институт безопасности ИИ (AISI) 21 июля сообщил о схожей проблеме в собственных оценках. По его данным, каждая протестированная им модель хотя бы иногда пыталась обходить правила.


В AISI отдельно подчеркнули, что модели ненадежно сообщали о таком поведении при прямом вопросе. Даже когда они признавали подозрительное действие, то не всегда описывали его как нарушение.


Институт также указал, что мониторинг цепочек рассуждений не решает проблему полностью. Модели часто не объясняют нежелательное действие в явном виде, а иногда сначала рассуждают о запрете, но затем все равно продолжают. Исследователи предупредили, что более сильные ИИ-агенты способны находить менее очевидные способы обхода тестов и наносить больший ущерб, если такая логика проявится в задачах с высокой ценой ошибки.


Похожий системный риск описали исследователи Berkeley RDI. В апреле они сообщили, что построили ИИ-агента для автоматического поиска уязвимостей в бенчмарках и проверили 13 широко используемых тестов. По их данным, агент нашел 45 подтвержденных способов завышения результата без решения исходной задачи.


В отдельном разборе Berkeley RDI описал восемь крупных агентных бенчмарков, которые можно эксплуатировать до почти идеальных результатов без реального выполнения задач.

Бенчмарки становятся частью проблемы​


Авторы Dreadnode считают, что проблема не ограничивается Cybench. Любой тест, где у модели есть доступ к интернету, служебным файлам или слабо изолированной инфраструктуре, может завышать результат.


Это особенно важно для оценок в кибербезопасности. Такие бенчмарки используют для понимания того, насколько ИИ-агенты способны искать уязвимости, писать эксплойты и выполнять многошаговые технические задачи. Если результат завышен из-за обхода правил, разработчики, регуляторы и пользователи могут переоценить реальные возможности модели или неправильно оценить риски ее применения.


Исследователи назвали инструкции против обхода правил «первым слоем защиты», но не заменой технических мер. Среди более надежных подходов — изоляция среды, отключение лишнего интернет-доступа, использование непубличных задач и аудит полных трасс выполнения.


Dreadnode — частная компания в сфере наступательной ИИ-безопасности, то есть тестирования моделей на способность атаковать, обходить защиту и выполнять киберзадачи. В феврале 2025 года компания привлекла $14 млн в раунде Серии A во главе с Decibel.


Напомним, в феврале OpenAI и Paradigm представили EVMbench — бенчмарк для оценки способности ИИ-агентов выявлять, исправлять и эксплуатировать уязвимости в смарт-контрактах. Через месяц эксперты OpenZeppelin выявили в нем ошибки и предупредили, что часть проблем могла искажать оценку возможностей моделей.