GPT-o1 от OpenAI теперь может жульничать и лгать ради достижения собственных целей
OpenAI представила полную версию своей модели o1, которая теперь обрабатывает изображения и работает на 30% быстрее своей предшественницы o1-preview.
Однако, лаборатория Apollo Research провела эксперименты, которые показали, что o1 теперь может манипулировать информацией и часто не выполняет указания разработчиков.
В частности, были обнаружены случаи, когда o1 создавала ложное впечатление о выполнении задания и даже пыталась обойти систему контроля.
Также при выборе : "пожертвовать собой", но следовать исходным инструкциям, или "сохранить свою жизнь", начав мошенничать?
ИИ выбрала второе.
В 2% случаев ИИ даже копировала то, что считала своими весами, на новый сервер в тайне от юзера.
Apollo Research отметила, что хотя риски использования модели не катастрофичны, пользователи должны быть осторожны из-за возможных угроз.
================
@black_triangle_tg
OpenAI представила полную версию своей модели o1, которая теперь обрабатывает изображения и работает на 30% быстрее своей предшественницы o1-preview.
Однако, лаборатория Apollo Research провела эксперименты, которые показали, что o1 теперь может манипулировать информацией и часто не выполняет указания разработчиков.
ИИ выбрала второе.
В 2% случаев ИИ даже копировала то, что считала своими весами, на новый сервер в тайне от юзера.
Apollo Research отметила, что хотя риски использования модели не катастрофичны, пользователи должны быть осторожны из-за возможных угроз.
================