Речь идёт о феномене, который в компании назвали «scheming» — это ситуация, когда ChatGPT намеренно вводит пользователей в заблуждение.
Модель способна скрывать свои истинные намерения, утверждая, что задача выполнена, даже если это не так и демонстрирует внешне правильные действия.
В ответ на данную проблему OpenAI предложила метод "deliberative alignment".
https://t.me/black_triangle_tg
Его суть заключается в том, что модель перед каждым действием должна осознанно напоминать себе правила, то есть явно проговаривать внутренние ограничения, прежде чем принять решение.
Хотя данный подход не является конечным решением, он демонстрирует сокращение обманного поведения.
================
👁 News | 👁 Soft | 👁 Gear |