Команда ученых разработала модель, способную соревноваться в популярной игре Among Us, используя исключительно метод обучения с подкреплением, без каких-либо размеченных данных.
Эта модель научилась общаться, убеждать, лгать, манипулировать и предсказывать, кто является предателем, имитируя человеческое поведение.
В ходе симуляционных игр она продемонстрировала впечатляющие 56% побед, а в поединках с реальными игроками — 45%!
Хотя люди все еще чаще выходят победителями, разрыв в успехах заметно сократился, подчеркивая потенциал языковых моделей в социальном взаимодействии и самообучении без необходимости в размеченных данных.
Код модели доступен на GitHub, а предварительно обученные версии на HuggingFace.
================
👁 News | 👁 Soft | 👁 Gear |