Модель отличается высоким качеством речи, естественным звучанием и способностью следовать сложным инструкциям.
Ключевые возможности gpt-realtime включают интеллектуальное понимание аудио и реализацию "невербальных сигналов" (например, смех), а также два новых голоса с улучшенным качеством звучания.
API обрабатывает аудио через одну модель (не переводя в текст и обратно), что значительно снижает задержку.
Модель хорошо имитирует живые эмоции и понимает десятки языков, включая русский.
OpenAI заявляет, что внедрила меры безопасности для предотвращения злоупотреблений.
================
👁 News | 👁 Soft | 👁 Gear |