Помимо использования текстового промта для создания аудио, инструмент DeepMind также учитывает содержимое видео.
Пользователям также не нужно тщательно сопоставлять сгенерированный звук с соответствующими сценами.
DeepMind также отмечает, что ее система преобразования видео в аудио зависит от качества видео, поэтому все зернистое или искаженное «может привести к заметному снижению качества звука».
Инструмент DeepMind пока недоступен, поскольку ему еще предстоит пройти «строгие оценки и испытания безопасности».
Когда он станет доступен, его аудиовыход будет включать водяной знак Google SynthID, указывающий на то, что он создан искусственным интеллектом.