HuMo позволяет создавать видеоконтент с участием человека, используя текстовое, визуальное и аудио управление.
На вход можно подавать комбинации текст + изображение, текст + аудио или даже текст + изображение + аудио.
Модель также обладает способностью сохранять образы персонажей и синхронизировать их движения с аудио, что значительно увеличивает уровень реализма.
Созданная на основе технологий Wan 2.1 и Whisper Large v3, HuMo обеспечивает высокое качество распознавания аудио и точное моделирование движений.
Эта модель подходит как для развлекательного, так и для профессионального контента.
Попробовать возможности HuMo можно на платформе Hugging Face
================
👁 News | 👁 Soft | 👁 Gear |
Video is too big
![]()