Создатели TikTok представили X-Omni — новую Open Source модель генерации изображений
Эта система успешно совмещает семантическое планирование с диффузионными моделями
, что позволяет избежать ошибок и несоответствий токенов
.

Сначала X‑Omni формирует семантические токены, затем диффузионный декодер превращает их в изображения.

Система оценки даёт обратную связь о качестве, и автогенеративная модель учится производить такие токены, которые декодер сможет использовать максимально эффективно.

Уже через 200 итераций X‑Omni превосходит результаты обычного гибридного подхода.
Система уже доступна на платформах
Hugging Face и
GitHub, открывая новые горизонты для разработчиков и исследователей в области ИИ
.
================
👁
News | 👁
Soft | 👁
Gear |
Links