DreamX-Creator实现2K分辨率原生音视频联合生成
原文:DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
近来的视频生成器常常省略音频,或在单独的阶段合成音频,限制了对视觉动态与声学事件之间相互建模的能力。我们推出 DreamX-Creator 1.0,一个以 7B 生成器为核心的紧凑型原生音视频联合生成系统。该生成器以首帧和文本提示为条件,联合去噪模态专用的音频和视频流。两条流在网络前半部分独立处理,在后半部分通过门控跨模态注意力(Gated Cross-Modal Attention)耦合,其基于 token 和注意力头的输出门控调制每个激活的跨模态注意力头输出。统一的音视频数据系统构建并筛选时间连贯的片段,生成结构化多模态标注,并将片段组织成面向能力的数据池。渐进式联合训练包括两个音视频预训练阶段,随后是高质量微调。音视频强化学习通过模态感知的多模态反馈对生成器进一步后训练,将视频、音频及跨模态反馈路由到对应的流。在高分辨率输出方面,我们的自回归一步式 2K 精修(Autoregressive 1-Step 2K Refinement)流水线将双向多步教师模型改造为自回归多步精修器,并将其蒸馏为每个时间块只需一次去噪评估的学生模型。总体而言,DreamX-Creator 1.0 实现了原生的、同步的音视频生成,性能可与最先进的开源系统媲美。通过发布紧凑的 7B 生成器和 2K 精修器,我们希望推动原生音视频生成的普及,为统一音视频生成式建模的未来研究提供可获取的基础。作者:Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang 分类:cs.CV, cs.SD