← 返回信息流
模型 arXiv 论文 · Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang 2026-08-31 17:11 🔥 热度 3

DreamX-Creator:让 2K 分辨率的原生音视频生成平民化

DreamX-Creator实现2K分辨率原生音视频联合生成

原文:DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

近来的视频生成器常常省略音频,或在单独的阶段合成音频,限制了对视觉动态与声学事件之间相互建模的能力。我们推出 DreamX-Creator 1.0,一个以 7B 生成器为核心的紧凑型原生音视频联合生成系统。该生成器以首帧和文本提示为条件,联合去噪模态专用的音频和视频流。两条流在网络前半部分独立处理,在后半部分通过门控跨模态注意力(Gated Cross-Modal Attention)耦合,其基于 token 和注意力头的输出门控调制每个激活的跨模态注意力头输出。统一的音视频数据系统构建并筛选时间连贯的片段,生成结构化多模态标注,并将片段组织成面向能力的数据池。渐进式联合训练包括两个音视频预训练阶段,随后是高质量微调。音视频强化学习通过模态感知的多模态反馈对生成器进一步后训练,将视频、音频及跨模态反馈路由到对应的流。在高分辨率输出方面,我们的自回归一步式 2K 精修(Autoregressive 1-Step 2K Refinement)流水线将双向多步教师模型改造为自回归多步精修器,并将其蒸馏为每个时间块只需一次去噪评估的学生模型。总体而言,DreamX-Creator 1.0 实现了原生的、同步的音视频生成,性能可与最先进的开源系统媲美。通过发布紧凑的 7B 生成器和 2K 精修器,我们希望推动原生音视频生成的普及,为统一音视频生成式建模的未来研究提供可获取的基础。作者:Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang 分类:cs.CV, cs.SD

查看原文 ↗ 大模型发布多模态

📌 相关阅读

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:编程基准翻倍,缓存读取成本直降 75% 热度 24 GPT-6 热度 13 “鼎犀智创”完成数亿元Pre-A轮融资 热度 9 【RAG实战】B站最全最细的 大模型 RAG私有知识库搭建零基础到实战全教程!手把手带你结合企业级项目实战完成一套完整的RAG项目!增加检索/文本向量/知识库搭建 热度 9 【全748集】目前B站最全最细的 AI大模型 零基础全套教程,2026最新版,包含所有干货!七天就能从小白到大神!少走99%的弯路!存下吧!很难找全的! 热度 9