← 返回信息流
模型 arXiv 论文 · Carlos Bain, Max Bain 2026-08-31 17:59 🔥 热度 3

面向 WhisperX 的上下文感知交错批处理

WhisperX引入上下文感知交错批处理,提升语音转写连贯性

原文:Context-Aware Interleaved Batching for WhisperX

WhisperX 通过音频内批处理加速语音转录,但它将音频片段隔离开来,丢失了连贯标点和术语转录所需的历史上下文。相反,标准 Whisper 虽然能顺序保留上下文,却推理缓慢且易出现幻觉循环。为了兼得两者优势,我们提出了上下文感知交错批处理(Context-Aware Interleaved Batching)。通过利用 VAD 导出的片段边界,我们的算法稳定了 Whisper 的文本条件输入,使其能够安全地在批处理的音频片段之间保持连续的历史上下文。在长音频基准测试中,该方法降低了词错误率(WER),提升了专有名词的转录质量,同时保持了高吞吐量的推理速度。作者:Carlos Bain, Max Bain 分类:cs.CL

查看原文 ↗ 技术论文多模态

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 19 还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 热度 9 世界模型与大模型安全风险到底哪里不同 热度 8 李飞飞发布:全球首个多模态世界模型 热度 8 【精翻】C4D 如何将 AI 模型转化为电影级 3D 动画 热度 8