← 返回信息流
模型 arXiv 论文 · Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito 2026-08-31 16:15 🔥 热度 5

跨架构、语料库与噪声条件的神经音频编解码器词元语言统计分析

跨架构与噪声分析神经音频编解码令牌的统计特性

原文:Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions

神经音频编解码器(NAC)将语音转换为离散词元序列,此前有研究报道这些序列遵循类语言的统计规律。本文分析了13种NAC的词元统计特性,涵盖多码本残差向量量化(RVQ)、单码本VQ以及非VQ设计,并在三个语料库上于干净、白噪声和真实世界DEMAND噪声条件下进行评估。我们在匹配的词元样本上估计了Zipf和Heaps参数、一元熵、码本占用率以及Jensen-Shannon散度(JSD),并采用明确的拟合有效性保障和按族条件化的n元阶数。语料库身份在任何指标上都只能解释很小的方差,而声学条件和量化器元类别则以依赖于指标的方式占据主导,其中一元熵是与元类别关联最强的指标。在相同一元阶数下计算的干净到噪声的JSD,与mel倒谱失真的关联在DEMAND噪声下最为明显。此前报道的RVQ编解码器的坍缩和爆炸式退化特征,分别在白噪声和DEMAND噪声下集中于RVQ单元;爆炸特征也出现在非VQ编解码器中,而单码本VQ编解码器在占用率和分布形状上发生偏移,却不呈现上述任一特征。这些结果为将语言统计分析应用于NAC词元提供了以架构为条件的规范。作者:Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito 分类:cs.CL,cs.SD

查看原文 ↗ 技术论文多模态

📌 相关阅读

3秒出片比播放还快,MiniMax打开了AI视频的实时商业化路径 热度 9 FastVideo-MiniMax-H3,融合模型,数字人,全能参考,文图生视频,8G显存可用,自动补帧,超分放大,首尾帧,自动提示词,多任务队列 热度 9 视频 模型 大PK!谁能兼顾价格、速度、效果? 热度 9 218. 大模型 的训练、推理、SFT、强化学习究竟有什么区别?【每天一个宝藏问题】 热度 9 基于多模态 Qwen3‑VL 大模型 微调实战|环境搭建、数据集处理、 模型 训练、部署推理【码士集团】 热度 9