跨架构与噪声分析神经音频编解码令牌的统计特性
原文:Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions
神经音频编解码器(NAC)将语音转换为离散词元序列,此前有研究报道这些序列遵循类语言的统计规律。本文分析了13种NAC的词元统计特性,涵盖多码本残差向量量化(RVQ)、单码本VQ以及非VQ设计,并在三个语料库上于干净、白噪声和真实世界DEMAND噪声条件下进行评估。我们在匹配的词元样本上估计了Zipf和Heaps参数、一元熵、码本占用率以及Jensen-Shannon散度(JSD),并采用明确的拟合有效性保障和按族条件化的n元阶数。语料库身份在任何指标上都只能解释很小的方差,而声学条件和量化器元类别则以依赖于指标的方式占据主导,其中一元熵是与元类别关联最强的指标。在相同一元阶数下计算的干净到噪声的JSD,与mel倒谱失真的关联在DEMAND噪声下最为明显。此前报道的RVQ编解码器的坍缩和爆炸式退化特征,分别在白噪声和DEMAND噪声下集中于RVQ单元;爆炸特征也出现在非VQ编解码器中,而单码本VQ编解码器在占用率和分布形状上发生偏移,却不呈现上述任一特征。这些结果为将语言统计分析应用于NAC词元提供了以架构为条件的规范。作者:Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito 分类:cs.CL,cs.SD