SNU研究者发布1B纯音频训练语言模型Sori-1B
原文:snkii/Sori-1B: Audio-Grounded LM Trained From Scratch (No Text-Only Pretraining)
Sori-1B 是一个由首尔国立大学(SNU)一位研究员独立开发的 10 亿参数音频语言模型,其最大的卖点是解码器完全基于音频配对文本从零训练——没有纯文本预训练,也没有预训练 LLM 初始化——其理念是:一个只在声音伴随下见过文本的语言模型,会真正将回答建立在音频之上,而不是像典型的 AF3 风格模型那样依赖纯文本先验(他们展示了当音频被替换为静音时,AF3 仍保留其高于随机水平 MMAU 成绩的约 74%)。模型复用了 NVIDIA 冻结的 Audio Flamingo Next 编码器(占 61.5% 参数,未做改动),其余部分——解码器、嵌入层、输出头,以及一个基于音频概念类别而非文本衍生词表构建的自定义“听觉本体”分词器——全部从零训练,仅用 3 张 RTX 4090 在约 7400 小时 / 475 万条样本上完成。它支持选择题、开放式问答、字幕生成和 ASR 模式,附带推理端点处理器和一个合成音频终端演示,还包含 MMAU test-mini 评估脚本,但权重在非商业/仅限学术许可下受限发布(因为它在 NVIDIA OneWay 非商业条款下重新分发了 NVIDIA 的编码器),且仓库本身标记为“即将推出”。由 /u/Balance- 提交