← 返回信息流
模型 Reddit-LocalLLaMA · /u/Balance- 2026-08-31 02:48 🔥 热度 5

snkii/Sori-1B:从零训练的音频接地语言模型(无纯文本预训练)

SNU研究者发布1B纯音频训练语言模型Sori-1B

原文:snkii/Sori-1B: Audio-Grounded LM Trained From Scratch (No Text-Only Pretraining)

Sori-1B 是一个由首尔国立大学(SNU)一位研究员独立开发的 10 亿参数音频语言模型,其最大的卖点是解码器完全基于音频配对文本从零训练——没有纯文本预训练,也没有预训练 LLM 初始化——其理念是:一个只在声音伴随下见过文本的语言模型,会真正将回答建立在音频之上,而不是像典型的 AF3 风格模型那样依赖纯文本先验(他们展示了当音频被替换为静音时,AF3 仍保留其高于随机水平 MMAU 成绩的约 74%)。模型复用了 NVIDIA 冻结的 Audio Flamingo Next 编码器(占 61.5% 参数,未做改动),其余部分——解码器、嵌入层、输出头,以及一个基于音频概念类别而非文本衍生词表构建的自定义“听觉本体”分词器——全部从零训练,仅用 3 张 RTX 4090 在约 7400 小时 / 475 万条样本上完成。它支持选择题、开放式问答、字幕生成和 ASR 模式,附带推理端点处理器和一个合成音频终端演示,还包含 MMAU test-mini 评估脚本,但权重在非商业/仅限学术许可下受限发布(因为它在 NVIDIA OneWay 非商业条款下重新分发了 NVIDIA 的编码器),且仓库本身标记为“即将推出”。由 /u/Balance- 提交

🖼 相关图片

查看原文 ↗ 多模态

📌 相关阅读

如何让非遗对话?基于 Gemma 4开放 大模型 ,画剪纸、舞唐俑、诵古诗,让传统活在当下! 热度 9 非遗如何能有新生机?基于 Gemma 4开放 大模型 ,手绘剪纸、隔空舞唐俑、读诗唤风雪! 热度 9 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp · Hugging Face 热度 6 国内首部AI生成长剧《兴安西传》今日开播,首创“边审边播”新模式 热度 6 中国首部AIGC长剧《西游记后传》今日首播,同时也是首部“边审边播”的剧集 热度 6