开源Qwen3.5-0.8B的dictation cleanup微调模型SpeakoFlow Mini
原文:I fine-tuned a 0.8B local model for dictation cleanup. It matched a hosted frontier model on this narrow task
我构建了 SpeakoFlow Mini,这是 Qwen3.5-0.8B 的 Apache-2.0 微调版本,用于听写清理。它不是一个聊天模型或通用改写器。它接受语音转文本的输出,应用说话者实际进行的更正,并保留其他所有内容。最后一部分比听起来更难。通用模型通常会过度润色已经正确的内容,但在听写中,不必要的改进仍然是一个错误的编辑。例如:输入:截止日期是星期一。取消。那,截止日期是星期三。输出:截止日期是星期三。在我的专门的仅限英语基准测试中,SpeakoFlow Mini 得分为 70.7%,而 GPT-5.6 Luna 得分为 65.0%。两者都使用了相同的固定短提示,并且禁用了推理。差距是 +5.8 分,但 95% 区间是 [-1.5, +12.9],所以这是一个统计上的平局,而不是胜利。这种设置很重要。这是该模型训练的低开销配置。使用更长的提示和推理预算,Luna 会做得更好。对于这里未涵盖的异常情况,它也是更好的模型。声明范围更窄。在一个固定的短提示下,没有推理预算,一个本地运行的 0.8B 模型在这项任务上与托管的前沿模型相匹配。与未调整的 Qwen3.5-0.8B 基线相比,微调将得分从 47.3% 提高到 70.7%,增加了 +23.4 分,95% 区间为 [+16.3, +30.3]。第二张图片显示了这种比较。Q8_0 版本是 833 MB,并且完全离线运行。Hugging Face 卡片上有模型文件、运行命令、基准测试方法、量化结果、限制和公共示例:https://huggingface.co/SpeakoFlow/speakoflow-mini 评估集不是公开版本的一部分。如果你尝试它,我最感兴趣的是它更改了应该保留的内容。披露:我构建了 SpeakoFlow Mini 和 SpeakoFlow。由 /u/MoodOdd9657 提交 [链接] [评论]