← 返回信息流
论文 arXiv 论文 · Ran Zhang, Miryam de Lhoneux, Wessel Poelman 2026-08-31 10:11 🔥 热度 5

看见不可见之物:利用视觉相似性实现像素语言模型适配

利用视觉相似性提升像素级语言模型跨语言迁移

原文:Seeing the Unseen: Visual Similarity for Pixel Language Model Adaptation

基于像素的语言模型(LM)通过处理文本渲染图像来取代传统的分词器,这使得跨语言迁移高度依赖于书写系统的视觉与结构特性。然而,将这些模型适配到形态复杂、使用独特文字的低资源语言的动态过程尚未被探索。以藏语为案例,我们分析了基于像素的语言模型的持续预训练如何受数据规模、初始文字暴露程度以及来自其他婆罗米系文字语言的跨语言迁移的影响。我们引入四个渲染层面的指标来量化文字的视觉相似性,并在三项任务上评估下游性能。结果表明,更高的正字法接近度能增强语义迁移,即使在数据严重受限的情况下也是如此。此外,我们发现基于预训练起点的性能不对称性:多语言预训练模型PIXEL-M4具有更强的初始性能,但其后续适配能力似乎受限;而将单语模型PIXEL用混合文字进行适配,则在句子级任务上带来更多收益。我们的指标与案例研究提供了实证观察,可为在类似低资源场景下使用像素模型时的数据选择和文字适配决策提供参考。作者:Ran Zhang, Miryam de Lhoneux, Wessel Poelman

查看原文 ↗ 技术论文

📌 相关阅读

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 10 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 10 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 9 【中/英】 AI 时代,类型检查会变得更重要吗?🤔 热度 9