利用视觉相似性提升像素级语言模型跨语言迁移
原文:Seeing the Unseen: Visual Similarity for Pixel Language Model Adaptation
基于像素的语言模型(LM)通过处理文本渲染图像来取代传统的分词器,这使得跨语言迁移高度依赖于书写系统的视觉与结构特性。然而,将这些模型适配到形态复杂、使用独特文字的低资源语言的动态过程尚未被探索。以藏语为案例,我们分析了基于像素的语言模型的持续预训练如何受数据规模、初始文字暴露程度以及来自其他婆罗米系文字语言的跨语言迁移的影响。我们引入四个渲染层面的指标来量化文字的视觉相似性,并在三项任务上评估下游性能。结果表明,更高的正字法接近度能增强语义迁移,即使在数据严重受限的情况下也是如此。此外,我们发现基于预训练起点的性能不对称性:多语言预训练模型PIXEL-M4具有更强的初始性能,但其后续适配能力似乎受限;而将单语模型PIXEL用混合文字进行适配,则在句子级任务上带来更多收益。我们的指标与案例研究提供了实证观察,可为在类似低资源场景下使用像素模型时的数据选择和文字适配决策提供参考。作者:Ran Zhang, Miryam de Lhoneux, Wessel Poelman