研究表明带sinks的滑窗注意力在长上下文推理上不逊线性注意力
原文:Sliding-window attention beats linear on long-context reasoning [R]
带 sinks 的滑动窗口注意力(SWA)是解决 LLM 二次方计算成本问题的最简单方案之一,其表现不逊于、甚至优于那些实验室投入大量后训练算力开发的线性注意力变体。这是 Alexia Jolicoeur-Martineau、Rhea Sanjay Sukthanker、Pashmina Cameron 和 Emy Gervais 的一篇新 arXiv 预印本的结论。在论文重点考察的长上下文推理基准上,差距并不接近。摘要指出:"SWA 实现了大幅领先的性能(比线性注意力高2到10倍)",并列出 Needle-in-a-Haystack 和 BABILong 这两项任务。论文的核心论点是:整个"后训练转线性"的流水线一直是用错误的基准来评估的。作者写道:"这一研究方向从未与更简单的基线进行过恰当的比较。"他们的替代方案无需后训练、运行速度快、内存占用低。建议非常直白:"我们强烈建议转向 SWA,而不是对线性模型进行后训练。"摘要也承认,线性注意力"或许显示出一些前景,但它们很可能需要从头训练或大量后训练,才能勉强与 SWA 匹敌。"