← 返回信息流
论文 Reddit-MachineLearning · /u/Justgototheeffinmoon 2026-08-31 16:35 🔥 热度 6

滑动窗口注意力在长上下文推理上胜过线性注意力

研究表明带sinks的滑窗注意力在长上下文推理上不逊线性注意力

原文:Sliding-window attention beats linear on long-context reasoning [R]

带 sinks 的滑动窗口注意力(SWA)是解决 LLM 二次方计算成本问题的最简单方案之一,其表现不逊于、甚至优于那些实验室投入大量后训练算力开发的线性注意力变体。这是 Alexia Jolicoeur-Martineau、Rhea Sanjay Sukthanker、Pashmina Cameron 和 Emy Gervais 的一篇新 arXiv 预印本的结论。在论文重点考察的长上下文推理基准上,差距并不接近。摘要指出:"SWA 实现了大幅领先的性能(比线性注意力高2到10倍)",并列出 Needle-in-a-Haystack 和 BABILong 这两项任务。论文的核心论点是:整个"后训练转线性"的流水线一直是用错误的基准来评估的。作者写道:"这一研究方向从未与更简单的基线进行过恰当的比较。"他们的替代方案无需后训练、运行速度快、内存占用低。建议非常直白:"我们强烈建议转向 SWA,而不是对线性模型进行后训练。"摘要也承认,线性注意力"或许显示出一些前景,但它们很可能需要从头训练或大量后训练,才能勉强与 SWA 匹敌。"

查看原文 ↗ 技术论文

📌 相关阅读

别再无脑卷 模型 参数了!JIT-Agent 告诉你:自适应 Harness 才是下一代 AI 的真正胜负手! 热度 9 网络数据基础设施如何驱动下一代AI 热度 9 CaaS的崛起:面向智能体AI的“上下文即服务”——Omer Primor,Bright Data 热度 8 AI 拿诺贝尔物理奖?详解Hinton与Hopfield|诺奖真正表彰的不是 大模型 热度 8 你的 GNN 可能只是一个过度复杂的 MLP(表格数据泄露)。我们构建了 SynthFin-AML 来强制执行严格的因果边界 热度 6