返回信息流
新闻事件
A重点83
量子位
1 个来源

COLM 2026多篇论文质疑Transformer默认设计,揭示长上下文与梯度传播隐患

COLM 2026上,多篇论文同时挑战Transformer的默认架构选择,如QK归一化、GQA和滑动窗口注意力,发现这些设计在长上下文任务中表现不佳,且组合使用会加剧性能下降。另一项研究指出输出投影层在反向传播中丢失大量梯度信息,影响训练效率。这些发现可能促使未来模型设计重新评估这些看似合理的默认配置。

SynthePulse Insight · AI 深度解读会员精读

Transformer的“标配”正在被集体清算:COLM 2026三篇论文揭示隐藏代价

版本 1 · 1 个来源

长上下文、梯度流动、层剪枝——那些被主流模型默认采用、鲜少被质疑的设计,正在COLM 2026上被三篇独立论文重新审视,并发现它们各自在评测盲区付出了实打实的代价。

  • Ai2等机构训练26个7B-8B模型,发现架构组合对长上下文性能影响巨大,HELMET 32K分数差达47%。
  • 康奈尔大学发现输出投影层在反向传播中抹去95%-99%的梯度范数,剩余信号方向严重失真。
  • 图宾根大学发现层剪枝在长链推理任务上导致性能骤降,测试时扩展失效,微调难以恢复。
展开章节目录长上下文的裂缝:架构组合的隐性代价

长上下文的裂缝:架构组合的隐性代价

COLM 2026上,来自Ai2等机构的论文《Cracks in the Foundation》系统性地挑战了Transformer的几项标配设计:QK归一化、GQA、滑动窗口注意力、预训练上下文长度。研究者从Llama 2、Llama 3、Qwen 3、Olmo 3中选取不同取值,训练了26个7B-8B参数的模型,统称“OlmPool”,保持数据、分词器、上下文扩展方案一致,仅改变架构。

这些模型先预训练140B token,再用10B token做长上下文收尾训练,总计消耗超过17万GPU小时。在HELMET 32K测评上,最高分56.4,最低分29.9,相对差距达47%。单独调整某个开关(如预训练上下文长度或滑动窗口)平均只影响一两分,但组合起来影响显著:SWA与GQA同时使用时平均掉9分,超过各自影响之和;最差组合(GQA+SWA+逐头QK归一化)掉分幅度同样超线性。

一个反直觉的发现是,QK归一化(原本为训练稳定性而加入)在Olmo 3上移除并换用前置归一化后,HELMET分数提升6分,但在Llama 3上同样改动却下降3.8分,说明同一设计在不同模型上效果可能相反。此外,论文发现“注意力汇聚”现象(模型将大量注意力集中在上下文开头token)在OlmPool模型中与长上下文表现正相关,而QK归一化会削弱这种汇聚,这可能解释了其负面影响。

限时免费

继续阅读完整分析

还有 3 节深入分析和完整结论

加载中

可信度边界

本文基于量子位对COLM 2026三篇论文的报道,所有数据均来自该报道。论文本身为预印本或会议论文,未经同行评议,且报道未提供原始论文全文,因此部分结论(如梯度损耗的具体机制)属于论文作者的主张,而非独立验证的事实。

主报道

量子位

主报道来源