COLM 2026多篇论文质疑Transformer默认设计,揭示长上下文与梯度传播隐患
COLM 2026上,多篇论文同时挑战Transformer的默认架构选择,如QK归一化、GQA和滑动窗口注意力,发现这些设计在长上下文任务中表现不佳,且组合使用会加剧性能下降。另一项研究指出输出投影层在反向传播中丢失大量梯度信息,影响训练效率。这些发现可能促使未来模型设计重新评估这些看似合理的默认配置。
COLM 2026上,多篇论文同时挑战Transformer的默认架构选择,如QK归一化、GQA和滑动窗口注意力,发现这些设计在长上下文任务中表现不佳,且组合使用会加剧性能下降。另一项研究指出输出投影层在反向传播中丢失大量梯度信息,影响训练效率。这些发现可能促使未来模型设计重新评估这些看似合理的默认配置。
SynthePulse Insight · AI 深度解读会员精读
版本 1 · 1 个来源
长上下文、梯度流动、层剪枝——那些被主流模型默认采用、鲜少被质疑的设计,正在COLM 2026上被三篇独立论文重新审视,并发现它们各自在评测盲区付出了实打实的代价。
COLM 2026上,来自Ai2等机构的论文《Cracks in the Foundation》系统性地挑战了Transformer的几项标配设计:QK归一化、GQA、滑动窗口注意力、预训练上下文长度。研究者从Llama 2、Llama 3、Qwen 3、Olmo 3中选取不同取值,训练了26个7B-8B参数的模型,统称“OlmPool”,保持数据、分词器、上下文扩展方案一致,仅改变架构。
这些模型先预训练140B token,再用10B token做长上下文收尾训练,总计消耗超过17万GPU小时。在HELMET 32K测评上,最高分56.4,最低分29.9,相对差距达47%。单独调整某个开关(如预训练上下文长度或滑动窗口)平均只影响一两分,但组合起来影响显著:SWA与GQA同时使用时平均掉9分,超过各自影响之和;最差组合(GQA+SWA+逐头QK归一化)掉分幅度同样超线性。
一个反直觉的发现是,QK归一化(原本为训练稳定性而加入)在Olmo 3上移除并换用前置归一化后,HELMET分数提升6分,但在Llama 3上同样改动却下降3.8分,说明同一设计在不同模型上效果可能相反。此外,论文发现“注意力汇聚”现象(模型将大量注意力集中在上下文开头token)在OlmPool模型中与长上下文表现正相关,而QK归一化会削弱这种汇聚,这可能解释了其负面影响。
本文基于量子位对COLM 2026三篇论文的报道,所有数据均来自该报道。论文本身为预印本或会议论文,未经同行评议,且报道未提供原始论文全文,因此部分结论(如梯度损耗的具体机制)属于论文作者的主张,而非独立验证的事实。
主报道
主报道来源