S信号86
量子位
1 个来源至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%
至知创新研究院联合多所高校提出稀疏权重分解(SWD)方法,直接从预训练权重中分解出可干预单元,无需训练替代网络,数据成本不到1%。该方法在GPT-2、Qwen等模型上验证了高效的任务回路抽取能力,为机制可解释性提供了新思路。
至知创新研究院联合多所高校提出稀疏权重分解(SWD)方法,直接从预训练权重中分解出可干预单元,无需训练替代网络,数据成本不到1%。该方法在GPT-2、Qwen等模型上验证了高效的任务回路抽取能力,为机制可解释性提供了新思路。
主报道
主报道来源