【Transformer 与注意力机制】52|可解释性入门:注意力权重真的是“解释”吗
attention 权重容易被读成“模型关注了哪里”,但 Jain 和 Wallace(NAACL 2019)等工作证明相关不等于因果。本文区分用户、行为、机制三层解释,梳理 attention is not explanation 之争,梯度、遮挡、探针、因果中介分析各自的证据边界,以及 RLHF 之后 LLM 自我解释为何更容易“听起来合理却不真实”。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 3 篇文章 · 返回首页
attention 权重容易被读成“模型关注了哪里”,但 Jain 和 Wallace(NAACL 2019)等工作证明相关不等于因果。本文区分用户、行为、机制三层解释,梳理 attention is not explanation 之争,梯度、遮挡、探针、因果中介分析各自的证据边界,以及 RLHF 之后 LLM 自我解释为何更容易“听起来合理却不真实”。
Wei et al. 用 BIG-Bench 定义了"涌现能力",Schaeffer et al. 用一个数学模型证明很多涌现曲线是非线性指标的产物。本文梳理这场争论的证据链、in-context learning 与 Chain-of-Thought 各自的机制证据,以及涌现能力是否可预测、可诱导两个仍未解决的问题。
推理模型通过强化学习训练长思维链(long CoT),在测试时执行多步推理以提升复杂任务性能。o1与R1展示了不同的训练策略与能力边界。