faithfulness 标签归档

共 1 篇文章 · 返回首页

【Transformer 与注意力机制】52|可解释性入门:注意力权重真的是“解释”吗

attention 权重容易被读成“模型关注了哪里”,但 Jain 和 Wallace(NAACL 2019)等工作证明相关不等于因果。本文区分用户、行为、机制三层解释,梳理 attention is not explanation 之争,梯度、遮挡、探针、因果中介分析各自的证据边界,以及 RLHF 之后 LLM 自我解释为何更容易“听起来合理却不真实”。