sparse-autoencoder 标签归档

共 1 篇文章 · 返回首页

【Transformer 与注意力机制】53|机制可解释性:电路、诱导头与叠加态的边界

机制可解释性要的不是热力图,而是因果证据。本文用 induction head、IOI 26-head 电路、activation patching、superposition 和 Sparse Autoencoder 讲清楚:找到一个 head 远不等于解释整个模型,patching 本身也会制造“解释幻觉”,SAE 从玩具模型扩到 Claude 3 Sonnet 后仍有系统性失败模式。