【Transformer 与注意力机制】53|机制可解释性:电路、诱导头与叠加态的边界
机制可解释性要的不是热力图,而是因果证据。本文用 induction head、IOI 26-head 电路、activation patching、superposition 和 Sparse Autoencoder 讲清楚:找到一个 head 远不等于解释整个模型,patching 本身也会制造“解释幻觉”,SAE 从玩具模型扩到 Claude 3 Sonnet 后仍有系统性失败模式。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 1 篇文章 · 返回首页
机制可解释性要的不是热力图,而是因果证据。本文用 induction head、IOI 26-head 电路、activation patching、superposition 和 Sparse Autoencoder 讲清楚:找到一个 head 远不等于解释整个模型,patching 本身也会制造“解释幻觉”,SAE 从玩具模型扩到 Claude 3 Sonnet 后仍有系统性失败模式。