【Transformer 与注意力机制】54|涌现能力:规模效应、评测假象与可预测性之争
Wei et al. 用 BIG-Bench 定义了"涌现能力",Schaeffer et al. 用一个数学模型证明很多涌现曲线是非线性指标的产物。本文梳理这场争论的证据链、in-context learning 与 Chain-of-Thought 各自的机制证据,以及涌现能力是否可预测、可诱导两个仍未解决的问题。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 3 篇文章 · 返回首页
Wei et al. 用 BIG-Bench 定义了"涌现能力",Schaeffer et al. 用一个数学模型证明很多涌现曲线是非线性指标的产物。本文梳理这场争论的证据链、in-context learning 与 Chain-of-Thought 各自的机制证据,以及涌现能力是否可预测、可诱导两个仍未解决的问题。
推理模型通过强化学习训练长思维链(long CoT),在测试时执行多步推理以提升复杂任务性能。o1与R1展示了不同的训练策略与能力边界。
> 本文从零推导注意力机制点积方差的来源,解释缩放因子如何防范梯度弥散,并作为大模型 Scaling Laws 数值稳定的基石。