【Transformer 与注意力机制】54|涌现能力:规模效应、评测假象与可预测性之争
Wei et al. 用 BIG-Bench 定义了"涌现能力",Schaeffer et al. 用一个数学模型证明很多涌现曲线是非线性指标的产物。本文梳理这场争论的证据链、in-context learning 与 Chain-of-Thought 各自的机制证据,以及涌现能力是否可预测、可诱导两个仍未解决的问题。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 3 篇文章 · 返回首页
Wei et al. 用 BIG-Bench 定义了"涌现能力",Schaeffer et al. 用一个数学模型证明很多涌现曲线是非线性指标的产物。本文梳理这场争论的证据链、in-context learning 与 Chain-of-Thought 各自的机制证据,以及涌现能力是否可预测、可诱导两个仍未解决的问题。
把现代后训练拆成数据、目标函数、采样、奖励和评测组成的系统流水线,说明每一阶段改变模型的哪一部分。
从偏好胜率、LLM-as-judge、推理基准、安全红队到能力回归,组织后训练模型的评测闭环。