【Transformer 与注意力机制】38|GPT 系列:从续写到助手,每一代到底改变了什么
GPT-1 到 GPT-4 四次跃迁里,next-token prediction 这个目标函数从未换过,真正变化的是任务接口、参数规模和对齐机制。本文只用公开论文与技术报告拆解每代的改与不改,并摆开 in-context learning 机制、涌现能力是否为度量假象、能力该归因 scale、数据还是对齐这几个仍在争论的问题。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 2 篇文章 · 返回首页
GPT-1 到 GPT-4 四次跃迁里,next-token prediction 这个目标函数从未换过,真正变化的是任务接口、参数规模和对齐机制。本文只用公开论文与技术报告拆解每代的改与不改,并摆开 in-context learning 机制、涌现能力是否为度量假象、能力该归因 scale、数据还是对齐这几个仍在争论的问题。
Wei et al. 用 BIG-Bench 定义了"涌现能力",Schaeffer et al. 用一个数学模型证明很多涌现曲线是非线性指标的产物。本文梳理这场争论的证据链、in-context learning 与 Chain-of-Thought 各自的机制证据,以及涌现能力是否可预测、可诱导两个仍未解决的问题。