beam-search 标签归档 | 土法炼钢兴趣小组的算法知识备份

【Transformer 与注意力机制】48｜从 logits 到文本：贪心、Beam Search、采样的几何直觉

2026-04-15 | transformer | #transformer #decoding #sampling #beam-search #logits

语言模型不会直接输出“答案”，它每一步输出的是下一个 token 的 logits。本文解释 logits、softmax 和概率分布的关系，比较贪心解码、Beam Search、temperature、top-k、top-p、重复惩罚等策略，说明为什么解码不是模型之外的小细节，而是直接决定文本风格、稳定性和幻觉风险的决策层。