【Transformer 与注意力机制】16|Multi-Head Attention:为什么要分多个头
单头 attention 只有一组 softmax 权重,只能在一种相似度度量下做一次聚合。Multi-Head Attention 通过多套独立的 Q/K/V 投影,让模型在同一步内并行建模多种关系,并在几乎不增加参数量的前提下提升表达力。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 1 篇文章 · 返回首页
单头 attention 只有一组 softmax 权重,只能在一种相似度度量下做一次聚合。Multi-Head Attention 通过多套独立的 Q/K/V 投影,让模型在同一步内并行建模多种关系,并在几乎不增加参数量的前提下提升表达力。