bert 标签归档

共 4 篇文章 · 返回首页

【Transformer 与注意力机制】37|BERT:MLM、NSP 与 Encoder-only 路线的代价

BERT 的每个设计选择都有可核对的实测代价。本文钉住 BERT 这一条路线本身:80/10/10 掩码策略真正缓解了多少 pretrain-finetune mismatch、NSP 为什么被 RoBERTa 的受控实验指出可能是输入格式而非目标函数在起作用、BERT 为什么在数学上是一个可以生成文本的 Markov Random Field 却没人拿它做生成模型,以及 2024 年之后 ModernBERT 一类工作为什么还在升级这条路线。三条路线的横向比较见 40|三大路线之争。

【Transformer 与注意力机制】30|预训练目标:BERT、GPT、T5 其实在学三种不同的事

这篇文章只比较文本模型里最重要的三类预训练目标:GPT 的自回归语言建模、BERT 的掩码语言建模、T5/BART 的去噪式序列到序列。重点不是背定义,而是看清它们各自优化什么接口、为什么迁移方式不同,以及为什么通用 LLM 最后大多落到 decoder-only 的 next-token prediction。

【Transformer 与注意力机制】22|Encoder 详解:6 层堆叠到底在做什么

把 Transformer encoder 从“左半边”这个模糊概念拆成可操作的结构:单层里 self-attention、FFN、残差、LayerNorm 各做什么;6 层堆叠为什么不是重复劳动;encoder 输出为什么适合理解任务而不直接擅长生成;以及它和 decoder-only、encoder-decoder 两条路线到底差在哪。