2026-08-08 | transformer | #transformer #bert #encoder-only #masked-language-model #roberta #nlp
BERT 的每个设计选择都有可核对的实测代价。本文钉住 BERT 这一条路线本身:80/10/10 掩码策略真正缓解了多少 pretrain-finetune mismatch、NSP 为什么被 RoBERTa 的受控实验指出可能是输入格式而非目标函数在起作用、BERT 为什么在数学上是一个可以生成文本的 Markov Random Field 却没人拿它做生成模型,以及 2024 年之后 ModernBERT 一类工作为什么还在升级这条路线。三条路线的横向比较见 40|三大路线之争。
2026-08-06 | transformer | #transformer #encoder-only #encoder-decoder #decoder-only #kv-cache #information-retrieval #llm-serving
Encoder-only、Encoder-Decoder、Decoder-only 的差异不是谁更聪明,而是谁能看见谁的信息流不变量。本文从可见性图出发,解释这个不变量如何锁死任务接口与训练管线,KV Cache、continuous batching、投机解码为什么默认假设单流 causal Decoder,以及 embedding、rerank、强制双向抽取场景为什么不该硬上生成式大模型。