baseline 标签归档 | 土法炼钢兴趣小组的算法知识备份

baseline 标签归档

共 2 篇文章 · 返回首页

【强化学习与大模型后训练】03｜策略梯度与 REINFORCE

2026-05-29 | rl-posttraining | #rl #policy-gradient #reinforce #rloo #baseline #variance-reduction #rlhf #language-model

从期望回报出发推导策略梯度与 REINFORCE，解释 log-derivative trick、基线降方差，以及它们在语言模型后训练中的含义。

【系统架构设计】容量规划：从拍脑袋到数据驱动

2026-04-13 | architecture | #capacity-planning #queueing-theory #load-testing #resource-modeling #baseline

容量规划不是'加机器'。本文从排队论基础讲起，用 Little 定律和 M/M/c 模型建立容量预测框架，再拆解全链路压测的设计方法和容量基线与水位线管理的工程实践，用一个电商大促案例走完从历史数据分析到资源供给的全过程。