Linux / 存储
从 fsync、无锁到 io_uring:系统层踩坑入口
按工程问题找文章:fsync 失败语义、内存屏障、Zero Copy、Direct I/O、文件锁与分配器擂台。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
第一次访问时先按主题切入,比直接沿着时间线翻文章更快。
Linux / 存储
按工程问题找文章:fsync 失败语义、内存屏障、Zero Copy、Direct I/O、文件锁与分配器擂台。
系统架构
限流与过载、混沌实验、多租户、Cloudflare/Discord 案例,以及 AI 原生架构。
大模型基础设施
把训练、推理、量化与服务化串成一条工程主线;先建立 GPU 心智模型,再进入引擎与量化落地。
可观测性
从 Continuous Profiling 到 eBPF 全景与 ftrace/kprobe 生产实战。
把已经形成系列阅读闭环的主题集中在首页,减少在 400 多篇文章里盲找的成本。
按最近更新时间排序;如果你想系统性阅读一个主题,优先回到上面的专题入口。
回测按中价成交,实盘却被价差、冲击和逆向选择吃掉收益。本文从限价订单簿出发拆解价差口径与分解、流动性四维、OFI、Kyle λ、VPIN 与 Hawkes,并用币安 LTCUSDT 真实数据验证:10 秒 OFI 解释约六成中价变化,有效价差三分之二以上表现为价格冲击。
股票数接近样本天数时,样本协方差会把最小方差组合的风险低估到真实值的约 1-N/T 倍。本文用 Barra 式因子模型降维,对比 Ledoit-Wolf 收缩与 eigenfactor 调整,配合欧拉风险归因、VaR/ES 回测和压力测试,用可运行的模拟代码给出各方法的偏差大小与适用边界。
回测按收盘价成交,实盘却多付几十 bp。本文把交易成本拆成显性费用、滑点、冲击、机会成本四层,用平方根律标定、Almgren-Chriss 与 Implementation Shortfall 统一口径,附合成数据验证的 Python 代码和按 2026 年官方规则核对的四市场费率。
自回归模型训练要并行、生成不能偷看未来。本文从 teacher forcing 推到 mask 矩阵,对比 causal、prefix LM、滑窗与 packing 文档掩码,结合 KV cache 对齐、FlashAttention 跳块与 GPT-2 实测 attention sink,说明 mask 决定训练并行性、推理对齐方式和 sink 落点。
ML-KEM(FIPS 203)与 ML-DSA(FIPS 204)都建立在 Module-LWE 上。本文从 LWE 归约讲到 KeyGen/Encaps/Sign 流程、NTT 实现(附与朴素乘法对拍过的 Python 代码)、FO 变换与拒绝采样,说明参数集怎么选、core-SVP 估计为何不能直接和 NIST 级别相减,以及 TLS、Signal 等部署现状。
decode 受显存带宽限制,量化把权重从 BF16 压到 FP8 或 INT4 就能直接换来显存和延迟收益。本文讲清 FP8/FP4/MX 数据类型、GPTQ/AWQ/SmoothQuant/旋转法各自解决什么问题、KV Cache 量化的收益边界,给出按硬件选位宽的规则和 AutoAWQ + vLLM、TensorRT-LLM FP8 的落地命令。
回测 Sharpe 漂亮却上线失效,多半死于前视偏差、过拟合和数据窥视。本文给出前视偏差的三条机械自查规则,用可复现仿真说明零信号数据上挑出的最佳策略能通过 PSR 却被 DSR 拒掉,并附 Bonferroni、BH-FDR、DSR 的 Python 实现与 30 条上线前自检清单。
神经网络训练就是前向、损失、反向、更新四步循环。本文用一个可手算的标量网络逐步推出反向传播梯度,再推广到两层 MLP 的矩阵求导,给出 NumPy 手写与 PyTorch 对照实现和真实训练曲线,最后说明固定窗口 MLP 为什么处理不好序列、RNN 改了哪一条边。
以倒排表的 d-gap 为对象,在两份真实语料和伯努利合成表上实测 varint、Elias、Golomb/Rice、插值编码、Elias-Fano、Simple、PFOR、Stream VByte、BP128 的每整数比特数与下界之差,并在共享 2 vCPU 上测解码的相对速度。
拆解 Gorilla 的时间戳 delta-of-delta 与浮点 XOR 编码,对照 Prometheus、InfluxDB、VictoriaMetrics 钉版本源码,用节点采集数据和 ALP 数据集实测每个值花多少比特,并说明 XOR 在十进制数据上失效的原因与 Chimp、Elf、ALP 的改法。
对照 Parquet 2.11 规范与 Arrow、ORC 源码拆开字典、RLE/位打包混合、DELTA 与 RLEv2,讲清写入器何时放弃字典;在 TPC-H lineitem 上按字节比较 Parquet、ORC 与级联选择,并数出在编码数据上执行省下的工作。
BWT 只是可逆排列,LF 映射让它能还原文本、用 rank 查询计数子串。本文用对拍过的 C 实现推演逆变换、backward search 与采样 SA 定位,并对照 bzip2 1.0.8、BWA 0.7.18 源码说明工程取舍。
证明 Huffman 码为何最优、离熵多远,讲清规范码、15 位限长、查表解码与 DEFLATE 的三层码表;用逐比特记账的解码器拆开 zlib 1.3 与 zopfli 的输出:Huffman 只比经验熵多 0.64%,距离额外比特却占 42%。
从 1977、1978 年两篇原始论文出发,讲清滑动窗口与短语表两种字典、LZSS 与 LZW 的改动;用可解码验证的固定码 DEFLATE 输出实测哈希链与二叉树匹配查找器、贪心/lazy/最优解析:二叉树每位置 22 个候选即得最长匹配,最优解析比贪心小 12.7%。
按 RFC 8878 与 zstd 1.5.7 源码拆开帧、块、字面量段和序列段,讲清 FSE 表怎么建、怎么传、编码器怎么选模式;用逐比特记账的解码器实测:偏移额外比特占 39–44%,FSE 离逐块经验熵不到 1%,字典与长距离匹配的收益取决于数据和编码器的启发式。