【可观测性工程】Traces 栈与采样:Jaeger、Tempo、Zipkin、SkyWalking
拆解 Jaeger、Tempo、SkyWalking 架构差异与采样策略(头部/尾部/自适应),给出 W3C TraceContext 传播、OpenTelemetry tail_sampling 配置与选型框架。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 7 篇文章 · 返回首页
拆解 Jaeger、Tempo、SkyWalking 架构差异与采样策略(头部/尾部/自适应),给出 W3C TraceContext 传播、OpenTelemetry tail_sampling 配置与选型框架。
可观测性数据量持续增长,存储成本常超过计算成本。拆解四大支柱的成本结构、采样与保留期策略、冷热分层架构,以及带显式假设的成本估算 worksheet。
区分 Envoy Gateway 控制面信号与数据面 access log / metrics / tracing 各自能钉住的坐标轴;说明 v1.9 客户端强制追踪默认 0% 会被误判为「没开 tracing」,以及 xdsNACKTotal 只证明 xDS 被拒而非路由翻译失败。
语言模型每一步只输出一组 logits,真正决定输出哪个 token 的是解码策略。本文从 softmax 与 temperature 的几何直觉出发,讲清贪心、Beam Search 为何在开放生成中显得枯燥重复,top-k/top-p/min-p 叠加时的组合陷阱,以及重复惩罚、presence/frequency penalty 对专有名词和代码的副作用,并给出采样是否掩盖模型校准问题的学界争论。
埋点不是多加几行日志,而是一整套关于什么该记、什么该采样、什么该丢弃的工程决策体系。从信号分层、基数控制、采样策略到落地规范与工程坑点,给出可操作的埋点治理框架。
分布式追踪的采样率设多少?100% 采样的成本和收益分别是什么?本文从 Google Dapper 论文的 Trace/Span 模型出发,拆解 W3C Trace Context 标准的传播机制,深入 OpenTelemetry SDK、Collector、Exporter 三层架构,对比 Jaeger 与 Tempo 的存储设计差异,讨论头部采样、尾部采样与自适应采样的工程取舍,结合 Uber 迁移 OpenTelemetry 的实战经验,给出追踪数据驱动的自动拓扑发现与关键路径分析方法。
perf 到底看到了什么?PMU 硬件计数器、tracepoint、perf_event_open、perf ring buffer、Processor Trace——本文讲 perf 子系统的内核机制。