hive 标签归档

共 2 篇文章 · 返回首页

【数据湖与开放表格式】Lakehouse 全景：从 Hive 表到开放表格式

2026-06-30 | database · storage | #lakehouse #hive #table-format #iceberg #object-storage #data-lake #data-warehouse

Hive 目录式分区表把『表』等同于『一组目录加 metastore 里的分区行』，于是没有原子提交、planning 要 LIST 目录、schema 与分区演进常要重写。本文用这三个硬伤切入，讲清 lakehouse 把表拆成『不可变数据文件 + 可变元数据指针 + catalog』三层后各自解决了什么，并给出全系列的分层地图。

【数据湖与开放表格式】ORC 文件格式与 Parquet 对照

2026-06-30 | database · storage | #orc #parquet #columnar-format #stripe #hive #rle #encoding

ORC 用 stripe 而非 row group、用三级统计（file/stripe/row-group index）而非独立 page index、用 PRESENT/DATA 等 stream 而非 page 组织一列。本文按 ORC 规范拆其文件尾（postscript + footer）、stripe 内部结构与 RLEv2 整数编码，并用本机 pyarrow 24.0.0 把同一份 30 万行数据写成 ORC 与 Parquet，对比真实体积与物理布局，最后给出什么场景仍用 ORC。