【向量检索引擎】Lance / LanceDB 对照:格式还是服务
承接 lakehouse/21 的 Lance vs Parquet 实测口径,用官方 Table Format 规范拆开 fragment/manifest/version 与 Milvus Segment/WAL 的边界;对照两边索引异步构建的共性,并给出湖侧 snapshot 与在线引擎可见性水位的对齐方式。
发布来自土法炼钢兴趣小组的知识、笔记、进展和应用。主题包括数据结构和算法、编程语言、网络安全、密码学等。
共 5 篇文章 · 返回首页
承接 lakehouse/21 的 Lance vs Parquet 实测口径,用官方 Table Format 规范拆开 fragment/manifest/version 与 Milvus Segment/WAL 的边界;对照两边索引异步构建的共性,并给出湖侧 snapshot 与在线引擎可见性水位的对齐方式。
扩展选型决策树:从单机原型到十亿级多租户,逐层加入湖上格式、SQL 同进程、存算分离运维、多一致性级别四个判断轴;用一个团队规模演进的最小故事串起决策点,并回链 llm-infra RAG 与本系列全部核心论文谱系。
补齐 ANN 算法与 RAG 应用之间的生产级向量引擎层:以 Milvus 2.6.x 为主线拆解 Segment、WAL、Segcore、Knowhere、混合过滤与一致性,并用 Qdrant、LanceDB、pgvector 对照选型。
湖仓如何承接 AI 负载:embedding/特征/训练样本存湖、按 snapshot 固定数据版本做可复现训练,以及 Parquet 在随机访问和向量检索上的短板。用本机实测对比 Lance 与 Parquet 的顺序扫描与按行随机 take,讲清 Lance 为何为随机访问与向量而生,并划清湖侧存储与专用向量引擎的边界。
系统梳理 LanceDB、Chroma、Weaviate、SurrealDB 等多模态数据库的架构差异;列存格式(Lance、Parquet)如何支持张量;给出多模态一体化的选型矩阵,并与仓库的 Parquet/Arrow 文章互链。