【图数据库内核】全文与向量属性边界:Lucene 旁路,不是 page cache 里的第二套邻接
划清 Neo4j FULLTEXT / VECTOR 索引相对 RANGE/TEXT 与拓扑 expand 的边界:二者均走 Lucene、吃 OS page cache;查询靠过程/SEARCH 而非自动计划;并链到站内 search-engine 与 vector-engine,不重写倒排与 ANN 全书。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 5 篇文章 · 返回首页
划清 Neo4j FULLTEXT / VECTOR 索引相对 RANGE/TEXT 与拓扑 expand 的边界:二者均走 Lucene、吃 OS page cache;查询靠过程/SEARCH 而非自动计划;并链到站内 search-engine 与 vector-engine,不重写倒排与 ANN 全书。
按 Milvus 2.6.x Bitset、Filter Templating 文档拆解表达式如何变成 bitset 再喂给 Knowhere;用最小故事、bitset 取反细节与选择度打穿 Top-k 归并的示意图,说明为何过滤会改变延迟而不只是改变结果数量;对读 db-frontier/09 的 ACORN、Filtered-DiskANN 争论。
补齐 ANN 算法与 RAG 应用之间的生产级向量引擎层:以 Milvus 2.6.x 为主线拆解 Segment、WAL、Segcore、Knowhere、混合过滤与一致性,并用 Qdrant、LanceDB、pgvector 对照选型。
只谈 Elasticsearch 8.x / Lucene 上 BM25 与 kNN 的组合接口与段内共存代价,ANN 算法与专用向量引擎细节外链 vector-engine 与 db-frontier/08;指出倒排与向量同 Segment 生命周期尚未统一的开放问题。
系统拆解 ANN 混合过滤检索(filtered vector search)里的 pre-filter、post-filter、in-filter 三种策略,覆盖 ACORN(SIGMOD 2024)的预测路由、Milvus/Qdrant 的 partition / pinned filter,以及 pgvector 的实际查询写法和 EXPLAIN 观察方法。