【存储工程】向量存储与 ANN 索引
存储工程视角的向量检索入门:L2/余弦/内积的几何意义与归一化等价、暴力基线、LSH/HNSW/量化直觉与 FAISS 选型;算法深度与生产引擎内核外链到 db-frontier 与 vector-engine。
发布来自土法炼钢兴趣小组的知识、笔记、进展和应用。主题包括数据结构和算法、编程语言、网络安全、密码学等。
共 5 篇文章 · 返回首页
存储工程视角的向量检索入门:L2/余弦/内积的几何意义与归一化等价、暴力基线、LSH/HNSW/量化直觉与 FAISS 选型;算法深度与生产引擎内核外链到 db-frontier 与 vector-engine。
按官方 Knowhere 文档说明其在 Milvus 中的位置、相对 Faiss 的扩展(bitset、SIMD 选择、二进制度量)、VecIndex 类层次与 IDMAP/IVF/HNSW 等类型,用插件注册、CPU/GPU 分发与 bitset 进查询三张图钉住工程契约,并与 db-frontier/08 的算法细节分工。
HNSW 是当前向量检索的事实标准算法。
系统拆解 HNSW、DiskANN/Vamana、SPANN 三类主流 ANN 索引的原理、构建算法、查询流程与工程参数,并覆盖 IVF-PQ、ScaNN 的位置,最后给出 FAISS/Milvus/pgvector/Qdrant 的选型与一份 200 行 numpy HNSW 复现。
当向量数据集大到连 HNSW 都装不下内存,IVF-PQ 是最后一道防线。