Hybrid Search demo
配合文章《向量与标量的混合过滤检索》的最小演示脚本。 脚本用 numpy 实现暴力混合检索,并对比 “pre-filter + brute”、“post-filter”、“in-filter” 三种策略 在不同选择度下的召回率与候选扫描量。
依赖
- Python 3.9+, numpy
运行
python compare_strategies.py示例输出:
selectivity=0.5000 pre=1.000 post=1.000 in=1.000 scanned pre=5000 post=100 in=200
selectivity=0.0100 pre=1.000 post=0.080 in=0.960 scanned pre=100 post=100 in=2000
selectivity=0.0010 pre=1.000 post=0.000 in=0.620 scanned pre=10 post=100 in=10000
说明不同策略在选择度变化下的表现差异:post-filter 在低选择度下召回迅速崩溃; in-filter 需要随选择度放大 ef;pre-filter 在极低选择度下最稳。
这是教学 demo,不反映生产 ANN 索引的真实性能。
同主题继续阅读
把当前热点继续串成多页阅读,而不是停在单篇消费。
【数据库研究前沿】Text-to-SQL 与 Agentic Query:DIN-SQL、C3、DAIL-SQL 工程复盘
Spider / BIRD 评测、DIN-SQL / C3 / DAIL-SQL 的核心机制、schema linking 与 self-consistency,以及一个离线可跑的最小 Text-to-SQL 闭环 demo
【数据库前沿】【数据库研究前沿】流批一体与增量视图:Materialize、RisingWave、Feldera 的 DBSP 理论
以 IVM 历史、Differential Dataflow、DBSP(Z-set 与线性化)为主线,对比 Materialize、RisingWave、Feldera 的架构取舍,划清与 Flink/Kafka Streams 的能力边界,并附 Python Z-set 最小增量 join demo
【数据库前沿】【数据库研究前沿】HTAP 新范式:从 TiDB、SingleStore 到 Lakehouse 一体化
从工作负载隔离到行列双维护,系统梳理 TiDB + TiFlash、SingleStore Universal Storage、F1 Lightning 与 Lakehouse 的设计取舍、新鲜度边界与 HTAP 基准测试方法
【数据库前沿】【数据库研究前沿】Serverless 数据库弹性理论:Neon 与 Aurora Serverless v2
从 Aurora 的日志即数据库到 Neon 的 pageserver/safekeeper/compute 三层分离,拆解 Serverless 数据库的冷启动、细粒度伸缩与 copy-on-write 分支,并给出本地可跑的 Neon demo 指引