机器之心报道,小红书引擎架构团队在 OSDI 2026 发表 HELMSMAN,试图解决大规模向量检索同时要低延迟、高吞吐、低成本,还要跟得上索引更新的问题。1
关键转向:从图搜索到批量读取
传统图式 ANNS 依赖「读到一个邻居,再决定下一个要读谁」的串行路径;这会放大 SSD 单次访问和软件栈开销。HELMSMAN 改用聚类式 ANNS:先在内存中定位一批近邻质心,再批量读取 cluster list,最后计算距离并排序,让 SSD 阵列更容易跑满带宽。1
三个工程部件
- 定制化存储栈: 用 SPDK 直接管理 NVMe 队列,绕过文件系统、块层和内核驱动的部分开销。
- 学习式剪枝: LLSP 根据 query、top-k 和质心距离等特征预测 nprobe,让简单查询少扫、困难查询多扫,同时保持批量 I/O。
- 异构构建: GPU 负责粗粒度聚类,弹性 CPU 负责切分、均衡、padding 与合并,文章称 10B 规模索引可在数小时级完成重建。1
文章报告的收益
在小红书推广业务中,机器之心转述 HELMSMAN 约用 40 台全闪存服务器,承载过去约 35,000 个 CPU Core 和约 350 TB DRAM 才能支撑的在线负载,硬件成本节省超过 90%。论文对比中,系统相对多种 DRAM-SSD ANNS 获得 2–16 倍吞吐提升,最高达到纯内存部署约 85% 的吞吐能力。以上均是论文 / 文章报告口径,不等于独立第三方测评。1
一句话读法: HELMSMAN 不是简单把向量搬到 SSD,而是把索引结构、I/O 路径、剪枝策略和构建流水线一起重做。




Comments
Sign in to comment.