ParqDB 今日发布

基于 HTTP 协议在浏览器中实现向量搜索的创新工具,它将完整的向量索引部署在对象存储上

部分免费

ParqDB 是一个基于 HTTP 协议在浏览器中实现向量搜索的创新工具,它将完整的向量索引部署在对象存储上,允许用户在不依赖专用向量数据库的情况下直接进行高效语义检索。核心技术路径是将 Wikipedia 百万级条目的 MiniLM 向量嵌入构建为 IVF-LVQ8 索引,转换为不可变的 Parquet 文件发布到对象存储,查询时浏览器通过 WebAssembly 直接加载索引文件,仅请求所需的数据字节范围,在本地完成向量距离计算和结果排序。

整个查询流程完全在用户浏览器本地执行,查询文本首先通过 ONNX/WASM 运行时转换为 384 维向量嵌入,然后根据全局 LVQ8 质心进行路由探测,定位候选最近邻区域,再通过精确的向量距离计算和 top-k 筛选得到最终结果。ParqDB 的设计哲学是彻底消除传统向量搜索架构中对查询服务器的依赖——传统架构下浏览器需要先请求向量数据库服务,数据库再从对象存储拉取数据,而 ParqDB 让浏览器直接与对象存储通信,数据库不再是瓶颈。

该方案的优势在于极致隐私保护:没有任何查询服务器能够看到用户提交的搜索内容,数据完全在本地处理。索引文件通过 HTTP Range 请求按需获取,无需下载完整索引,大幅降低带宽消耗。由于索引本身不可变且部署在对象存储,版本管理和分发极为简单。ParqDB 同时提供索引发现、查询剖析、内存缓存命中统计和 HTTP 传输追踪等调试工具,适合向量检索技术研究、前端向量应用开发以及隐私敏感型搜索场景。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论