- 论文公开站arXiv
多跳检索中的可预测失败:分数分布置信评分与弃答
Predictable Failure in Multi-Hop Retrieval: Score-Distributional Confidence Scoring and Abstention
该论文指出多跳检索失败并非均匀分布,而是聚集在结构上可预测的子群体中。作者证明两个结论:置信失败缩减可归约性,以及特征机制互补性。提出 RegimeAbstain 方法,计算检索置信分数(RCS),该分数由最多九个查询-ANN 结构特征的逻辑函数构成,无需额外 LLM 调用,并据此实现校准弃权策略。在三个多跳基准和两种检索架构上评估,RCS 在五种条件下均取得最佳或并列最佳 AUC-AC。
意义:为 RAG 多跳检索提供无需额外 LLM 调用的置信度评分与弃权方案,可降低高置信错误答案率,提升检索系统可靠性。
- 开源项目公开站GitHub
阿里巴巴开源轻量级进程内向量数据库 zvec
alibaba/zvec — A lightweight, lightning-fast, in-process vector database
阿里巴巴在 GitHub 开源 zvec,定位为轻量、极速、进程内的向量数据库,已获约 15939 颗星。设计强调无需独立服务进程即可嵌入应用运行,面向低延迟向量检索场景。
意义:进程内向量库可省去独立服务部署,降低检索延迟与运维成本,对 RAG 与本地 AI 应用开发者有参考价值。