![]()
这项由中国科学技术大学与腾讯元宝团队、中国科学院大学及山东大学联合开展的研究,以预印本形式于2026年7月发布,论文编号为arXiv:2607.19747。有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。
一、搜索结果"全对"但答案却是错的?
假设你请了五位助手去图书馆帮你查一道历史题,结果他们带回来的五本书,每一本都与这道题有关联——然而翻开一看,两本书讲的几乎是同一件事,第三本里有一个关键错误,第四本把重要信息藏在几百页无关内容的中间,第五本提供了一些边角信息但缺少最核心的那块拼图。最终你手里有五本"相关书籍",却依然无法给出一个完整、准确的答案。
这个令人沮丧的场景,正是当今人工智能搜索系统天天都在经历的困境。在传统的信息检索逻辑中,评估一次搜索好不好的标准非常简单:每一篇文档单独打分,看它与查询问题有没有关系,然后把分数加总排个名次,这就是所谓的nDCG评估体系。这套方法沿用了几十年,在人类用眼睛浏览搜索结果的时代运转得还不错——毕竟人类有能力自己过滤重复内容、识别矛盾说法、判断哪些信息是真正需要的。
阅读全文