![]()
这项由StackOne Technologies的研究人员开展的研究以预印本形式发布于2026年7月22日,论文编号为arXiv:2607.20379,感兴趣的读者可通过该编号查阅完整原文。
你有没有想过,当一个AI系统告诉你"我之所以做出这个决定,是因为……"的时候,它说的到底是不是真话?更进一步,我们有没有办法去验证它的说法是否准确?这听起来像是一个哲学问题,但其实是一个非常实际的技术难题,而且这个难题的答案可能比你预想的要令人不安得多。
研究人员发现,目前最先进的AI自我解释系统存在一个严重的结构性漏洞。这个漏洞不是因为某家公司偷工减料,也不是因为某个程序员犯了低级错误,而是深深嵌入在整个评测体系的设计逻辑之中。更麻烦的是,按照现有的验证方式,这个漏洞几乎无法被发现——系统看起来表现得非常好,分数也很高,但实际上它说的那些"解释"在绝大多数情况下都是无从核实的。
这项研究不仅揭示了问题所在,还提出了一套被称为RECAP的修复方案,并通过大量实验验证了其有效性。
一、当AI开口解释自己:一场听起来很美的自我审查