![]()
这项由香港理工大学与四川大学联合开展的研究,以预印本形式发布于2026年7月22日,论文编号为arXiv:2607.19691v1,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。
当你解一道数学题,脑袋里会经历一段"内心独白"——先想到用哪个公式,再试试代入数字,发现不对就回头重想。这个过程虽然在纸上看不见,却是你真正在"思考"的核心环节。现在,让AI也拥有这种"内心独白",正是近年来人工智能研究的一个重要方向,学界把它叫做"潜在推理"(Latent Reasoning)。
然而,这条路走到今天却遇到了一堵墙:AI的"内心独白"虽然速度更快、计算量更少,却一直被关在"模仿"的笼子里,没办法像那些把思维过程写出来的AI一样,通过"做对了就奖励、做错了就惩罚"的强化学习方式来自我提升。这就好比一个学生能在脑子里飞速运算,却始终只能靠抄老师的解题步骤来学习,而没办法通过自己做对题目获得成就感从而越练越强。
来自香港理工大学和四川大学的研究团队,正是要打破这堵墙。他们提出了一套叫做**SLPO(Surrogate Latent Policy Optim