关闭广告

香港科大:用"随机策略"训练AI数学推理,效果竟然超越复杂算法

科技行者6440人阅读


这项由香港科技大学潘凌教授团队联合快手科技、StepFun等机构共同完成的研究,发表于2025年9月29日的arXiv预印本平台(论文编号:arXiv:2509.24981v1)。研究团队提出了一种名为ROVER的全新AI训练方法,颠覆了人们对机器学习复杂性的认知。有兴趣深入了解技术细节的读者可以通过论文编号在arXiv平台查询完整论文。

当我们谈论训练AI解决数学问题时,大多数人可能会想象这需要极其复杂的算法和精密的计算。然而,香港科技大学的研究团队却发现了一个令人意外的现象:有时候,最简单的方法反而能产生最好的效果。这就像在烹饪界,有些大厨经过多年探索后发现,最朴素的食材搭配往往能烹制出最美味的佳肴一样。

目前,训练AI进行数学推理主要依赖一种叫做"强化学习"的技术。这种方法就像训练一个学生做数学题:先让学生尝试解题,如果答对了就给奖励,答错了就给惩罚,然后不断调整学生的解题策略。在AI领域,这种方法被称为PPO(Proximal Policy Optimization)或GRPO(Group-Relative Policy Optimization)等算法。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

鲁媒:苏超决赛变成青训对决,别被所谓“草根”赛事蒙蔽双眼

懂球帝 浏览 6636

国乒多人离队 总教练秦志戬回应

乒乓世界 浏览 15260

全球首次 我国实现千亿级分子库秒速检索筛选

财闻 浏览 2902

美议员炒作:中国发展"太吓人" 核军控谈判必须拉进来

澎湃新闻 浏览 36922

43岁演员王凯离世,死因曝光让人泪目

老缰科普 浏览 1239

全是震撼!《悬案》的17集大结局,是我今年看过最震撼的大结局

娱乐圈笔娱君 浏览 1257

Meta实验室革命性并行推理技术:让AI模型思考速度提升50%

科技行者 浏览 5713

普京签署法律修订兵役法:征兵工作将全年不间断进行

界面新闻 浏览 11118

埃安 UT super 国民好车下线,广汽、京东、宁德时代联合打造

IT之家 浏览 6364

百万粉丝网红小英丈夫被刑拘 夫妻已数月未住村里

红星新闻 浏览 45208

《向往》收视创新低!仅剩0.19%越看越丧气,节目氛围遭吐槽

萌神木木 浏览 6724

多名男女当街爬行学狗叫 官方:企业团建行为已致歉

极目新闻 浏览 13078

美媒:日本欲采购攻击型核潜艇 标志一个重大战略转变

环球时报新闻 浏览 34128

俄罗斯多地遭袭

极目新闻 浏览 5582

官方首次披露龚晓莉已被查:在考试录用中泄露试题

新京报 浏览 12311

石药集团185亿美元合作背后

YOUNG财经 浏览 5503

白俄罗斯国防部长:边境出现“前所未有”军事集结

环球网资讯 浏览 5644

金价暴跌 不少上海人跑外地买黄金:就像在抢大白菜

极目新闻 浏览 9506

曝小米汽车调整销售体系!

电动知家 浏览 7378

预售35万起 小鹏X9增程版终结MPV续航焦虑

网易汽车 浏览 6531

日均排队超千桌!“反预制”的年轻人捧红了地方菜

餐饮老板内参 浏览 5635
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1