关闭广告

香港科大:用"随机策略"训练AI数学推理,效果竟然超越复杂算法

科技行者5418人阅读


这项由香港科技大学潘凌教授团队联合快手科技、StepFun等机构共同完成的研究,发表于2025年9月29日的arXiv预印本平台(论文编号:arXiv:2509.24981v1)。研究团队提出了一种名为ROVER的全新AI训练方法,颠覆了人们对机器学习复杂性的认知。有兴趣深入了解技术细节的读者可以通过论文编号在arXiv平台查询完整论文。

当我们谈论训练AI解决数学问题时,大多数人可能会想象这需要极其复杂的算法和精密的计算。然而,香港科技大学的研究团队却发现了一个令人意外的现象:有时候,最简单的方法反而能产生最好的效果。这就像在烹饪界,有些大厨经过多年探索后发现,最朴素的食材搭配往往能烹制出最美味的佳肴一样。

目前,训练AI进行数学推理主要依赖一种叫做"强化学习"的技术。这种方法就像训练一个学生做数学题:先让学生尝试解题,如果答对了就给奖励,答错了就给惩罚,然后不断调整学生的解题策略。在AI领域,这种方法被称为PPO(Proximal Policy Optimization)或GRPO(Group-Relative Policy Optimization)等算法。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

巴基斯坦总理在联大敲桌子强调"自卫权"

北京日报 浏览 4489

巴基斯坦防长警告阿富汗:任何袭击都将招致50倍强度的回应

环球网资讯 浏览 5328

蔚来ES9四月发布!车长近5.4米-比林肯领航员还大

网上车市 浏览 4594

牛津VGG团队突破:单一网络实现视频动态3D重建

科技行者 浏览 4470

外国女教师性侵16岁男学生数月上百次 详情炸裂

胡侃社会百态 浏览 40742

世卫组织:6名苏丹医务人员被武装分子绑架

国际在线 浏览 5434

美股科技七巨头风光不再

第一财经资讯 浏览 4023

官方:克雷马斯基当选美国2025年度最佳青年球员

懂球帝 浏览 4125

刚刚 | “死了么”APP征名!

天津广播 浏览 4488

马卡:C罗在红海购入两栋豪华别墅,享受私密宁静的家庭时光

懂球帝 浏览 4781

罗马诺:斯帕莱蒂已与尤文签约,随后将官宣

懂球帝 浏览 5313

收视破1,全员狠人,我断言:央视这部剧,又要火向全国了

娱乐圈笔娱君 浏览 4512

在国家德比爆发冲突后,亚马尔社媒取消对卡瓦哈尔的关注

懂球帝 浏览 5511

硬核风格 奥迪Q6 e-tron越野版假想图曝光

车质网 浏览 4988

贵州茅台打假“飞天开放企业直供通道”等信息:有诈骗风险!

红星资本局 浏览 4463

加冕荷兰射手王+助攻王!德佩:又一破纪录时刻,而且远未结束

懂球帝 浏览 5500

韩星张元英辱华发酵!相关代言遭抵制品牌方回应,本人持续装糊涂

萌神木木 浏览 3799

美军机沿伊朗边界飞行 伊朗寻求外交支持

新华社 浏览 4524

小号普拉多 丰田兰德酷路泽FJ全球首发亮相

车质网 浏览 4596

李鬼变李逵?央视揭开温峥嵘骗局真相

烈史 浏览 5100

全网泪目!《马踏樱花》一夜刷屏

手工制作阿歼 浏览 4967
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1