关闭广告

香港科大:用"随机策略"训练AI数学推理,效果竟然超越复杂算法

科技行者6291人阅读


这项由香港科技大学潘凌教授团队联合快手科技、StepFun等机构共同完成的研究,发表于2025年9月29日的arXiv预印本平台(论文编号:arXiv:2509.24981v1)。研究团队提出了一种名为ROVER的全新AI训练方法,颠覆了人们对机器学习复杂性的认知。有兴趣深入了解技术细节的读者可以通过论文编号在arXiv平台查询完整论文。

当我们谈论训练AI解决数学问题时,大多数人可能会想象这需要极其复杂的算法和精密的计算。然而,香港科技大学的研究团队却发现了一个令人意外的现象:有时候,最简单的方法反而能产生最好的效果。这就像在烹饪界,有些大厨经过多年探索后发现,最朴素的食材搭配往往能烹制出最美味的佳肴一样。

目前,训练AI进行数学推理主要依赖一种叫做"强化学习"的技术。这种方法就像训练一个学生做数学题:先让学生尝试解题,如果答对了就给奖励,答错了就给惩罚,然后不断调整学生的解题策略。在AI领域,这种方法被称为PPO(Proximal Policy Optimization)或GRPO(Group-Relative Policy Optimization)等算法。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

什么?!你告诉我佘诗曼已经50岁了

时尚COSMO 浏览 6125

冬天想穿得轻盈保暖,看看这些大衣穿搭,大方舒适又有高级感

静儿时尚达人 浏览 5905

德转:24岁马里中场孔特加盟北京国安,球员身价55万欧

懂球帝 浏览 4921

舒淇,东亚女孩的恨海情天

时尚COSMO 浏览 5194

香港知名女星惹同性绯闻,和朋友关系举止亲密

你约电影 浏览 5472

律所主任疑"借款"9亿失联 客户有上百人最年长者88岁

界面新闻 浏览 9878

为嫁"高富帅"与母亲互殴 31岁女子道歉:给他花90多万

潇湘晨报 浏览 10657

贵州茅台多款产品出厂价降价,最高下调1990元,销售端也有降价

红星资本局 浏览 5534

123-120!里夫斯44+11,詹姆斯连续上双纪录终结,湖人绝杀猛龙

全景体育V 浏览 5850

铁威马推出雷电5移动固态硬盘盒D1 SSD Pro

IT之家 浏览 5932

男子花3万多网购2400克银条空欢喜 付款次日店铺清空

红星新闻 浏览 20562

热搜上消失的女明星,正在偷偷养鸡

Yuki女人故事 浏览 6658

边开火,边关店:顶奢LV,店又没了?

她刊 浏览 21

生日夜刷纪录!杰约43+11+9比肩詹皇 美媒:无法想象他能如此出色

颜小白的篮球梦 浏览 5736

美媒:用S-400换F-35 美国逼土耳其“二选一”

环球网资讯 浏览 5882

奥斯瓦尔多:我想看到迪巴拉加盟博卡,但他不大可能去

懂球帝 浏览 5891

重庆8D交通“路考”全国首块L3车牌,开起来够稳吗?|封面测试

封面新闻 浏览 5690

《麻省理工科技评论》发布2026年“十大突破性技术”

DeepTech深科技 浏览 5491

被家暴16次女子得70%共同财产及10万赔偿 共140万余元

极目新闻 浏览 11751

网红版闫学晶!600万粉博主阿爆翻车

萌神木木 浏览 5442

对话刘展术|大众安徽是转型先锋,与众09将于下半年上市

My车轱辘 浏览 2760
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1