关闭广告

清华大学团队NeurIPS 2025文章分析 RL 与 SFT 泛化性差异

机器之心Pro6816人阅读



在具身智能领域,视觉 - 语言 - 动作(VLA)大模型正展现出巨大潜力,但仍面临一个关键挑战:当前主流的有监督微调(SFT)训练方式,往往让模型在遇到新环境或任务时容易出错,难以真正做到类人般的泛化。但在大语言模型(LLM/VLM)领域,强化学习(RL)已被证明能显著提升模型的泛化能力。RL 究竟能为 VLA 带来哪些独特的泛化优势?与 SFT 相比,它们的优劣势分别体现在哪里?

来自清华大学的研究团队在 NeurIPS 2025 发表文章,首次系统性地揭示了强化学习(RL)在提升 VLA 泛化能力上的独特优势,并带来了一套全面的评测基准和高效训练方法。通讯作者是清华大学教授汪玉和博士后于超。


版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

2050年人形机器人市场规模达5万亿美元,每10人就有1台

环球网资讯 浏览 5850

今年秋冬最时髦的穿法:长外套+长裤,太高级了!

LinkFashion 浏览 6337

深圳自动驾驶安全实验室揭牌成立,将重点攻坚十大方向

南方都市报 浏览 5475

前央视主持人水均益直播 额头顶"中国人"纸条否认移民

极目新闻 浏览 11904

宁波84-79逆转江苏取4连胜,杰克逊29+6,庞峥麟25分5板7助

懂球帝 浏览 5478

何超琼近况曝光,生图皮包骨大小眼,西装裤松垮

张发林 浏览 6942

多国领导人到访 朝鲜迎来外交潮

上观新闻 浏览 6472

郑智化发声道歉!坦言自己情绪上头用词不当

萌神木木 浏览 6327

中国留学生潜水后失踪妻子4天后报警 仅找到一根胫骨

新民晚报 浏览 26209

梅西:作为朋友我当然希望内马尔踢世界杯,但我无法客观评价

懂球帝 浏览 3188

AI学会玩游戏,还能像人类一样思考因果关系

科技行者 浏览 5521

专栏 | 我们对女性友谊太缺乏想象力了

时尚COSMO 浏览 6647

制裁重启 伊朗军方:已准备好应对任何威胁

极目新闻 浏览 7001

纯电续航达550km 吉利银河A7 EV官图发布

车质网 浏览 3931

时隔8年,苏农银行终换行长

财经众议院 浏览 6270

战斗气息十足 全新AMG GT内饰官图发布

车质网 浏览 4617

徐彬:邵指导是第一个想让我出去踢球的;拿手菜有把子肉

懂球帝 浏览 5348

编码新未来!WAVE2025泛互全球领航者大会即将启幕

霞光社 浏览 6435

青创人才说 | 柒色莲生物汪会兵:当好iPSC细胞疗域“铺路人”

上观新闻 浏览 6133

春晚阵容曝光!十年来最强的演出阵容

阿纂看事 浏览 5314

朱光耀:中美AI实力对比,中国具备三项优势

上观新闻 浏览 5771
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1