关闭广告

高效训练新标杆!华人开源原生VLM-NEO,以少数据追平顶级模型

DeepTech深科技6605人阅读

当下主流的视觉语言模型(Vision-Language Models, VLM),通常都采用这样一种设计思路:将预训练的视觉编码器与大语言模型通过投影层拼接起来。这种模块化架构成就了当前 VLM 的辉煌,但也带来了一系列新的问题——多阶段训练复杂、组件间语义对齐成本高,不同模块的扩展规律难以协调。

由南洋理工大学 S-Lab 助理教授刘子纬领导的联合团队最近提出了 NEO,试图用另一种思路解决这些问题。这项工作试图回答一个根本性问题:如果不依赖预训练的视觉编码器,能否构建出与顶级模块化 VLM 相媲美的原生统一架构?


图丨相关论文(来源:arXiv)

在传统方法中,视觉编码器通常基于 CLIP 或 SigLIP 等预训练模型,这些编码器虽然在视觉理解上表现出色,但其固有的语义偏置会限制模型在特定任务上的灵活性。

更重要的是,视觉编码器和语言模型之间存在天然的“代沟”——前者采用双向注意力机制来捕捉图像中的全局关系,后者则使用因果注意力进行文本的自回归生成。这种架构上的不匹配使得多阶段训练不仅复杂,还需要大量的对齐数据来弥合两个模态之间的鸿沟。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

卡什:阿卡辛纳这样“双马竞争”对网坛来说不是健康的事

网球之家 浏览 5598

最懂何超琼的人,不是陈百强,不是母亲,而是他

娱说瑜悦 浏览 45

那不勒斯旧将克罗尔:那不勒斯有卫冕意甲实力,略微领先国米

懂球帝 浏览 5699

将于5月15日发布 理想L9 Livis内饰细节公开

车质网 浏览 3387

科大讯飞AI创新成果亮相第十届版博会

中安在线 浏览 6535

拼多多,十年启示录

正和岛 浏览 6547

深圳水贝“杰我睿”最新进展:有消费者收到兑付方案,20g黄金+9000多元余额,兑付本金4856元

每日经济新闻 浏览 5395

“奶奶风耳饰”火了!时髦洋气巨显脸小!今秋必备!

Yuki女人故事 浏览 6601

拉夫罗夫被指"地位下降" 克宫否认其与普京关系紧张

红星新闻 浏览 11428

小鹏将推出长途增程混合动力X9,单次续航1600公里

MOTO 浏览 7399

多名男女在呼伦贝尔大草原上跳起"纸片舞" 当地回应

扬子晚报 浏览 11512

优雅,与皱纹无关

Yuki女人故事 浏览 4449

指控闻泰科技的安世荷兰高管 大幅提高了自己的薪水

澎湃新闻 浏览 34511

明年起5纳米以下先进制程至少涨3%?台积电回应:定价策略不以机会导向

澎湃新闻 浏览 6278

林慧卿:我国第一代乒乓球削球女王,退役后如何?

阿光的技巧课堂 浏览 6782

账面1000多亿,却隐藏20多年,整个互联网都找不到它长什么样

壹只灰鸽子 浏览 5354

90后占比近六成,小鹏X9超级增程成年轻家庭首选

定焦One 浏览 5365

耗资3000万,正面对决吴京,我感慨:41岁谢苗终于迈出了这一步

靠谱电影君 浏览 5455

消息称华为Mate 80单品激活150万,逆袭成年底国产旗舰第一

IT之家 浏览 5448

智己LS9上市32.28万起 两个Ultra都是高配

网易汽车 浏览 6301

特朗普称认定委内瑞拉现政府是“外国恐怖组织”

极目新闻 浏览 5742
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1