关闭广告

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

新智元6600人阅读


新智元报道

编辑:LRST

【新智元导读】Meta开源DepthLM,首证视觉语言模型无需改架构即可媲美纯视觉模型的3D理解能力。通过视觉提示、稀疏标注等创新策略,DepthLM精准完成像素级深度估计等任务,解锁VLM多任务处理潜力,为自动驾驶、机器人等领域带来巨大前景。

在当前多模态AI发展浪潮中,视觉语言模型(Vision Language Models, VLMs)因其能通过「看图 + 文字交互」处理多样任务而备受关注。

然而,尽管在语义理解、视觉问答、图像指令等任务上表现优异,它们在从 2D 图像理解 3D 空间结构方面仍显薄弱。相比之下,纯视觉模型(pure vision models)在 绝对深度估计(metric depth estimation) 等三维理解任务上,凭借专门设计的网络结构与损失函数,早已达到了超越人类的精度。

这就带来了一个核心问题:「视觉语言模型是否有可能不更改其标准架

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

环球:中国实施稀土出口管制 美方没必要过度反应

环球网资讯 浏览 10052

波音圣路易斯地区罢工持续近三月,谈判陷入僵局

国际金融报 浏览 6287

A股年内近160股易主

北京商报 浏览 6103

泰柬冲突柬方70人死伤 泰国近20万人住进避难中心

财联社 浏览 5956

微创、高效、直达大脑!我国科学家开辟脑卒中病灶给药新路径

环球网资讯 浏览 5404

中美两军在夏威夷见面 中方当场划下两条"红线"

看看新闻Knews 浏览 65192

OpenAI完成重组!微软持股缩减至27%,市值再超4万亿美元

澎湃新闻 浏览 6175

强脑科技:预计未来3-5年多款脑机接口产品获得医疗器械注册证

澎湃新闻 浏览 5202

特朗普亮明"弃台"主张 学者:美在台海已不具军事优势

台海网 浏览 15877

罗马诺:鲍勃转会富勒姆谈判进最后阶段,曼城坚持要3500万镑

懂球帝 浏览 5373

大众中国市场2025年交付269.38万辆,同比减少8%

IT之家 浏览 5432

小米新车曝光!雷军的致命子弹,射向李想和余承东

象视汽车 浏览 6431

吴启华:后悔演反派,来内地定居还交社保

失宠的小野猪 浏览 5430

每秒赚2300元!宁德时代交出最强年报

车东西 浏览 4666

重要信号,楼市将变!

博闻财经 浏览 5813

超300倍就清零!超高位科技股突然暴跌,中芯国际重挫7%

深蓝财经 浏览 6567

德罗西:沙拉维要尽快进入可用状态,哪怕他只能上10到15分钟

懂球帝 浏览 47

190万赞的爆款女孩,等待代表作

时尚COSMO 浏览 5254

黄宗泽恭喜陈伟霆当爸,没想到隐藏那么深,怼记者做人别太八卦

扒虾侃娱 浏览 6482

等折叠屏iPhone要再熬两年?郭明錤称恐缺货至2027年

环球网资讯 浏览 5672

泡泡玛特回应79有点贵直播事故;山姆回应支付跳色情网站丨邦早报

创业邦 浏览 6270
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1