关闭广告

谁是AI之王?聊聊备受争议的AI评测与崛起的LMArena

硅谷1013846人阅读

撰稿 |张珺玥

编辑 |陈茜

在大模型激战的当下,究竟谁更强?是OpenAI的GPT,还是Anthropic的Claude?是谷歌的Gemini,还是中国的DeepSeek?

当AI模型排行榜开始被各种刷分作弊之后,谁家大模型最牛这个问题就变得非常主观,直到一家线上排行榜诞生,它叫:LMArena。

在文字、视觉、搜索、文生图、文生视频等不同的AI大模型细分领域,LMArena上每天都有上千场的实时对战,由普通用户来匿名投票选出哪一方的回答更好。最近以来,很多AI研究者都纷纷发声,认为大模型竞赛的下半场,最重要的事情之一就是重新思考模型评估。

因为当技术创新趋于饱和,真正拉开差距的,可能将不再是谁的参数更多、推理更快,而是谁能更准确地衡量、理解模型的智能边界。

在大模型评测上,传统的Benchmark(基准测试)究竟存在什么问题,是已经过时了吗?LMArena的竞技场模式为什么会被视为一种新的标准?它的技术机制、公平性和商业化隐藏着怎样的挑战?而下一代的大模型评测,又可能会走向哪里?

(本文为视频改写,欢迎大家收看以下视频)

01

题库泄露、数据污染传统Be

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

传祺向往S9正式上市,22.99万起就能入手

车扯 浏览 4923

美媒:特朗普政府再就霍尔木兹海峡拼凑国际联盟

上观新闻 浏览 842

熊园:9月进出口均走高的背后

首席经济学家论坛 浏览 4216

49 岁马伊琍公布喜讯,终于等到这一天

动物奇奇怪怪 浏览 3893

新中式,才是属于我们的时尚与生活

LinkFashion 浏览 3387

广汽功臣肖勇让位,埃安、杨龙能否相互成全?

车友观察 浏览 4810

美乌柏林两日会谈后 特朗普、泽连斯基同日发声

环球时报国际 浏览 18402

以色列捅了娄子,巴铁正式成了沙特保护伞,对中国意味着什么?

北向财经 浏览 4567

曹德旺辞去福耀玻璃董事长职务,儿子曹晖接任

红星资本局 浏览 4061

前安永合伙人,因酒吧斗殴被解雇,早前涉嫌勾引已婚女合伙人被警告

财通社 浏览 3918

普京会见伊朗最高领袖顾问:正密切关注伊朗局势

上观新闻 浏览 2782

3万月薪急招董秘!安徽五粮液大商要港股IPO?95后海归接棒,一天卖酒30万瓶

时代周报 浏览 3061

《大生意人》将至,陈晓出演一代商王,或可比肩《乔家大院》

最爱酷影视 浏览 4273

亮出“小红卡”加入本地生活争夺赛,小红书不硬刚

钛媒体APP 浏览 4703

细节调整 新款享界S9纯电版申报图曝光

车质网 浏览 4369

继与霉霉恋情谣言后,里弗斯被传约会网红

艺兔体坛 浏览 3157

香港科技大学突破:让电脑"看懂"视频中每个像素的3D运动轨迹

科技行者 浏览 3172

专家:荷兰舰机行为恶劣 解放军高度克制

环球网资讯 浏览 17807

零跑D19定档10月16日,旗舰SUV全球首秀

网易汽车 浏览 4958

M3旅行版上市售94.39万元 告别平行进口

网易汽车 浏览 3858

连奕名为老婆过46岁生日 杨若兮素颜照惹争议

小徐讲八卦 浏览 3370
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1