关闭广告

谁是AI之王?聊聊备受争议的AI评测与崛起的LMArena

硅谷1013889人阅读

撰稿 |张珺玥

编辑 |陈茜

在大模型激战的当下,究竟谁更强?是OpenAI的GPT,还是Anthropic的Claude?是谷歌的Gemini,还是中国的DeepSeek?

当AI模型排行榜开始被各种刷分作弊之后,谁家大模型最牛这个问题就变得非常主观,直到一家线上排行榜诞生,它叫:LMArena。

在文字、视觉、搜索、文生图、文生视频等不同的AI大模型细分领域,LMArena上每天都有上千场的实时对战,由普通用户来匿名投票选出哪一方的回答更好。最近以来,很多AI研究者都纷纷发声,认为大模型竞赛的下半场,最重要的事情之一就是重新思考模型评估。

因为当技术创新趋于饱和,真正拉开差距的,可能将不再是谁的参数更多、推理更快,而是谁能更准确地衡量、理解模型的智能边界。

在大模型评测上,传统的Benchmark(基准测试)究竟存在什么问题,是已经过时了吗?LMArena的竞技场模式为什么会被视为一种新的标准?它的技术机制、公平性和商业化隐藏着怎样的挑战?而下一代的大模型评测,又可能会走向哪里?

(本文为视频改写,欢迎大家收看以下视频)

01

题库泄露、数据污染传统Be

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

央视主持人遭AI仿冒带货 官方通报

大象新闻 浏览 8183

杨振宁在京逝世死因披露 与妻子翁帆最后合影流出

乌娱子酱 浏览 7607

特斯拉Robotaxi撞车率约人类司机4倍

不看车bukanche 浏览 2589

韩安冉自曝新男友为她花了十几万,两人交往仅一个多月

扒虾侃娱 浏览 836

高市早苗求见特朗普要聊聊中国 美国没憋住开口"帮腔"

观察者网 浏览 8273

离婚四年后再看赵丽颖冯绍峰,答案早已一目了然

手工制作阿歼 浏览 3876

这是一个跨越二十四年的纪实长镜头

幕味儿 浏览 3675

事关黄金交易!工、农、中、建、交、邮储,六大行密集公告

上观新闻 浏览 2849

天汽模五年四谋易主 陷增长瓶颈中期扣非降90%

长江商报 浏览 4768

卡其裤+蓝衬衫,简单高级

Yuki女人故事 浏览 4618

李在明表态:韩国站美国一边 但要妥善处理对华关系

澎湃新闻 浏览 15961

潘江:大家的思想包袱还是太重,希望奈特能保持这样的状态

懂球帝 浏览 3150

大电池增程成风,车企在堆料自嗨?

帮宁工作室 浏览 3751

15年离婚拉锯落幕,“中国巴菲特”失去沃华医药实控权

野马财经 浏览 3841

丹麦航运巨头:中东战事加剧全球贸易和物流不确定性

极目新闻 浏览 810

造车,京东方向盘转向的下个万亿市场?

速度计 浏览 4138

500Bar新蓝鲸 CS75PLUS智慧冠军版限时价9.19万元起

网易汽车 浏览 4012

机票“锁座”变相收费 10家航司被约谈

北京商报 浏览 3719

郑智化发声道歉!坦言自己情绪上头用词不当

萌神木木 浏览 4029

Here we go!罗马诺:曼城中场菲利普斯租借加盟谢菲尔德联

懂球帝 浏览 2914

进苏超决赛,泰州主帅:队伍分工明确,三个臭皮匠顶个诸葛亮

懂球帝 浏览 4067
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1