当前位置:首页 > Deepseek应用场景 > 正文内容

LMArena模型榜单出炉!DeepSeek-R1编程能力赶超了Claude Opus 4

5个月前 (06-17)Deepseek应用场景519

机器之心报道

编辑:杜伟

在开源模型领域,DeepSeek 又带来了惊喜。

上个月 28 号,DeepSeek 来了波小更新,其 R1 推理模型升级到了最新版本(0528),并公开了模型及权重。

这一次,R1-0528 进一步改进了基准测试性能,提升了前端功能,减少了幻觉,支持 JSON 输出和函数调用。

今天,业界知名、但近期也陷入争议(曾被指出对 OpenAI、谷歌及 Meta 的大模型存在偏袒)的大模型公共基准测试平台 LMArena 公布了最新的性能排行榜,其中 DeepSeek-R1(0528)的成绩尤为引人瞩目。

其中,在文本基准测试(Text)中,DeepSeek-R1(0528)整体排名第 6,在开放模型中排名第一。

具体到以下细分领域:

在硬提示词(Hard Prompt)测试中排名第 4

在编程(Coding)测试中排名第 2

在数学(Math)测试中排名第 5

在创意性写作(Creative Writing)测试中排名第 6

在指令遵循(Intruction Fellowing)测试中排名第 9

在更长查询(Longer Query)测试中排名第 8

在多轮(Multi-Turn)测试中排名第 7

此外,在 WebDev Arena 平台上,DeepSeek-R1(0528)与 Gemini-2.5-Pro-Preview-06-05、Claude Opus 4 (20250514) 等闭源大模型并列第一,在分数上更是超过了 Claude Opus 4。

WebDev Arena 是 LMArena 团队开发的实时 AI 编程竞赛平台,让各家大语言模型进行网页开发挑战,衡量的是人类对模型构建美观且功能强大的 Web 应用能力的偏好。

DeepSeek-R1(0528)表现出来的强大性能激起了更多人使用的欲望。

还有人表示,鉴于 Claude 长期以来一直是 AI 编程领域的基准,如今 DeepSeek-R1(0528)在性能上与 Claude Opus 相当,这是一个里程碑时刻,也是开源 AI 的关键时刻。

DeepSeek-R1(0528)在完全开放的 MIT 协议下提供了领先的性能,并能与最好的闭源模型媲美。虽然这一突破在 Web 开发中最为明显,但其影响可能延伸到更广泛的编程领域。

不过,原始性能并不能定义现实世界的表现。虽然 DeepSeek-R1(0528)在技术能力上可能与 Claude 相当,但其是否可以在日常工作流程中提供媲美 Claude 的用户体验,这些需要更多的实际验证。

高强度使用过 DeepSeek-R1(0528)的小伙伴,可以在评论区留言,谈一谈自己的体验感受。

参考链接:

https://lmarena.ai/leaderboard/text

https://x.com/lmarena_ai/status/1934650639906197871


“LMArena模型榜单出炉!DeepSeek-R1编程能力赶超了Claude Opus 4” 的相关文章

DeepSeek R2来了?全新推理时Scaling论文联手清华震撼发布!

DeepSeek R2来了?全新推理时Scaling论文联手清华震撼发布!

新智元报道编辑:Aeneas 犀牛【新智元导读】DeepSeek新论文来了!在清华研究者共同发布的研究中,他们发现了奖励模型推理时Scaling的全新方法。DeepSeek R2,果然近了。最近,De...

按下AI产业发展“加速键”,湖北移动全面加快DeepSeek部署

按下AI产业发展“加速键”,湖北移动全面加快DeepSeek部署

今年以来,国产AI大模型DeepSeek热度持续攀升,引发国资央企新一轮合作热潮,近日,记者从中国移动湖北公司获悉,在武汉光谷未来科技城——中国移动大模型产业创新基地(湖北),依托九天大模型MaaS平...

北京首个!顺义基础教育领域部署DeepSeek大模型

北京首个!顺义基础教育领域部署DeepSeek大模型

据北京顺义区消息,近日,顺义在北京市基础教育领域率先部署DeepSeek-R1人工智能大模型,以人工智能促进教育高质量发展,开启顺义智慧教育新篇章。顺义教委相关负责人表示,DeepSeek在教育领域的...

大连银行牵手DeepSeek开启金融智能化转型新篇章

大连银行牵手DeepSeek开启金融智能化转型新篇章

在数字化时代的浪潮下,DeepSeek大模型的迅速崛起正深刻改变着各个行业的发展格局,在银行业更是掀起了一场技术变革。日前,大连银行凭借多年来在人工智能领域的精耕细作和对大模型技术的沉淀积聚,依托开源...

华为+DeepSeek,终于不再“服务器繁忙”?

华为+DeepSeek,终于不再“服务器繁忙”?

没有人不在期待大模型能够成为下一个电动车,作为代表中国的新兴产业,在世界范围内掀起狂澜。然而主流的MoE架构大模型,却苦于其结构上的“先天不足”:巨大的硬件成本与多重拖累效率的环节,使得中国企业在这场...

航天宏图:DeepSeek已经部署完毕

航天宏图:DeepSeek已经部署完毕

每经快讯,航天宏图(688066)2月18日在互动平台表示,DeepSeek已经部署完毕,并在天权智能体上线。每日经济新闻...