当前位置:首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练

4个月前 (03-26)DeepSeek技术交流291

明敏 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5!

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B,与此前网传的685B有所出入。

开源版本上下文长度为128K(网页端、App和API提供 64K 上下文)。

私有化部署时只需要更新checkpoint和tokenizer_config.json(tool calls相关变动)。

目前,想要体验这一版本模型,只需用户登录官方网页、APP、小程序进入对话界面后,关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议,此后非复杂推理任务使用V3新版本更好。

此外,官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高,视觉效果也更好。

中文写作

相较于R1版有进一步优化,特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文:

中文搜索

联网情况下,V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy(上下滑动查看完整内容):

此外,V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力,比如做个小游戏:

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说,趁着深夜,还没睡的赶紧去体验最新版吧~


原标题:《新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练》


“新版DeepSeek-V3官方报告出炉:超越GPT-4.5,仅靠改进后训练” 的相关文章

DeepSeek说:你最看重人类的五个品质是什么?

DeepSeek说:你最看重人类的五个品质是什么?

1. 共情能力(Empathy)(1)核心价值:能够感知他人情绪、理解不同立场的核心能力,是建立信任、化解冲突的基础。(2)现实意义:◦在人际关系中避免“自我中心”陷阱(如职场沟通、家庭矛盾)。◦推动...

西安举办“解码DeepSeek——大模型技术与应用主题论坛”

西安举办“解码DeepSeek——大模型技术与应用主题论坛”

2月21日,由西安市科学技术局指导,西安电子科技大学人工智能学院、西安市人工智能产业发展联盟等主办的“解码DeepSeek——大模型技术与应用主题论坛”在西安市举行。本次论坛聚焦以DeepSeek为代...

探索跳跃式思维链:DeepSeek创造力垫底,Qwen系列接近人类顶尖水平

探索跳跃式思维链:DeepSeek创造力垫底,Qwen系列接近人类顶尖水平

在大语言模型 (LLM) 的研究中,与以 Chain-of-Thought 为代表的逻辑思维能力相比,LLM 中同等重要的 Leap-of-Thought 能力,也称为创造力,目前的讨论和分析仍然较少...

调用 DeepSeek 的 API 会导致数据泄露吗?

调用 DeepSeek 的 API 会导致数据泄露吗?

调用 DeepSeek 的 API 会导致数据泄露吗?调用DeepSeek的API可能会导致数据泄露。以下是主要原因和建议措施:主要原因:未授权访问:DeepSeek的服务API接口(如http://...

车企扎堆接入DeepSeek,真有用还是纯噱头?

车企扎堆接入DeepSeek,真有用还是纯噱头?

今年春节前后,一场围绕DeepSeek展开的“AI风暴”席卷汽车行业。《消费者报道》统计发现,截至2月20日,已有20余家车企和品牌宣布与DeepSeek深度融合,包括吉利、奇瑞、长安、上汽、东风、广...

启明创投创始人:中国创新药的“DeepSeek时刻”

启明创投创始人:中国创新药的“DeepSeek时刻”

中国AI DeepSeek引爆全球,但生物技术领域正在发生一场更为静默的革命。曾经生产仿制药的中国制药公司,现在正崛起成为快速、高效的药物发现领域的全球领导者。近日,资本市场关注到了创新药领域的这场革...