当前位置：首页 > DeepSeek技术交流 > 正文内容

新版DeepSeek-V3官方报告出炉：超越GPT-4.5，仅靠改进后训练

1年前 (2025-03-26)DeepSeek技术交流592

明敏发自凹非寺

量子位 | 公众号 QbitAI

刚刚，DeepSeek官方发布DeepSeek-V3模型更新技术报告。

V3新版本在数学、代码类相关评测集成绩超过GPT-4.5！

而且这只是通过改进后训练方法实现。

DeepSeek-V3-0324和之前的DeepSeek-V3使用同样的base模型。

打破了之前传言该版本base模型是R2的传言。

新版本参数量约为660B，与此前网传的685B有所出入。

开源版本上下文长度为128K（网页端、App和API提供 64K 上下文）。

私有化部署时只需要更新checkpoint和tokenizer_config.json（tool calls相关变动）。

目前，想要体验这一版本模型，只需用户登录官方网页、APP、小程序进入对话界面后，关闭深度思考即可体验。API 接口和使用方式保持不变。

官方建议，此后非复杂推理任务使用V3新版本更好。

此外，官方还进一步展示了新版本在各个维度的能力。

前端开发

生成代码可用性更高，视觉效果也更好。

中文写作

相较于R1版有进一步优化，特别提升了中长篇的内容质量。

比如写一篇关于苏轼生平的散文：

中文搜索

联网情况下，V3新版本的搜索输出内容也更详实准确、排版更清晰美观。

现在写一份3000字的市场报告也是so easy（上下滑动查看完整内容）：

此外，V3新版本在工具调用、角色扮演、问答闲聊等方面也进一步提升。

今天白天不少网友也上手实测了诸多能力，比如做个小游戏：

该版本模型采用宽松的MIT开源协议。

且可直接部署在M3 Ultra的Mac Studio上。

这意味着大模型开发应用的门槛更进一步降低。

话不多说，趁着深夜，还没睡的赶紧去体验最新版吧~

原标题：《新版DeepSeek-V3官方报告出炉：超越GPT-4.5，仅靠改进后训练》

标签: DeepSeek 人工智能数据分析应用场景

返回列表

上一篇：DeepSeek V3再次震撼硅谷，中美AI差距突然缩至3个月！

下一篇：DeepSeek-V3升级：评测达75.9%正确率，代码生成提速40%

“新版DeepSeek-V3官方报告出炉：超越GPT-4.5，仅靠改进后训练” 的相关文章

天津滨海新区多领域“拥抱”DeepSeek

连日来，滨海新区数据局积极推动DeepSeek本地化部署，区内各领域、各行业启动适配应用。截至目前，国家超级计算天津中心、滨海智慧集团、天河计算机公司等结合各自业务，探索应用DeepSeek，出炉一系...

返利科技新增“DeepSeek概念”

2025年4月24日，返利科技（600228）新增“DeepSeek概念”。据同花顺数据显示，入选理由是：2025年4月15日互动易，公司在线导购产品“返利”IOS版已接入DeepSeek（深度求索旗...

DeepSeek梁文锋亲自挂名，公开新注意力架构NSA

机器之心报道机器之心编辑部DeepSeek 新论文来了！相关消息刚刚发布到 𝕏 就吸引了大量用户点赞、转发、评论三连。据介绍，DeepSeek 的这篇新论文提出了一种新的注意力机制 ——NSA。这是一...

特斯联特AI接入满血DeepSeek，为职场数智化转型注入新动能

2025年《政府工作报告》明确提出，要持续推进“人工智能+”行动，推动大模型技术向垂直场景渗透。在数字技术与实体经济深度融合的浪潮下，人工智能正加速重构职场办公的底层逻辑。作为AIoT领域的领军企业，...

紫金银行：我行已部署多个Deepseek蒸馏版本用于个性化场景的研究探索

每经AI快讯，有投资者在投资者互动平台提问：董秘您好！请问贵公司是否已经部署了DeepSeek？如果已经部署了，请问主要应用于哪些具体的业务？公司接入DeepSeek有哪些成本、收益方面的考量？如果公...

深度解析：DeepSeek揭示7大时间浪费行为，助你高效管理时间

时间是人生最宝贵的资源，浪费时间等同于慢性自杀。DeepSeek通过大数据分析，揭示了生活中最严重的7大时间杀手，帮助我们深刻反思，重新掌控生活节奏。第一，垃圾娱乐如游戏和短视频虽然短暂放松，但长期沉...