当前位置:首页 > Deepseek应用场景 > 正文内容

DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆

12个月前 (05-01)Deepseek应用场景603

IT之家 5 月 1 日消息,深度求索(DeepSeek)昨日(4 月 30 日)在 AI 开源社区 Hugging Face 上,发布名为 DeepSeek-Prover-V2-671B 的新模型,随后在 GitHub 等平台上公布了论文信息。

IT之家援引论文介绍,DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源大型语言模型,基于 DeepSeek-V3-0324,通过递归定理证明管道生成初始数据。

Deepseek 推出了 DeepSeek-Prover-V2-671B(结合 V3 基础大模型)、DeepSeek-Prover-V2-7B(增强模型)两个模型,以及 DeepSeek-ProverBench 数据集。

DeepSeek-Prover-V2-671B 采用和 DeepSeek V3-0324 相同的架构,并非用于常规对话或者推理,而是用于形式化定理证明、专门增强数学能力的模型。

DeepSeek 团队首先引导 DeepSeek-V3 模型将复杂定理分解为一系列子目标(subgoals),整合非形式与形式化数学推理,在 Lean 4 平台上形式化证明步骤。

接着,利用一个较小的 7B 参数模型处理子目标的证明搜索,减轻计算负担。最终,结合完整的逐步证明与 DeepSeek-V3 的思维链(chain-of-thought),形成强化学习的“冷启动”数据。

在训练中,团队筛选出一批 7B 模型无法直接解决但子目标已被证明的难题。通过整合子目标证明,形成完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成合成数据。

随后,模型微调这些数据,并通过强化学习进一步提升能力,以二元反馈(正确或错误)作为奖励机制。最终,DeepSeek-Prover-V2-671B 在神经定理证明领域创下新高,在 MiniF2F-test 数据集上通过率达 88.9%,在 PutnamBench 数据集中解决 658 个问题中的 49 个。

团队还发布了 ProverBench 基准数据集,包含 325 个形式化数学问题。其中,15 个问题源自近期 AIME 竞赛(AIME 24 和 25),涉及数论与代数,代表高中竞赛难度。

其余 310 个问题则来自精选教材和教学内容,涵盖线性代数、微积分、概率等多个领域。这一数据集旨在为高中竞赛和本科数学提供全面评估标准,推动模型在多样化场景下的测试与应用。

相关阅读:

《DeepSeek-Prover-V2-671B 新模型开源发布》


“DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆” 的相关文章

DeepSeek新版本又“偷偷”变强了!苹果CEO库克此前回应:好极了

DeepSeek新版本又“偷偷”变强了!苹果CEO库克此前回应:好极了

3月24日深夜,中国人工智能初创公司深度求索(DeepSeek)低调上线了DeepSeek-V3的新版本DeepSeek-V3-0324,参数量为6850亿,在代码、数学、推理等多个方面的能力再次显著...

九号公司:九号出行APP已率先完成DeepSeek-R1的接入

九号公司:九号出行APP已率先完成DeepSeek-R1的接入

每经AI快讯,有投资者在投资者互动平台提问:请问下我们公司是否有将deepseek嵌入到相关产品中,发挥产品更大的功能?九号公司(689009.SH)4月22日在投资者互动平台表示,2025年2月14...

商业银行接入DeepSeek大赛:谁抢先,谁落后

商业银行接入DeepSeek大赛:谁抢先,谁落后

银行正加速DeepSeek系列模型本地化部署工作,“含D量”比拼战局愈演愈烈。3月8日,工商银行宣布于近期完成DeepSeek最新开源大模型的私有化部署,并将其接入行内“工银智涌”大模型矩阵体系。据北...

DeepSeek致谢腾讯大模型网络提速技术方案贡献,助力大模型通信性能提升30%

DeepSeek致谢腾讯大模型网络提速技术方案贡献,助力大模型通信性能提升30%

5月7日,科技领域迎来一则备受瞩目的消息:腾讯技术团队针对DeepSeek开源的DeepEP通信框架展开了深度且细致的优化工作,经过不懈努力,成功让该框架在多种复杂多变的网络环境下均实现了显著的性能提...

开启智慧医疗新篇章 四川广元这家医院率先完成DeepSeek本地化部署

开启智慧医疗新篇章 四川广元这家医院率先完成DeepSeek本地化部署

封面新闻记者 刘彦谷3月7日,记者从广元市中心医院了解到,在医疗行业加速数字化转型的关键节点,该院在区域内率先完成基于国产化服务器的DeepSeek智能中枢本地化部署。这一举措通过构建自主可控的AI基...

江苏九三科学讲坛|教你用DeepSeek

江苏九三科学讲坛|教你用DeepSeek

3月22日下午,江苏九三科学讲坛邀请九三学社社员、江苏未来网络集团有限公司技术方案部副总监秦子健做客“金陵科普讲坛",主讲“驾驭信息海洋的终极奥义——教你用DeepSeek”的科普讲座。讲座...