当前位置:首页 > Deepseek应用场景 > 正文内容

DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆

1年前 (2025-05-01)Deepseek应用场景607

IT之家 5 月 1 日消息,深度求索(DeepSeek)昨日(4 月 30 日)在 AI 开源社区 Hugging Face 上,发布名为 DeepSeek-Prover-V2-671B 的新模型,随后在 GitHub 等平台上公布了论文信息。

IT之家援引论文介绍,DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源大型语言模型,基于 DeepSeek-V3-0324,通过递归定理证明管道生成初始数据。

Deepseek 推出了 DeepSeek-Prover-V2-671B(结合 V3 基础大模型)、DeepSeek-Prover-V2-7B(增强模型)两个模型,以及 DeepSeek-ProverBench 数据集。

DeepSeek-Prover-V2-671B 采用和 DeepSeek V3-0324 相同的架构,并非用于常规对话或者推理,而是用于形式化定理证明、专门增强数学能力的模型。

DeepSeek 团队首先引导 DeepSeek-V3 模型将复杂定理分解为一系列子目标(subgoals),整合非形式与形式化数学推理,在 Lean 4 平台上形式化证明步骤。

接着,利用一个较小的 7B 参数模型处理子目标的证明搜索,减轻计算负担。最终,结合完整的逐步证明与 DeepSeek-V3 的思维链(chain-of-thought),形成强化学习的“冷启动”数据。

在训练中,团队筛选出一批 7B 模型无法直接解决但子目标已被证明的难题。通过整合子目标证明,形成完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成合成数据。

随后,模型微调这些数据,并通过强化学习进一步提升能力,以二元反馈(正确或错误)作为奖励机制。最终,DeepSeek-Prover-V2-671B 在神经定理证明领域创下新高,在 MiniF2F-test 数据集上通过率达 88.9%,在 PutnamBench 数据集中解决 658 个问题中的 49 个。

团队还发布了 ProverBench 基准数据集,包含 325 个形式化数学问题。其中,15 个问题源自近期 AIME 竞赛(AIME 24 和 25),涉及数论与代数,代表高中竞赛难度。

其余 310 个问题则来自精选教材和教学内容,涵盖线性代数、微积分、概率等多个领域。这一数据集旨在为高中竞赛和本科数学提供全面评估标准,推动模型在多样化场景下的测试与应用。

相关阅读:

《DeepSeek-Prover-V2-671B 新模型开源发布》


“DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆” 的相关文章

海口市检察院举办“DeepSeek应用与创新”主题沙龙

海口市检察院举办“DeepSeek应用与创新”主题沙龙

为深入贯彻最高检“数字检察”战略部署,推动人工智能技术与检察工作深度融合,3月4日,海口市检察院举办2025年第一期“椰城检语·青年智享会”主题沙龙——DeepSeek应用与创新。市院机关各部门干警代...

车企扎堆接入DeepSeek,概念狂欢还是认知革命?|钛度车库

车企扎堆接入DeepSeek,概念狂欢还是认知革命?|钛度车库

原创 韩敬娴 钛媒体▎DeepSeek“上车”关键是看应用的领域,数据是否有效和丰富,场景对输出错误的容忍度。作者|韩敬娴编辑|李玉鹏本文首发于钛媒体APP技术革命的浪潮正加速席卷汽车行业。春节过后,...

警惕不法分子借DeepSeek热度研发出的新型骗局

警惕不法分子借DeepSeek热度研发出的新型骗局

紧 急 预 警广大市民朋友:近期,DeepSeek的热度持续居高不下,这款全能型工具各领域分析处理能力都令人大开眼界。然而,DeepSeek的火爆也让不法分子利用用户渴望尝试DeepSeek却认知不足...

谷歌CEO评DeepSeek:我认为DeepSeek团队做得非常非常出色

谷歌CEO评DeepSeek:我认为DeepSeek团队做得非常非常出色

据凤凰卫视现场报道,北京时间2月12日,在迪拜举行的第12届世界政府峰会(WGS 2025)上,谷歌CEO桑达尔·皮查伊(Sundar Pichai)与阿联酋人工智能部长奥马尔·苏丹·奥拉马(Omar...

朱民:大家现在都在讲DeepSeek,这是未来的全球化

朱民:大家现在都在讲DeepSeek,这是未来的全球化

北京商报讯(记者李海媛)3月25日至3月28日,博鳌亚洲论坛2025年年会在海南博鳌举行。3月27日,在“构建开放世界经济:挑战与出路”分论坛中,中国国际经济交流中心副理事长、国际货币基金组织原副总裁...

中国华能宣布接入DeepSeek

中国华能宣布接入DeepSeek

每经快讯,2月17日,据中国华能官微消息,2月15日,中国华能集团有限公司完成DeepSeek系列模型的本地化部署,推出“睿智小能”AI助手。部署版本包括671B千亿参数级通用大语言模型DeepSee...