当前位置:首页 > Deepseek最新资讯 > 正文内容

刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apac

9个月前 (12-03)Deepseek最新资讯219

  Mistral 表示:「所有模型均采用 Apache 2.0 许可证发布。以多种压缩格式开源我们的模型,能够赋能开发者社区,并通过分布式智能将 AI 交到人们手中。」

  该公司也声称:「Ministral 模型代表了同类产品中最佳的性价比。与此同时,Mistral Large 3 也跻身于前沿指令微调开源模型的行列。」

  Mistral Large 3 是 Mistral 自开创性的 Mixtral 系列以来的首个混合专家模型,代表了 Mistral 在预训练方面迈出的重要一步deepseek。经过后训练,该模型在通用提示词上达到了与市场上最好的指令微调开放权重模型同等的水平,同时展现了图像理解能力,并在多语言对话(即非英语 / 中文环境)中表现出一流的性能。

  值得注意的是,Mistral 在这里并没有对比刚发布几天的 DeepSeek-V3.2 正式版,可能是因为 DeepSeek 没有发布在普通语言任务上的基准测试结果,仅给出了推理和智能体任务的基准结果。

  Mistral Large 3 在 LMArena 排行榜的 OSS(开源软件)非推理模型类别中首次亮相即排名第 2(在所有开放模型中排名第 6),是性能最好的开放模型之一。

  另外,他们还强调与英伟达的合作:「交付先进的开源 AI 模型需要广泛的优化,这通过与 NVIDIA 的合作得以实现。我们所有的新 Mistral 3 模型,从 Large 3 到 Ministral 3,都在 NVIDIA Hopper GPU 上进行了训练,以利用高带宽 HBM3e 内存来处理前沿规模的工作负载。NVIDIA 的极致协同设计(co-design)方法将硬件、软件和模型融为一体。NVIDIA 工程师为整个 Mistral 3 系列实现了对 TensorRT-LLM 和 SGLang 的高效推理支持,从而实现高效的低精度执行。

  针对 Large 3 的稀疏 MoE 架构,英伟达集成了最先进的 Blackwell 注意力和 MoE 内核,增加了对预填充 / 解码分离服务的支持,并与 Mistral 在推测性解码(方面进行合作,使开发者能够在 GB200 NVL72 及更高版本的硬件上高效地服务长上下文、高吞吐量的工作负载。在边缘端,NVIDIA 为 DGX Spark、RTX PC 和笔记本电脑以及 Jetson 设备提供了 Ministral 模型的优化部署方案,为开发者提供了一条从数据中心到机器人运行这些开放模型的一致且高性能的路径。」

  此外,对于每种尺寸,他们都向社区发布了基础版(base)、指令版(instruct)和推理版(reasoning)变体,每种都具备图像理解能力,且全部采用 Apache 2.0 许可证。

  Mistral 重点强调:「Ministral 3 实现了所有开源模型中最佳的性价比。在实际用例中,生成的 token 数量和模型大小同等重要。Ministral 指令模型与其同类模型的性能相当或更好,同时生成的 token 数量通常要少一个数量级。」

  另外,Ministral 推理变体可以进行更长时间的思考,以在其权重级别中产生最先进的准确性 —— 例如,其 14B 变体在 AIME ‘25 上达到了 85% 的准确率。

  对于寻求量身定制 AI 解决方案的组织,Mistral AI 也提供了定制模型训练服务,以微调或完全适配模型来满足自己的特定需求。

  该公司表示:「无论是针对特定领域任务进行优化、提高在专有数据集上的性能,还是在独特环境中部署模型,我们的团队都会与您合作构建符合您目标的 AI 系统。对于企业级部署,定制训练可确保您的 AI 解决方案安全、高效且大规模地交付最大影响力。」

  Mistral 早期的模型采用 Apache 2.0 开源许可,属于真正开放权重;但随着公司推出更大型、更高性能的旗舰模型(如 Mistral Large),逐步转向闭源与商业授权。可以说,Mistral 此次全线回归 Apache 2.0 协议,某种程度上是被 DeepSeek「逼」出来的战略调整。

  在过去的一段时间里,DeepSeek 以极致的推理成本和激进的开源策略迅速抢占了全球开发者社区的心智,一度让坚持「开放权重但限制商用」的中间派厂商陷入被动。

  Mistral 3 的发布,可以看作是这家法国独角兽对 DeepSeek 发起的正面追赶:不仅在 MoE(混合专家)架构上继续深耕,更试图通过端侧模型(Ministral)的差异化优势,在被中美巨头挤压的缝隙中杀出一条血路。原文出处:刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apache 2.0,感谢原作者,侵权必删!

标签: deepseek

“刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apac” 的相关文章

1月12日DeepSeek预测:奇才vs太阳,布克率队延续连胜,奇才难逃连败

1月12日DeepSeek预测:奇才vs太阳,布克率队延续连胜,奇才难逃连败

  东部垫底的华盛顿奇才(10胜27负,胜率0.27)将客场挑战西部第七的菲尼克斯太阳(23胜15负,胜率0.605)。奇才目前排名东部第14,距离季后赛席位渐行渐远;而太阳则需巩固西部前...

1月1日 DeepSeek预测:掘金vs猛龙 约基奇缺阵,猛龙能否终结交锋连败?

1月1日 DeepSeek预测:掘金vs猛龙 约基奇缺阵,猛龙能否终结交锋连败?

  新年首战,多伦多猛龙将在主场迎战丹佛掘金。作为东部第四的劲旅,猛龙近期状态回暖(3胜2负),而西部第三的掘金虽遭遇两连败,但历史交锋5战全胜的碾压战绩仍让本场充满悬念。...

1月27日DeepSeek预测:老鹰主场迎战步行者,特雷杨率队冲击三连胜

1月27日DeepSeek预测:老鹰主场迎战步行者,特雷杨率队冲击三连胜

  北京时间1月27日凌晨2:30,NBA常规赛将迎来一场东部对决,亚特兰大老鹰队将在主场迎战印第安纳步行者队。老鹰目前排名东部第10,战绩为22胜25负,胜率46.8%;步行者则排名东部...

英伟达「抛弃」游戏玩家,黄仁勋却夸 DeepSeek「让全世界大吃一惊」

英伟达「抛弃」游戏玩家,黄仁勋却夸 DeepSeek「让全世界大吃一惊」

  准确地说,5 年来首次在 CES 大会不发消费级显卡。没有 RTX 6090,没有游戏性能提升,没有光追演示。   他发布了下一代 AI 超算,发布了会「思考」的自动...

乔丹当年有没有退役巡演?詹姆斯会否学他

乔丹当年有没有退役巡演?詹姆斯会否学他

  你说的是碧昂丝和jayz吧,因为吹牛老爹的事受点舆论牵连,蕾哈娜和ASAP rocky没听说受啥影响啊。   你说的是碧昂丝和jayz吧,因为吹牛老爹的事受点舆论牵连...

国产AI王者归来!科创人工智能ETF(589520)盘中拉升2.5%!DeepS

国产AI王者归来!科创人工智能ETF(589520)盘中拉升2.5%!DeepS

  。这是时隔4年之后,华为麒麟芯片首次公开展示。此外,余承东宣布鸿蒙5.0系统设备数突破1400万。   iPhone 17发售在即,开源证券指出,随着关税问题落地、苹...