当前位置:首页 > Deepseek应用场景 > 正文内容

英伟达宣布创造满血 DeepSeek 推理世界记录

3个月前 (03-19)Deepseek应用场景178

IT之家 3 月 19 日消息,英伟达在今日举行的 NVIDIA GTC 2025 上宣布其 NVIDIA Blackwell DGX 系统创下 DeepSeek-R1 大模型推理性能的世界纪录。

据介绍,在搭载了八块 Blackwell GPU 的单个 DGX 系统上运行 6710 亿参数的满血 DeepSeek-R1 模型可实现每用户每秒超 250 token 的响应速度,系统最高吞吐量突破每秒 3 万 token。

英伟达表示,随着 NVIDIA 平台继续在最新的 Blackwell Ultra GPU 和 Blackwell GPU 上突破推理极限,其性能将会继续不断提高。

▲ 运行 TensorRT-LLM 软件的 NVL8 配置的 NVIDIA B200 GPU

单节点配置:DGX B200(8 块 GPU)与 DGX H200(8 块 GPU)

测试参数:最新测试采用 TensorRT-LLM 内部版本,输入 1024 token / 输出 2048 token;此前测试为输入 / 输出各 1024 token

计算精度:B200 采用 FP4,H100 / H200 采用 FP8 精度

英伟达表示,通过硬件和软件的结合,他们自 2025 年 1 月以来成功将 DeepSeek-R1 671B 模型的吞吐量提高了约 36 倍。

节点配置:DGX B200(8 块 GPU)、DGX H200(8 块 GPU)、两个 DGX H100(8 块 GPU)系统

测试参数:依然采用 TensorRT-LLM 内部版本,输入 1024 token / 输出 2048 token;此前测试为输入 / 输出各 1024 token;并发性 MAX

计算精度:B200 采用 FP4,H100 / H200 采用 FP8 精度

与 Hopper 架构相比,Blackwell 架构与 TensorRT 软件相结合可实现显著的推理性能提升。

英伟达表示,包括 DeepSeek-R1、Llama 3.1 405B 和 Llama 3.3 70B,运行 TensorRT 软件并使用 FP4 精度的 DGX B200 平台与 DGX H200 平台相比已经提供了 3 倍以上的推理吞吐量提升。

英伟达表示,在对模型进行量化以利用低精度计算优势时,确保精度损失最小化是生产部署的关键。IT之家注意到,在 DeepSeek-R1 模型上,相较于 FP8 基准精度,TensorRT Model Optimizer 的 FP4 训练后量化(PTQ)技术在不同数据集上仅产生微乎其微的精度损失。


“英伟达宣布创造满血 DeepSeek 推理世界记录” 的相关文章

DeepSeek干什么用的?探索人工智能技术的前沿应用

DeepSeek干什么用的?探索人工智能技术的前沿应用

标题:DeepSeek干什么用的?探索人工智能技术的前沿应用关键词:DeepSeek,人工智能,技术创新,大数据,机器学习,智能分析,产业升级描述:深入了解DeepSeek,这款人工智能应用是如何帮助...

车企“抢滩”DeepSeek背后:角力智能座舱,降低投资成本

车企“抢滩”DeepSeek背后:角力智能座舱,降低投资成本

DeepSeek掀起的技术革命正在席卷汽车行业。截至目前,超过20家车企宣布接入DeepSeek模型,涵盖了比亚迪、吉利、奇瑞、岚图、长城、理想汽车等主流品牌。这一情况与2023年ChatGPT爆火时...

李开复力推DeepSeek!零一万物发布模型一体机,搭载华为GPU

李开复力推DeepSeek!零一万物发布模型一体机,搭载华为GPU

第一家全面拥抱DeepSeek的“六小虎”,出现了!不卖关子,它就是李开复亲任CEO的零一万物。今日正式上线万智企业大模型一站式平台,宣布提供企业级DeepSeek部署定制解决方案。而早在今年2月11...

为什么DeepSeek回答前总先“嗯”一下

为什么DeepSeek回答前总先“嗯”一下

在人工智能与人类对话的边界逐渐融合消弭的今天,许多用户发现DeepSeek的回复中常常出现一个有趣的细节——这个AI似乎格外喜欢在回答中插入“嗯”这样的语气词。这个看似简单的小习惯,背后其实藏着人工智...

从DeepSeek的成功经验看原始创新的重要性

从DeepSeek的成功经验看原始创新的重要性

在当今快速发展的科技领域,创新已成为推动进步的核心动力,企业生存和发展的关键。在众多创新类型中,原始创新因其独特性和突破性而备受关注。原始创新不仅能够带来技术上的重大突破,还能为企业创造持久的竞争优势...

加速行业智能化升级,能科科技受邀参加华为温州站 DeepSeek 思享会

加速行业智能化升级,能科科技受邀参加华为温州站 DeepSeek 思享会

5月13日,“DeepSeek+昇腾”加速行业智能化升级——华为DeepSeek思享会在温州国际云软件谷圆满举办。大会就人工智能前沿技术与行业应用展开深入探讨,共商产业智能化升级发展新路径。能科科技(...