当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布开源周首个成果 可优化英伟达GPU效率

2年前 (2025-02-25)Deepseek最新资讯586

新京报贝壳财经讯(记者罗亦丹)北京时间2月24日上午,DeepSeek发布了其“开源周”的第一项成果:FlashMLA(直译为快速多头潜在注意力机制)的代码。

据了解,MLA(多头潜在注意力机制)正是DeepSeek降低大模型成本使用的关键技术之一,其可以显著减少大模型训练和推理过程中的内存占用,而FlashMLA则是针对Hopper GPU(一种英伟达GPU架构)开发的高效MLA解码内核,其针对可变长度序列进行了优化,目前已投入了生产,其可以使得H800达到3000GB/s内存,实现580TFLOPS(每秒浮点运算次数)计算性能。

贝壳财经记者注意到,根据此前DeepSeek发布V3大模型时公开的技术文档,该大模型正是使用英伟达的H800芯片训练而成。

上海骊翰科技咨询有限公司发文称,FlashMLA能在不损失模型性能的前提下,将缓存体积压缩至原来的1/4,从而大幅降低显存需求。例如,原始需要存储的100GB中间结果,压缩后仅需25GB,通过开源让企业可以直接使用FlashMLA来优化自家模型。随着FlashMLA的普及,AI推理有望进入千元级硬件跑百亿模型的时代。


“DeepSeek发布开源周首个成果 可优化英伟达GPU效率” 的相关文章

DeepSeek问世,加快联想全栈AI战略落地

DeepSeek问世,加快联想全栈AI战略落地

3月4日,在2025年世界移动通信大会期间,世界互联网大会国际组织在西班牙巴塞罗那举办以“打造融合、普惠、绿色的AI算力新生态”为主题的“AI算力发展”专题论坛。联想集团执行副总裁刘军表示,联想已经形...

华为+DeepSeek,终于不再“服务器繁忙”?

华为+DeepSeek,终于不再“服务器繁忙”?

没有人不在期待大模型能够成为下一个电动车,作为代表中国的新兴产业,在世界范围内掀起狂澜。然而主流的MoE架构大模型,却苦于其结构上的“先天不足”:巨大的硬件成本与多重拖累效率的环节,使得中国企业在这场...

从Deepseek到Manus:Al如何重塑企业价值报告

从Deepseek到Manus:Al如何重塑企业价值报告

2025年,AI技术的普及让企业站在了新的十字路口。一方面,产品被颠覆的风险如影随形;另一方面,弯道超车的机会也近在咫尺。DeepSeek的出现,让企业能够以低成本、高质量的方式使用AI技术,这种“A...

教育行业拥抱DeepSeek的浪潮还在继续 学而思×DeepSeek,首发超级学习应用“随时问”

教育行业拥抱DeepSeek的浪潮还在继续 学而思×DeepSeek,首发超级学习应用“随时问”

全教育行业拥抱DeepSeek的浪潮还在继续,在产品层面的落地和结合也开始带来惊喜。学而思今天正式发布接入DeepSeek的全新“随时问”APP。该产品深度融合DeepSeek R1智能推理,依托学而...

宿州以DeepSeek大模型打通“未来之门”

宿州以DeepSeek大模型打通“未来之门”

未来已来。随着chatGPT等大模型,特别是本土大数据语言模型DeepSeek的横空出世,数字化浪潮汹涌而来,人类进入大数据人工智能时代。进入大数据时代,抓好数字化转型,就是抓住了未来。聚“数”集“算...

YY直播接入DeepSeek,推出低延时“YYDS”满血版,开启智能社区新体验

YY直播接入DeepSeek,推出低延时“YYDS”满血版,开启智能社区新体验

近日,YY公司宣布正式接入DeepSeek,并推出了低延时、不卡顿的YY-DeepSeek R1-满血版(简称“YYDS”)。目前,广州津虹YY直播和YY语音等产品已经上线了该产品的入口,供用户使用。...