当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek开源第一个用于混合专家模型训练和推理的高效专家并行通信库

6个月前 (02-25)Deepseek最新资讯329

【DeepSeek开源第一个用于混合专家模型训练和推理的高效专家并行通信库】财联社2月25日电,DeepSeek在“开源周”的第二天向公众开源了DeepEP。据介绍,DeepEP是第一个用于MoE(混合专家)模型训练和推理的EP(Expert Parallelism,专家并行)通信库,可以实现高效且优化的全对全通信,支持包括FP8在内的低精度运算,适配现代高性能计算需求。同时,DeepEP针对NVLink到RDMA的非对称带宽转发场景进行了深度优化,不仅提供了高吞吐量,还支持SM(Streaming Multiprocessors)数量控制,兼顾训练和推理任务的高吞吐量表现。对于延迟敏感的推理解码场景,DeepEP还提供了纯RDMA的低延迟内核,支持自适应路由,能实现更灵活的GPU资源控制,满足不同场景需求。

“DeepSeek开源第一个用于混合专家模型训练和推理的高效专家并行通信库” 的相关文章

中国工程院院士张亚勤:无人驾驶将迎来“DeepSeek时刻”|院士上封面

中国工程院院士张亚勤:无人驾驶将迎来“DeepSeek时刻”|院士上封面

封面新闻记者 边雪过去数十年,从沟通、消费、娱乐到生产、交通、商业往来,无不深深烙刻上数字化的印记。在中国工程院院士,清华大学智能产业研究院(AIR)院长张亚勤眼中,数字世界正逐步与物理世界、生物世界...

专访学而思CTO田密:接入DeepSeek改变的不只是产品

专访学而思CTO田密:接入DeepSeek改变的不只是产品

开源的DeepSeek大模型火了,在线教育行业也因此卷起千层浪花。近期,学而思、网易有道、中公教育、猿辅导、作业帮等头部企业密集宣布接入DeepSeek大模型,这引发了业界广泛关注。DeepSeek为...

四川长虹:长虹AI TV已正式接入DeepSeek

四川长虹:长虹AI TV已正式接入DeepSeek

金融界3月27日消息,有投资者在互动平台向四川长虹提问:董秘您好!请问贵公司是否已经部署了DeepSeek?如果已经部署了,请问主要应用于哪些具体的业务?公司接入DeepSeek有哪些成本、收益方面的...

白云机场:目前已在本地部署DeepSeek

白云机场:目前已在本地部署DeepSeek

证券日报网讯 白云机场3月26日在互动平台回答投资者提问时表示,目前已在本地部署DeepSeek,同时组织研究制定DeepSeek应用开发工作推进方案。现阶段主要聚焦在内部管理效率提升,比如知识库建立...

DeepSeek引发国际关注 外交部回应

DeepSeek引发国际关注 外交部回应

据央视新闻消息,2月10日,外交部发言人郭嘉昆主持例行记者会。有记者就深度求索(DeepSeek)引发国际社会广泛讨论一事提问。对此,郭嘉昆表示,具体的专业问题建议你向主管部门了解。我想强调的是,当前...

deepseek怎么写百万字的小说

deepseek怎么写百万字的小说

利用DeepSeek(或类似的人工智能写作助手)来写一部百万字的小说是一个庞大而复杂的任务,需要周密的计划和策略。以下是一些建议,帮助你利用AI助手完成这一壮举:1. 明确小说主题与大纲确定...