当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布稀疏注意力技术降低AI推理成本

11个月前 (10-09)Deepseek最新资讯325

  为什么ChatGPT在长对话中会变慢?原因在于一个基础数学挑战:处理长文本序列需要巨大的计算资源,即使已经部署了效率优化技巧。虽然美国科技巨头可以投入更多硬件来解决这个问题,但受到出口限制无法稳定获得先进AI芯片的中国AI公司深度求索(DeepSeek),有着更强的动机从更少的硅芯片中榨取更多性能。

  周一,深度求索发布了其最新模拟推理大语言模型的实验版本DeepSeek-V3.2-Exp,引入了被称为DeepSeek稀疏注意力(DSA)的技术。这是该公司对一项可能已在世界上一些最知名AI模型中使用的计算技术的实现。OpenAI在2019年首创了稀疏Transformer,并使用这项技术构建了GPT-3,而谷歌研究院在2020年发表了使用类似概念的Reformer模型研究。(西方AI公司目前在其最新模型中使用稀疏注意力的全部程度仍未公开。)

  尽管稀疏注意力多年来一直是已知的方法,但深度求索声称其版本首次实现了细粒度稀疏注意力,并将API价格降低了50%以展示效率提升。但要更好地理解DeepSeek v3.2的显著之处,有必要回顾一下AI发展历史。

  深度求索在1月份引起轰动,其R1模拟推理模型据报道在仅花费600万美元训练成本的情况下达到了OpenAI的o1性能水平,其聊天应用一度登顶iPhone应用商店榜首,超越了ChatGPT。所有目光都聚焦在这家让美国顶尖AI实验室感受到竞争压力的公司身上。

  在AI中,注意力是指一种软件技术,用于确定文本中哪些词语与理解彼此最相关。这些关系映射出上下文,而上下文构建了语言的含义。例如,在句子银行提高了利率中,注意力帮助模型确定银行在金融语境中与利率相关,而非河岸语境。通过注意力,概念关系被量化为存储在神经网络中的数字。注意力还控制着AI大语言模型在生成回应的每个词时如何选择最重要的信息。

  用机器计算上下文很复杂,直到GPU等能够并行计算这些关系的芯片达到一定能力水平后,才在规模化应用中变得实用。即便如此,2017年的原始Transformer架构以一种暴力破解的方式检查提示词中每个词与其他所有词的关系。因此,如果向AI模型输入1000个词的提示,就会产生1000×1000次比较,即需要计算100万个关系。对于10000个词,这变成了1亿个关系。成本呈二次方增长,这为处理长对话创造了根本性瓶颈。

  尽管OpenAI可能在GPT-5中使用了某些稀疏注意力技术,但长对话仍然会遭受性能损失。每次向ChatGPT提交新回应时,其核心的AI模型都会重新处理整个对话历史的上下文比较。

  当然,原始Transformer模型的研究者将其设计用于相对较短序列的机器翻译(可能几百个Token,Token是代表词语的数据块),在这种情况下二次方注意力是可管理的。当人们开始扩展到数千或数万个Token时,二次方成本变得令人望而却步。

  稀疏注意力的工作方式不同。它不是检查每个词与每个词的关系,而是只检查模型确定最相关的词关系子集。例如,在处理文档中第5000个词时,模型可能只检查其与100个精心选择的早期词语的关系,而不是所有4999个前面的词语。

  深度求索的模型通过训练获得了确定哪些关系优先的能力,使用被深度求索称为闪电索引器的技术。如深度求索关于新模型的论文所述,这个小型神经网络组件对词对之间的相关性进行评分,并为每个词选择前2048个最重要的连接,尽管论文没有完全解释这个索引器如何做出决策deepseek。深度求索声称其实现可以识别哪些连接可以跳过,而不会降低模型对整体文本的理解。

  DeepSeek-V3.2-Exp建立在该公司之前的V3.1-Terminus模型基础上,但融入了DeepSeek稀疏注意力。根据该公司的基准测试,实验模型即使在使用稀疏注意力的情况下,性能也与其前身相当。

  值得注意的是,与OpenAI和Anthropic的高端AI模型不同,该版本包含在MIT许可证下的开源组件和开放权重,允许其他研究者在此基础上构建工作。

  TechCrunch报道称,深度求索的初步测试发现,在长上下文情况下,API成本可以减少多达一半。然而,这些基准测试来自深度求索的自己测试,第三方研究者还没有时间独立验证性能声明或验证效率改进。但如果研究结果得到证实,稀疏注意力技术的改进可能会随着时间推移大幅降低AI推理成本。

  A:DeepSeek稀疏注意力(DSA)是一种计算技术,不同于传统方法检查每个词与每个词的关系,它只检查模型确定最相关的词关系子集。通过闪电索引器组件为每个词选择前2048个最重要的连接,从而大幅减少计算量。

  A:原因在于传统Transformer架构采用二次方注意力机制,需要检查每个词与其他所有词的关系。1000个词需要100万次比较,10000个词需要1亿次比较,成本呈二次方增长,创造了处理长对话的根本性瓶颈。

  A:根据深度求索的初步测试,在长上下文情况下API成本可以减少多达50%。该公司已将API价格降低50%来展示效率提升,不过这些基准测试来自深度求索自己的测试,还需要第三方研究者独立验证。原文出处:DeepSeek发布稀疏注意力技术降低AI推理成本,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek发布稀疏注意力技术降低AI推理成本” 的相关文章

DeepSeek突传重磅!一图梳理AI芯片概念股

DeepSeek突传重磅!一图梳理AI芯片概念股

  时报,周二市场上突然传出,DeepSeek-R2的预计发布时间窗口为2025年8月15日至8月30日,但具体日期尚未官宣。   市场期盼DeepSeek-R2已经有一...

2025盘点:DeepSeek引领AI进化 国补激发消费活力 行业重塑带来更多可

2025盘点:DeepSeek引领AI进化 国补激发消费活力 行业重塑带来更多可

  2025年即将迎来尾声,身处数码3C行业的我们也经历了跌宕起伏的一年。在这一年中,我们见证了国产AI大模型群雄并起,与国外顶尖选手一较高下;我们惊讶于各种新形态产品、新技术的诞生与上市...

2026年1月21日DeepSeek预测:森林狼vs爵士,爱德华兹率队客场取胜

2026年1月21日DeepSeek预测:森林狼vs爵士,爱德华兹率队客场取胜

  NBA常规赛即将迎来一场西部对决,爵士将在主场迎战森林狼。爵士作为联盟传统强队,本赛季表现不佳,目前以14胜29负的战绩排名西部第13位。而森林狼则以27胜16负的战绩高居西部第4,两...

2025年度全球50家聪明公司榜单发布,DeepSeek、华为等中国企业入选

2025年度全球50家聪明公司榜单发布,DeepSeek、华为等中国企业入选

  DeepSeek、宇树科技、华为deepseek、小米、比亚迪、科大讯飞等多家中国企业成功入选,展现中国创新力量!   “聪明公司”不仅以技术驱动未来,更以商业智慧实...

12月5日DeepSeek预测:勇士vs76人,库里缺阵马克西能否率队主场复仇?

12月5日DeepSeek预测:勇士vs76人,库里缺阵马克西能否率队主场复仇?

  北京时间12月5日早8点,NBA常规赛将迎来勇士客场挑战76人的焦点战。目前勇士以11胜11负排名西部第8,76人则以11胜9负暂列东部第9,双方胜场数相同但76人少赛2场。本场比赛对...

贵旅“年度精彩瞬间”丨“黄小西”数字人智慧导游“活”起来

贵旅“年度精彩瞬间”丨“黄小西”数字人智慧导游“活”起来

  甚至并非真人,而是贯穿旅途始终的智能伙伴——她就是由贵州贵旅数网科技有限公司基于贵州旅游行业大模型打造的AI旅游智能体“黄小西”。   “黄小西”之名,本身就是一张生...