当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek开源Engram论文,梁文锋领衔提出条件记忆新机制

7个月前 (01-13)Deepseek最新资讯95

  【#DeepSeek又开源了# 梁文锋署名新论文发布,实习生挑大梁】智东西1月13日报道,昨晚,DeepSeek又开源了,还发布一篇新论文。这次,他们提出了一种全新的“条件记忆”机制——Engram,旨在让MoE模型在保持巨量参数的同时,更高效地处理语言信息。

  DeepSeek创始人兼CEO梁文锋、北大王选计算机研究所的赵东岩和张辉帅教授都在论文中署名。Engram架构的核心优势在于以更低成本实现更优性能。训练计算量较MoE减少18%的情况下,在32768个token的长上下文任务中,Engram在RULER基准测试中反超同参数量MoE模型。

  并且,其浅层部署的记忆模块接管局部依赖与静态知识存储,为注意力机制腾出容量以专注全局推理,1000亿参数记忆表卸载后使H800推理吞吐量降幅不足3%。

  DeepSeek还观察到,增加记忆槽位数量能持续、稳定地降低验证损失,这意味着Engram提供了一个可预测的Scaling新手段:增大记忆容量持续带来收益,而无需增加计算量。

  那这种效果究竟是如何实现的呢?如今的MoE模型虽然在计算层面做到了稀疏化,但是它处理信息的方式仍然很费劲:有些老生常谈的事实性内容,比如常见的名字、公式或固定表达,模型却要重复计算,非常耗时间。

  DeepSeek的做法是,把这些“固定知识”提前整理成一个可以快速查询的表格,这样就能把更多精力放在真正需要深度思考的任务上,比如复杂推理或者理解长段文本deepseek

  值得一提的是,论文的第一作者Xin Cheng(程信)目前在北京大学智能学院攻读博士学位,主要研究大模型的高效参数化方法和机制。他同时也在DeepSeek工作,R1、V3的研究都参与了,很有可能是实习生。

  在论文摘要中,DeepSeek提出,条件记忆(conditional memory)将成为下一代稀疏模型中不可或缺的建模原语。这或许意味着DeepSeek-V4有望整合条件记忆机制,实现知识高效检索与推理能力的飞跃。原文出处:DeepSeek开源Engram论文,梁文锋领衔提出条件记忆新机制,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek开源Engram论文,梁文锋领衔提出条件记忆新机制” 的相关文章

微信、抖音、DeepSeek,集体官宣!

微信、抖音、DeepSeek,集体官宣!

  国家互联网信息办公室、工业和信息化部、公安部、国家广播电视总局制定了《人工智能生成合成内容标识办法》,   《标识办法》明确,人工智能生成合成内容标识主要包括显式标识...

DeepSeek预测:马德里竞技VS西班牙人!格列兹曼率队复仇or米拉再演弑旧主

DeepSeek预测:马德里竞技VS西班牙人!格列兹曼率队复仇or米拉再演弑旧主

  床单军团目前以45分排名第4,仅领先第5名贝蒂斯4分。本赛季主场7胜3平2负的战绩虽位列联赛第4,但近期连续被巴列卡诺3球羞辱、欧冠附加赛遭比甲球队逼平,暴露出防线松动问题(近5场丢1...

DeepSeek-R2计划8月中下旬发布 寒武纪午后涨停

DeepSeek-R2计划8月中下旬发布 寒武纪午后涨停

  【DeepSeek-R2计划8月中下旬发布 寒武纪午后涨停】8月12日,人工智能概念股集体大爆发,午后“寒王”寒武纪封住20CM涨停deepseek,报848.88元/股,总市值达到3...

从架构师到国家智库成员:呼延正勇的技术攀登与价值创造

从架构师到国家智库成员:呼延正勇的技术攀登与价值创造

  近日,信息技术领域传来佳音:西安寰宇卫星测控与数据应用有限公司高级架构工程师呼延正勇正式入选国家财政部评审专家库。这位2023年加入公司的技术专家,用两年多时间完成从企业技术骨干到国家...

1月14日DeepSeek预测:公牛vs火箭,杜兰特率队主场止颓,武切维奇难救主

1月14日DeepSeek预测:公牛vs火箭,杜兰特率队主场止颓,武切维奇难救主

  1月14日丰田中心将迎来一场关键对决,东部第10的公牛(18胜20负)挑战西部第7的火箭(22胜14负)。公牛距离附加赛区仅差1.5个胜场,而火箭正面临三连败危机,此役可能成为双方赛季...

消息称DeepSeek V4模型让华为等早期访问,不让英伟达AMD先用

消息称DeepSeek V4模型让华为等早期访问,不让英伟达AMD先用

  IT之家 2 月 27 日消息,据路透社 2 月 26 日报道,两位了解情况的消息人士表示,DeepSeek 在即将进行重大模型更新之前,   相反,DeepSeek...