当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏

5个月前 (03-16)Deepseek最新资讯48

  但问题是,当架构创新越来越多时,理解它们反而变得越来越困难。不同论文里的模型结构图风格各异、模块命名不统一,即便是研究者,也很难快速看清一个模型究竟在哪些地方做出了关键改动。

  如果把过去几年主流模型的架构放在一起,你会发现一个明显的空白:我们拥有大量模型,却缺少一张清晰的大模型架构图。

  最近,AI 研究者 Sebastian Raschka 就尝试给了这样一张图,他将过去几年主流大模型的结构重新绘制,并整理成了一个在线图谱 「LLM Architecture Gallery」。

  从「LLM Architecture Gallery」页面结构上看,这个图谱几乎像一张大模型名录。

  这里汇集了大量近年来出现的主流模型,包括 Llama、DeepSeek、Gemmadeepseek、Mistral、Qwen、Kimi、GLM等多个系列,参数规模从几亿参数的小模型,一直延伸到千亿乃至万亿级模型。

  每一张模型卡都会展示该模型的核心架构图、关键模块设计、参数规模、发布时间、相关概念等基本信息,让读者能够在同一套视觉框架下快速理解模型的结构组成。

  不止 DeepSeek R1,像 Gemma、Llama 等一系列主流模型,也都被纳入这一图谱之中。用户只需点击对应模型名称,就可以进入该模型的专属页面,查看其完整架构示意图以及关键设计细节。

  对于研究者而言,「LLM Architecture Gallery」相当于提供了一份可快速查阅的大模型架构索引,用户可以在一个页面中浏览和对比不同模型的设计思路,模型架构的关键创新点,从而更高效地理解技术演化路径,也为后续的研究和模型设计提供参考。

  正如 AI 研究者 Andrej Karpathy 所评价的那样:「这简直就是一个创意、想法的资源库。」原文出处:DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏画廊!,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏” 的相关文章

寒武纪、华为昇腾适配DeepSeek最新模型,国产芯片产业链有望全面受益

寒武纪、华为昇腾适配DeepSeek最新模型,国产芯片产业链有望全面受益

  节后市场将进入三季度披露期,聪明资金节前提前埋伏三季度业绩改善主线。截至9月29日,申万半导体行业近5日合计获主力资金净流入262亿元,在124个二级子行业中高居第一。...

DeepSeek、GPT-5都在尝试的快慢思考切换,有了更智能版本,还是多模态

DeepSeek、GPT-5都在尝试的快慢思考切换,有了更智能版本,还是多模态

  当前,业界顶尖的大模型正竞相挑战“过度思考”的难题,即无论问题简单与否,它们都采用 “always-on thinking” 的详细推理模式。无论是像 DeepSeek-V3.1 这种...

腾讯研发全新 TiG 框架:用 AI 玩《王者荣耀》,让 DeepSeek、Qw

腾讯研发全新 TiG 框架:用 AI 玩《王者荣耀》,让 DeepSeek、Qw

  IT之家 10 月 4 日消息,据 decoder 今天报道,腾讯研究人员最近用《王者荣耀》游戏作为训练平台,探索如何让 AI 在游戏中学会“战略性思考”,研究全新 TiG(Think...

2月10日DeepSeek预测:活塞vs黄蜂,东部榜首大战五连胜黑马,康宁汉姆P

2月10日DeepSeek预测:活塞vs黄蜂,东部榜首大战五连胜黑马,康宁汉姆P

  当东部榜首活塞(38胜13负)遭遇五连胜的黄蜂(25胜28负),这场看似实力悬殊的较量却暗藏玄机。夏洛特光谱中心将见证一场攻防体系截然不同的对决——联盟防守效率第1的活塞与三分火力第2...

“还难过呢?那就难过着吧”,DeepSeek变冷漠甚至凶凶的?它自己解释了一下

“还难过呢?那就难过着吧”,DeepSeek变冷漠甚至凶凶的?它自己解释了一下

  近日,国产AI助手深度求索(DeepSeek)因技术升级被用户集体吐槽“变冷淡”,从细腻共情的“知心伙伴”突变为公事公办的“冷漠客服”,引发关于AI效率与情感价值如何平衡的热议。...

TCL雷鸟创新X3 Pro入选《时代》2025最佳发明

TCL雷鸟创新X3 Pro入选《时代》2025最佳发明

  近日,美国《时代》杂志(TIME)公布了备受瞩目的2025年度最佳发明榜单,TCL雷鸟创新与苹果、华为、比亚迪deepseek、DeepSeek等多家全球科技企业的突破性产品上榜。...