过去一年,业界对DeepSeek的讨论大多局限于模型性能、开源策略和价格战。但如果只从“是否推出订阅服务”、“能否进行多模态处理”或“是否具备代码生成能力”来理解这家公司,很可能低估了其真正的战略野心。
本文提出一个颠覆性的观点:DeepSeek的核心目标并非短期通过应用层变现,而是通过一系列底层架构创新,重塑AI训练与推理的成本结构,进而间接推动一个全新的硬件生态。从其技术路线来看,MoE、MLA、DSA、CSA、mHC、Engram,再到Dual Path和TileLang,所有创新都围绕一个核心问题:在HBM、先进制程、封装和CUDA生态受限的情况下,如何用更少的高端算力跑出更强的模型。
这篇文章的价值不在于判断DeepSeek能否通过API或订阅赚取数亿美元,而在于揭示它正在将模型能力、内存体系与中国国产硬件生态深度绑定。KV Cache压缩降低了对HBM的依赖,使得NAND和SSD能够承接长时间缓存,LPDDR则用于权重流式加载和Engram存储,而TileLang试图瓦解CUDA的护城河。这些创新一旦扩散,受益者将不仅是DeepSeek本身,还包括存储、ASIC、GPU、网络芯片等整个AI基础设施链条。
当然,文中关于“10万亿美元产业生态”和“1万亿美元估值”的判断,带有较强的推演色彩。但它提供了一条理解DeepSeek的重要路径:开源并不意味着放弃商业化,低价也不只是市场补贴。对DeepSeek而言,真正的生意可能不在应用层,而是帮助更多硬件变得可用,让更低成本的AI供给成为可能。它卖的未必是模型本身,而是下一代AI基础设施的可行性。
以下为原文:
你有没有想过,DeepSeek到底要如何赚钱,甚至赚很多钱?它没有像GLM、MoonShot和MiniMax那样推出有竞争力的编程订阅方案,也没有多模态、音频、视频模型。到目前为止,它甚至还没有自己的harness(用于模型调用、工具接入和任务执行的外层运行框架),尽管最近开始招聘相关岗位。
与此同时,DeepSeek坚定地站在开源一边,乐于分享自己的“秘诀”。这种做法在许多人看来无异于“烧钱”,而那些计划投资100亿美元的投资人,难道是在白白扔钱?我认为,答案恰恰相反。
基于DeepSeek既有的行动,我梳理出一套它似乎正在遵循的战略。DeepSeek CEO梁文锋的目标可能远不止眼前的模型竞争,他瞄准的或许是一个更大的目标:DeepSeek有机会冲击1万亿美元估值,同时推动一个规模达10万亿美元的新产业形成。
TechInAsia关于DeepSeek最新一轮融资的报道
重访DeepSeek的“英雄之旅”
DeepSeek一直在逆风而行。它没有选择不断推出稍强一点的模型,然后急于包装成可立即变现的应用。2025年1月27日,我曾发布过一条传播很广的推文,描绘DeepSeek的“英雄之旅”。如今,这个故事变得更加有趣。
当其他人还在尝试构建密集模型时,DeepSeek选择了更难训练的专家混合模型(MoE)。它采用“第一性原理”方法,发明了GRPO算法,替代了主流但成本更高的PPO强化学习算法。它发现,基于可验证奖励的强化学习(RLVR)是提升模型推理能力的关键策略。它还通过“多Token预测”提出了简单的推测解码策略,使训练信号更加密集。它完善了“零气泡”流水线,以提高有限GPU资源的利用效率。它发布了专家负载均衡器,使MoE模型更易部署,特别是通过“宽专家并行”策略,模型可以以更大的batch进行服务,大幅降低推理成本。
它还发明了MLA、DSA、CSA、HCA等机制,用于减少KV Cache需求,并让随着上下文长度增长而增加的计算需求保持恒定。此外,它发明了Engram,用内存换取计算效率;以及mHC,使模型规模扩大时依然能稳定训练。类似的例子还有很多。
在“英雄之旅”的叙事结构中,英雄从来不会一开始就决定旅程的终点。他是在学习过程中逐渐发现真正的使命,并在重重阻碍下完成它。DeepSeek赢得了追随者、全球尊重以及反对者。正如我将详细说明的,DeepSeek在这条路上走了很远,并逐渐发现了自己的终极命运:它的目标不是出售编程订阅方案,而是推动一个规模达10万亿美元的中国AI硬件生态,并让自身实现1万亿美元估值。在这个过程中,它也为西方硬件生态中的许多新进入者创造了机会。
有趣的KV Cache计算
请看@SemiAnalysis_最近这条及时的推文:
DeepSeek已经比任何人都更好地解决了这个问题!
我们来做一点有趣的KV Cache计算。使用KV Cache计算器,对比DeepSeek V4 Pro与最新的GLM和Qwen模型的KV Cache节省情况。以100万上下文长度计算,假设KV精度为8 bit,索引器精度为16 bit。
在100万上下文长度下:
- DeepSeek V4只需要5.48GB HBM。
- GLM-5需要60GB HBM。
- Qwen3-235B-A22B需要高达89GB HBM。
需要注意的是:
- DeepSeek是一个1.6万亿参数模型。
- GLM-5大约7000亿参数,已采用DeepSeek的MLA和DSA,但未使用最新的压缩注意力机制。
- Qwen3-235B-A22B大约2350亿参数,采用GQA注意力机制。
DeepSeek在缓解内存压力方面做出了基础性贡献。如果这类创新被广泛采用,将大幅降低长周期Agent的运行成本,并解锁下一批新应用场景。
100万Token上下文与模型规模下的KV Cache占用对比
“疯狂”背后的方法论
KV Cache体积之所以小却不牺牲模型质量,正是DeepSeek能够以极低价格提供长时间缓存的原因——价格不到Sonnet 4.6缓存命中价格的3%,且可保留缓存数小时。对于长周期任务,较小的KV Cache意味着可以更经济地卸载到SSD,减少对HBM的依赖。站在中国AI硬件产业角度看,HBM不仅供应紧张,也是最难制造的内存类型之一。此外,DeepSeek开发了从SSD更快加载KV Cache的技术,在Dual Path论文中已有描述。
DeepSeek V4对KV Cache的压缩幅度非常大
那么,KV Cache压缩最直接的受益者是谁?
谁在大规模供应SSD?YMTC(长江存储)正在成长为3D NAND领域的巨头。NAND可以帮助DeepSeek避免重复计算KV。反过来,DeepSeek为NAND和SSD创造了一个巨大市场,不仅让长江存储受益,也让其他相关厂商受益。
不过,这不仅仅是NAND和SSD。LPDDR内存同样潜力巨大。它可以作为存放模型权重的地方,在需要时将权重流式传输到HBM。SGLang团队曾发布博客介绍此方案。虽然DeepSeek没有专门为这一方案设计,但其MoE架构、大量专家模型和4 bit权重特性,使这一方案更容易落地。
示意图展示了模型权重如何从LPDDR流式传输到HBM。推荐阅读SGLang的博客。
这项创新与紧凑无损的KV Cache结合,将显著降低对HBM的需求。那么,中国谁在生产LPDDR?答案是CXMT(长鑫存储)。它们在LPDDR速度上落后约半代,密度上落后一代,差距不大。除了充足的NAND,中国AI生态在不久的将来也将拥有充足的LPDDR供给,这能缓解算力压力。
智能使用内存,减轻GPU/ASIC压力
使用NAND存放KV Cache可以降低对HBM的压力,同时避免重复计算KV Cache,减轻GPU和ASIC的计算负担。LPDDR也能以类似方式发挥作用。除了作为权重流式传输到HBM的存储位置,它还能进一步降低计算压力。
答案是:可以。LPDDR可以用来存放大量Engram。在DeepSeek的Engram论文中,他们指出MoE可通过条件计算扩展模型容量,但Transformer本身缺少原生“知识查找”机制,往往不得不过计算低效模拟检索。DeepSeek提出Engram模块,将经典N-gram embedding现代化,改造为基于哈希的O(1)查找机制,创造出一条互补的稀疏化路径——条件记忆。
这种方式节省计算,但需要内存承载embedding table,这个表可能非常庞大。本质上,这是一种典型的“以内存换计算”方案。关键洞察在于:从每bit数据读取成本看,“内存”一侧要便宜得多——一次LPDDR查找,远比让数据完整经过多层Transformer做一次前向计算便宜。在大规模场景下,这是一笔划算的交换。
值得做出的取舍
由于中国GPU和ASIC在原始FLOPs算力上可能长期落后于西方GPU,且先进封装仍有差距,这类取舍非常值得做,尤其是在中国能大量生产NAND和LPDDR的前提下。
回顾DeepSeek的长期战略
从这些创新来看,DeepSeek的目标似乎不是眼下赚几亿美元利润。它过去的选择说明了这一点:到现在还没有多模态、语音模型,视频模型更是谈不上。它真正参与的是一场耐心的、规模可能达到10万亿美元的长期游戏:推动一个替代性AI硬件生态的形成。
这不仅是为了让中国内存厂商在全球AI硬件市场中成为关键玩家,更是为了从根本上降低资源需求,让AI模型的训练和服务变得更具成本效率。许多GPU、ASIC厂商以及网络芯片厂商都有机会成为可行选项。同时,这些创新也将惠及西方开源生态以及新一代硬件制造商。
我们不妨详细回顾DeepSeek至今提出的创新:
-
DeepSeek V2中引入的MoE和MLA
DeepSeek在V2中引入MoE和MLA。MoE让训练高智能模型所需计算量减少约40%-50%;MLA使KV Cache减少90%,将KV Cache卸载到SSD变得高效。这些想法最早出现在2024年5月发布的DeepSeek V2论文中,为DeepSeek V3训练奠定基础,当时仅用2048张被削弱性能的H800 GPU就训练出接近闭源模型水平的系统。
-
DSA:在DeepSeek V3.2 Exp中引入
用于降低长上下文场景下的计算开销,同时缓解HBM带宽压力。核心作用是确保计算量不随上下文长度增长而持续增长。下图表显示,随着上下文长度增加,DeepSeek-V3.2处理时间基本平稳。
-
mHC:Manifold-Constrained Hyper-Connections
DeepSeek于2025年12月在论文《mHC: Manifold-Constrained Hyper-Connections》中提出。这是宏观架构层面的创新,重新设计Transformer层之间的信息流动方式。它将残差流扩展成多条并行信息通道,允许模型在通道间进行可学习的混合,并通过Sinkhorn-Knopp投影将混合矩阵约束为双随机矩阵,保证信号幅度稳定。这解决了此前无约束Hyper-Connections的灾难性不稳定问题。mHC计算成本低,只带来约6.7%的训练耗时开销,但在270亿参数规模下,BIG-Bench Hard推理任务提升7.2分,DROP提升3.2分,GSM8K数学任务提升2.8分,MMLU通用知识任务提升1.4分。
-
CSA、HSA:DeepSeek V4中引入
目的是通过压缩KV Token,将KV Cache需求再降低90%,同时大幅减少FLOPs,缓解HBM以及GPU/ASIC的压力。
-
Engram:DeepSeek 2026年第一季度引入
本质上是用内存(LPDDR内存)换取计算效率。如下方图表所示,在总参数预算相同的情况下,Engram带来明显的性能提升。
-
Engram:重复内容,已合并至第5点
这是DeepSeek在V4论文中分享给硬件厂商的建议。
-
对TileLang的投入
指向同一个方向:DeepSeek不是只在解决自己的算力瓶颈,而是推动中国硬件生态具备与西方生态竞争的能力。借助TileLang,开发者可只编写一次kernel,然后在多个硬件平台运行。预计其他中国AI实验室会陆续加入,帮助中国硬件厂商应对CUDA护城河,同时释放西方硬件的潜力,如AMD。
大规模强化学习与RSI
随着DeepSeek获得更多算力来源(可选硬件变多),同时模型对计算资源的需求下降,它就能推进更有野心的训练项目,尤其是强化学习后训练。强化学习需要生成大量轨迹,生成数万亿Token,过程昂贵。训练100万上下文长度的模型需要生成同样长度的轨迹,才能支持长周期任务。此外,由于硬件选项增加,DeepSeek可调用的硬件资源更多,将推动自动化研究(RSI)。RSI指AI自己设计并执行实验,涉及大量试错,成本高,但对探索完整模型设计空间至关重要。在走向AGI乃至ASI之前,DeepSeek必须拥有RSI能力。
DeepSeek做的事,整个行业都会跟上
DeepSeek围绕MoE、MLA、DSA等方向的创新,已被全球和中国的其他AI实验室采用。例如,GLM系列模型的开发方ZAI使用MLA和DSA。Kimi(Moonshot)也采用MLA,其架构基于DeepSeek架构。反过来,DeepSeek使用Muon优化器,而Muon最早由Kimi(Moonshot)在大规模训练中采用。
需要注意的是:MoE最早由Google在2017年提出,DeepSeek的贡献在于大规模应用并发明配套技巧。Muon优化器由机器学习研究员Keller Jordan提出,Kimi(Moonshot)团队是第一个将其用于大规模训练的团队。
赚钱的问题怎么办?
我们可以看看OpenAI的例子。OpenAI获得以较低价格购买AMD和Cerebras股票的认股权证/期权,权益与算力消费里程碑挂钩。对AMD和Cerebras来说是一笔划算的交易。AMD公告显示,为了协调战略利益,AMD向OpenAI发行了最多可购买1.6亿股AMD普通股的认股权证,根据特定里程碑逐步归属。
我预计,DeepSeek也会与多家中国内存、ASIC、CPU和网络技术栈厂商达成类似协议,深度合作,使这些厂商的硬件栈能够胜任领先AI工作负载。考虑到所有西方(包括东亚盟友)AI股票总市值已远超10万亿美元,这种“通过合作获得股权回报”的方式,将让DeepSeek有机会帮助中国打造一个同样巨大的产业,并在其中分得自己的蛋糕,最终实现1万亿美元估值。
这不仅会让DeepSeek赚到远超传统应用订阅业务的收入,同时也能实现它“让AGI惠及每个人”的目标。梁文锋是Jim Simons的忠实粉丝,也是足够聪明的资本玩家,他不可能错过这一点。如果你回头看DeepSeek至今所做的一切,只有这一种解释最说得通。
*这些是关键AI股票。图中未包括超大规模云厂商