市场悖论:AI越“便宜”,硬件越“昂贵”

2025年6月30日,Anthropic发布了新一代中端模型Claude Sonnet 5。在代理能力测试SWE-bench Pro中,它取得了63.2分,仅比旗舰版Opus 4.8的69.2分低6分;而在研究生级推理测试GPQA-AAA v2中,其表现甚至超越了旗舰版。更引人注目的是其定价:优惠期间,每百万输入token收费2美元,输出收费10美元,仅为Opus 4.8定价(输入5美元,输出25美元)的40%至60%。这意味着,Sonnet 5以不到旗舰版一半的成本,实现了九成以上的性能。

这一新闻可从两个截然不同的角度解读:

  • 视角一:AI成本持续下降。技术进步惠及所有参与者,模型厂商之间的竞争进入白热化阶段,Chatbot战场硝烟弥漫。
  • 视角二:市场的真实定价。AI模型价格的下降,反而推高了算力与存储芯片的价值。发布当日,美国半导体指数上涨近4%。过去三年,关于“推理效率提升将削弱芯片需求”的论断,在每一个数据节点上均被证伪。

降本幅度:从千倍级到结构性变革

回顾2022年,调用GPT-4级别API的成本约为每千token 0.03美元。根据斯坦福AI指数报告,到2025年,同等性能模型的价格已下降约280倍。若将开源模型与效率优化的综合效应纳入考量,业界公认的降幅高达1000倍

降价并非个案,而是行业趋势:

  • Anthropic:Sonnet 5的定价仅为同级旗舰的40%-60%。
  • Google:Gemini Omni Flash的视频生成成本降至每秒0.10美元;Nano Banana 2 Lite图像模型出图时间缩短至4秒,每千张成本仅为前代的一半。
  • DeepSeek: V4-Pro模型将百万token输入成本压低至0.035美元。

成本下降不仅体现在定价表上。2025年6月,The Information报道OpenAI通过纯软件优化,将特定运算环节的GPU需求削减超过50%,专用GPU池从数千台骤降至数百台。同期,Meta推出Vistara方案,利用自研CXL芯片将退役服务器的DDR4内存与DDR5按3:1组合,使推理服务器成本降低25%。6月30日,阶跃星辰开源的推测解码技术JetSpec,可实现大模型推理速度近10倍的提升,意味着同等token输出所需的GPU数量可下降一个数量级。

若按照传统经济学模型,这些信号应指向未来芯片需求的减少。华尔街也曾因此恐慌——今年1月DeepSeek发布R1模型后,AI基础设施股遭遇剧烈抛售,AI云公司Nebius股价暴跌40%。市场逻辑很简单:当中国开源模型以0.1美元的价格销售token,而美国公司售价2美元时,算力需求必然面临坍缩。

需求爆发:总支出一年激增320%

然而,现实走向了完全相反的方向。Nebius联合创始人Roman Chernin回忆道,DeepSeek引发恐慌的那一周,反而是公司销售表现最好的一周。企业采购部门在看到成本骤降后的第一反应并非削减预算,而是终于可以大规模部署推理任务

数据佐证了这一转变:

  • 2024年全球企业生成式AI总支出约为115亿美元,而2025年飙升至370亿美元,一年内增长320%。
  • 根据Menlo Ventures的企业调研,2025年中位数企业运行着“数十个”AI应用,而2023年仅为1-2个。
  • 具体案例:Uber在2026年4月已耗尽全年AI预算;AT&T目前日处理270亿token,而18个月前仅为8亿;一家美国大型医保公司的月token消耗从300万跃升至1.5亿以上。

这种爆发式增长源于三个方向的叠加:

  1. 应用场景扩散:企业各部门应用AI的数量呈数量级跳跃,从最初的2个增长到数十个。
  2. 单应用深度增加:以客服AI为例,日交互量从500次增至15000次,每次交互触发的后续推理(情感分析、升级预测、质量评分)也从无到有,达到3-5次,产生指数级token消耗。
  3. 模型复杂度升级:从7B参数的单轮模型升级到70B以上的多步推理代理,每一轮内部推理消耗的token是线性交互的数十到上百倍。

结论清晰:token成本降至千分之一,但市场消耗量增长了数万倍。净效应只有一个方向——总支出爆炸式增长。Token消耗量每两个月翻一番,若此趋势延续,到2027年企业AI年支出突破千亿美元已是算术问题,而非预测。

硬件传导:存储芯片价格飙升六倍

降价刺激的需求迅速从软件层传导至硬件层。

DRAM和NAND Flash现货价格自2025年三季度起累计涨幅均超过300%。DDR5颗粒单月涨幅一度突破90%。进入2026年,涨价趋势非但未止,反而加速。一季度DRAM合约价涨幅从预期的55%-60%上修至90%-95%;NAND从33%-38%上修至55%-60%。TrendForce预测二季度DRAM和NAND将分别再涨58%-63%和70%-75%。

以消费级产品为锚,宏碁掠夺者32G DDR5 6000套条的价格在2025年10月底约为1300元,到2026年1月已飙升至2700元,三个月内翻倍。三星存储业务在2025年四季度录得单季营业利润历史新高,突破20万亿韩元(约962亿元人民币),主要驱动力正是AI数据中心对HBM、企业级SSD及高密度DRAM的巨量采购。

高盛5月的一份报告将这一趋势推演至极致:预测2026年至2031年全球AI基础设施累计资本支出约7.6万亿美元,单2026年即为7650亿美元,到2031年攀升至1.6万亿美元。其中,单颗基准GPU(基于NVIDIA VR200 Rubin)按8.05万美元计算,NVIDIA占各期总算力支出的75%。

高盛追问了一个关键问题:若ASIC(专用芯片)大量替代GPU,是否会削减总需求?答案取决于需求的弹性。若算力需求固定,ASIC替代可降低总资本支出;但若需求具有弹性——算力越便宜需求越大——芯片组合的改变主要重塑利润在不同供应商之间的分配,而非减少总支出。高盛的基准情景选择了后者。

美股市场对此反应强烈:闪迪股价年初以来上涨857%,Bernstein在6月30日将目标价上调至3000美元;AMD单日涨幅达7%创历史新高。正如Edgen.tech在6月11日的综述中所言:内存芯片价格在过去一年里涨了六倍,这一涨幅背后是整个经济体系对AI物理基础设施需求的重定价。

深层逻辑:杰文斯悖论的重现与正反馈

1865年,威廉·斯坦利·杰文斯在其著作《煤炭问题》中指出:瓦特改良蒸汽机后,单位煤耗大幅下降,但英国煤炭总消费量反而上升。因为效率的提升使蒸汽动力在纺织、铁路、采矿、航运等更多行业变得经济可行,创造了原来不存在的需求。

160年后,同样的逻辑在AI算力领域重现。2022年的token价格下,实时推理客服对话在经济上不可行;非紧急场景不值得跑AI;个性化内容生成只能做到群体级别。到了2025年,价格下降1000倍后,这些“原来不存在的需求”全部变为刚需。Nebius的Chernin总结道:“每一次我们让同样单位的智能变得更便宜,我们不是在减少消耗,而是在增加消耗——因为同样的预算可以解决更复杂的任务了。”

此外,一个结构性推力被市场忽略:AI推理的毛利率正反馈。AI API业务起步阶段毛利率可能仅为10%,但随着软件优化(算子融合、量化、推测解码)每月压降推理成本,而定价调整滞后,毛利率可从10%迅速攀升至90%。毛利率驱动利润,利润追加采购,采购摊薄成本——这一正反馈回路几乎不存在天花板。

“你有DRAM就能卖token,没有DRAM就无法卖token。”

这句话正在成为AI芯片需求的基本方程。高盛报告的两个敏感性假设进一步印证此判断:芯片经济寿命若从5年缩至3年,替换周期加速,累计资本需求将直接上台阶;每芯片内存比预期高25%,主要改变芯片堆栈内部的支出分配,对7.6万亿总盘子的净影响有限,但方向一致——资金不会少花。

结论:模型可替代,但物理硬件不可逾越

Fable 5出口管制在6月12日实施,又在6月30日解除,前后仅三周。解除管制并非因为风险消失,而是因为替代品已经出现——Tulongfeng等亚洲团队在管制期内推出了接近Mythos级的模型。封锁的威慑力迅速归零。这恰好印证了AI降本悖论的主线:模型是可替代的。从GPT到Claude到DeepSeek,没有人能垄断AI能力本身。

但硬件不受此逻辑支配。GPU不行,DRAM不行。晶圆厂建设周期以年为单位,光刻机产能上限固定,高纯度硅的供给弹性近乎零。这些是物理定律,而非商业策略。软件优化可以将模型成本压低一千倍,但无法将一个晶圆厂的建设周期缩短一天。

AI模型降价的终点,如果这一悖论持续运行,将不指向“去算力化”,而是指向算力定价权的再集中。无论使用谁的模型,token都必须运行在某个芯片上。模型厂商降价的每一分钱,最终都会转化为数据中心、晶圆厂和存储产线账簿上的收入。降本越激烈,这一转移就越不可逆。

市场资讯部点评
本文精准地揭示了当前AI产业中“模型越便宜,芯片越贵”这一看似矛盾、实则符合经济学规律的深层逻辑。从“杰文斯悖论”到“毛利率正反馈”,文章不仅提供了海量且详实的数据支撑,更构建了一条清晰的因果链:成本下降→需求爆发→硬件(存储与算力)供不应求→价格飙升。这对于理解AI领域的投资价值具有极高的参考意义。核心洞察在于,模型层面的“军备竞赛”最终都将为物理层的芯片与存储“做嫁衣”。我们应持续关注在算力与存储环节具备稀缺性、产能优势和定价权的企业,它们将是这场AI浪潮中更具确定性的受益者。