IDC ATLAS产业情报控制台
正在同步专栏研究
事实变更
研究发布
日报版本
系统扫描
核验覆盖
EN
IDC ATLAS
EN返回实时情报站
IDC ATLAS EXPLAINER · MODEL ECONOMICS · 40

芯片在涨价,DeepSeek 在降价:谁吞下了 AI 的成本?

一项合格任务,才是 AI 成本的正确分母。

缓存压缩与计算资源的概念体素插画
IDC Atlas 原创专栏封面 · MODEL ECONOMICS · 40

一边是买算力设备的账单越来越重,一边是调用模型的价格继续下降。把两条新闻放在一起,容易得到一个惊人的判断:AI 公司正在赔钱抢生意。但公开材料还不足以支持这个结论。设备贵,不代表每完成一项任务也更贵;模型降价,也不自动说明供应商的利润被压缩。

这两种价格,为什么可以反着走?

DeepSeek 在 9 月 10 日推出 V4.1 Flash,并同步下调 API 价格。公司称,相比上一代,新模型的 KV 缓存占用只需要四分之一的 HBM 和八分之一的 SSD 存储。这里说的是缓存,不能扩大成整台服务器的内存、采购价或电费都按同样比例下降。[1]

同一天,Reuters 援引知情人士报道,华为、寒武纪等国产 AI 芯片供应商调高了部分产品报价,并将其与 HBM 成本上升联系起来。相关报价未获报道所涉厂商公开确认。因此,这条材料能说明市场正在讨论的供给压力,不能替代采购合同,更不能证明 DeepSeek 购买了报道中的产品。[2]

两条消息没有直接的买卖对应关系。我们把它们放在一起,是为了问一个产业问题:当硬件成本承压时,模型和系统层的效率改善,能不能给应用端继续降价留出空间?

这与快递行业有点相似。卡车贵了,但一辆车如果能装更多有效货物、少跑空车,每件货物的运输成本仍可能下降。这个比喻只解释分母的变化。AI 服务还必须保证回答质量和等待时间,不能用更多错误答案充当更多有效货物。

设备报价属于买机器时的成本;API 价格属于客户按使用量付费时的售价。两者之间还隔着机器能用多久、运行多少小时、一次能服务多少请求、出错后要重做几次,以及机房、网络和工程团队的费用。新闻里最显眼的两个数字,恰好位于这条链的两端。

缓存到底是什么,为什么值得省?

模型处理长文件或连续对话时,会保存一部分此前计算形成的中间状态,以便生成后续内容时重复使用。KV 缓存可以理解为工作台上的笔记:不必每写一句答案,就从头重读全部材料。HBM 是靠近计算芯片的高带宽内存,工作台很快,但空间有限;SSD 则更像较大的储物柜,两者承担的工作不同。

DeepSeek 的官方模型卡介绍了新架构及缓存设计,并把效率改善与输入较多的代理任务联系起来。这些是开发者披露的技术机制,不等于所有软件环境都已得到相同比例的提升。把模型放进不同的推理框架、调整请求长度和并发量,实际表现需要重新测量。[3]

缓存占用减少,首先可能解决的是“放不下”。假设一台机器原本因为长对话占满了缓存,无法同时接更多用户,压缩后就有机会提高并发。若机器此前卡在计算速度或网络传输,省下内存并不会让这些瓶颈自动消失。

这也是“节省资源”和“降低账单”的差别。闲出来的一块内存,只有被用于承接更多付费工作,或者让运营商少买一部分设备,才会变成可见的经济收益。如果需求不足,剩余空间只会成为更宽裕的余量。

长任务也有两面。一份合同越长、代码库越大,复用此前状态越有价值;但任务可能同时需要外部工具、文件检索或人工确认。模型本身更快后,整个任务仍可能在等待别的环节。因此,采购者应分别看模型处理时间和端到端完成时间,不能把局部加速直接当作交付加速。

用一张小账单,看清“贵机器、便宜服务”

下面只做算术示例,不代表 DeepSeek、华为或任何运营商的真实成本。假设某项服务原来每完成一项合格任务花费 1 元,其中受本轮优化影响的资源占 0.30 元,其他成本占 0.70 元。如果前一部分的单位成本下降一半,新的任务成本就是 0.30×50%+0.70=0.85 元。

即使有关资源效率改善了 50%,总成本也只下降 15%。这不是对实际降幅的预测,而是提醒读者:局部优化的收益,受它在总账单中所占比例限制。缓存占用减少四分之三,不等于业务总成本减少四分之三。

左右滑动,查看完整表格 →
教学情形合格任务数总支出每项合格任务成本
原方案100 项100 元1 元
只降低支出100 项85 元0.85 元
支出增加,但有效产出更多150 项120 元0.80 元
便宜调用带来更多返工70 项85 元约 1.21 元

表内数字全部是假设,用来区分支出、产出和质量。计算公式为总支出除以合格任务数;“合格”的标准必须在测试前确定。

最后一行最容易被忽略。应用团队可能看到调用单价下降,就换用新模型;如果复杂任务的失败率上升,需要更多次调用或人工返工,最终每项成功任务反而更贵。反过来,一个单次调用稍贵但更可靠的模型,也可能让总账单下降。

合理的比较应固定一组真实任务,限定相同的交付要求,把模型费用、工具费用、重试和人工复核一起计入。测试不宜只挑最适合新架构的任务,也不能比较一个方案的高峰价格和另一个方案的低谷价格。

DeepSeek 还保留了峰谷定价。把可延期任务安排到低谷,可以降低客户支出,但那是一种时间调度收益,与模型架构改善不同。两种节省可以同时存在,记录时应拆开,否则第二次比较很难知道究竟是谁起了作用。[1]

效率红利最后落到谁手里?

模型公司至少有三种选择:把节省留作利润,降价争取更多使用量,或者把资源投入更复杂的推理过程,以提高任务成功率。公开 API 价格能观察到第二种选择的一部分,却看不到公司内部完整的成本结构。

云服务商面对的账本不同。如果它按机器租赁收费,客户用更少的机器完成同样工作,短期租赁需求可能减少;如果它按任务提供服务,提高利用率可能改善其利润。相同的技术进步,对不同收费模式的影响会相反。

设备供应商也不能只看单项任务需要多少资源。如果每项任务的资源需求降低,同时越来越多企业愿意使用 AI,总需求仍可能增长。这里需要检验的是数量变化,而不是预设“效率必然扩大需求”或“效率必然打击卖设备的人”。

例如,在一个纯假设场景中,每项任务所需设备时间降到原来的 80%,若合格任务量增长超过 25%,总设备时间仍会增加,因为 80%×125%=100%。这只是收支平衡条件,不是需求预测。它说明判断方向至少要同时知道效率和使用量。

应用公司通常最先看到价格变化,却未必最先拿到利润。竞争对手也能调用同一个模型,节省可能很快通过产品降价或免费额度转给终端用户。真正能留住收益的环节,可能是更可靠的工作流程、专有数据或客户交付能力,但本次材料不足以判断哪家企业已经做到了。

对于数据中心,传导还要更慢。已有租约、设备付款和供电安排不会因为一条模型公告立即重写。效率变化先影响调度与利用率,再经过续约、扩容和采购决策,才可能改变建设需求。应把几天内的模型测试与几个季度的资本决策分开观察。

最有力的反方解释是什么?

第一种反方解释是,降价主要来自竞争压力,与成本改善关系有限。官方架构说明能支持存在效率优化的机制,却不能证明每一次降价都由成本下降覆盖。要判断这一点,需要同口径的服务成本、毛利或更完整的经营披露;目前不能用价格表替代这些数据。

第二种是,基准上的改善没有转化为客户实际收益。测试任务可能比真实环境更整齐,真实企业还要处理权限、格式、脏数据、审计记录和人工批准。若试点中模型更便宜,整体交付时间却不变,就应检查任务链上的其他等待环节。

第三种是,硬件紧缺的影响超过算法节省。优化可以提高现有设备的产出,却无法让一个根本拿不到所需硬件的项目自动上线。采购周期、可用内存配置、推理软件成熟度和维修备件仍可能成为硬约束。

还有一种容易被忽略的结果:效率提升被更高的服务标准吃掉。原来只要求摘要的客户,现在要求逐条核对证据;原来能等待一分钟的应用,现在要求交互式响应。计算支出可能没有下降,但用户获得了更多价值。此时用“总账单没降”判定优化无效,同样失真。

上述解释并不互斥。一家公司可以同时提高技术效率、承受价格竞争、增加服务投入。研究要拆开各项作用,避免把产业变化归结为单一赢家或输家。

未来几个季度,怎样知道判断对不对?

对应用采购者,最有用的证据是一份固定任务集的复测。记录同样工作量下的合格率、完成时间、总费用和人工介入次数。若便宜模型需要更多返工,成本优势就要重新计算;若复杂任务的合格率改善,价值可能大于 Token 单价所显示的幅度。

对算力运营商,重点是省下的资源有没有被利用。需要看有效吞吐、稳定并发、故障与重试、服务质量,以及扩容发生在哪一种瓶颈上。单独展示某块卡的高利用率,无法说明用户是否拿到了合格结果。

对硬件供应链,应追实际采购配置和可交付周期。报道中的价格需要后续合同、招标或公司披露验证;不同卡型和配套条件不能混算。如果缓存优化推动客户调整配置,也要观察软件支持是否足够稳定,不能仅凭架构论文推定采购已经改变。

Atlas 的基准判断是:短期内,效率改善更可能先改变每项任务的经济性,而不是立刻改变全行业机房规模。若未来一至四个季度出现稳定的任务成本下降、使用量增长和运营商扩容,它们才共同支持“降价推动更多需求”的解释。若价格下降伴随毛利受压、需求无明显增加或项目延后,则应转向更谨慎的判断。

IDC ATLAS VIEW

对普通读者而言,最值得记住的只有一个问题:花出去的总钱,换回了多少合格的工作?这比“芯片涨了多少”或“模型便宜几倍”更接近 AI 生意真正的答案。

来源

  1. DeepSeek|V4.1 Flash 发布说明,2026-09-10:缓存口径、价格调整、峰谷安排。属于公司披露,未独立复现实测。
  2. Reuters,经 MarketScreener 转载|国产 AI 芯片与 HBM 成本,2026-09-10:匿名信源报道,报价未获厂商确认。
  3. DeepSeek 官方模型卡|DeepSeek-V4.1-Flash,2026-09-15 读取:架构和适用任务背景。本文不使用有口径争议的总参数统计推导设备需求。

资料截止:2026 年 9 月 15 日,北京时间。本文为独立产业机制分析,不构成投资建议。数字示例均已标明假设;未对任何公司的真实单位成本作估算。

本网站内容仅用于信息展示与研究,不构成任何投资建议。