IDC ATLAS产业情报控制台
正在同步专栏研究
事实变更
研究发布
日报版本
系统扫描
核验覆盖
EN
IDC ATLAS
EN返回实时情报站
IDC ATLAS COLUMN · AGENT ECONOMICS · 20

从 GLM-5.3 到 Claude:长任务代理如何改变推理需求

更强的代理模型、可替换的运行时与 Claude 的商业化信号指向同一方向:推理需求正在从一次问答转向可重复执行的长任务,但因果链尚不能被一条收入曲线证明。

长时运行的 AI 代理工作站、工具链与推理基础设施剖面
IDC Atlas 原创专栏封面 · AGENT ECONOMICS · 20

Z.ai 将 GLM-5.3 描述为与 GLM-5.2 同一基础模型、主要通过后训练改进的版本,并披露其在代码、终端和代理类基准上的提升。该产品目前在 GLM Coding Plan 中可用,API“即将推出”;公司基准需要被视为厂商披露,尚非独立复现结论。

DeepSeek Harness 是 DeepSeek 开源的开发者预览运行时,文档强调插件化、可替换的模型适配器和工具、会话日志、沙盒、审批与持久化。它是模型中立的代理基础设施,不是 GLM-5.3 的官方发行或集成。

Anthropic 在 2026 年的公告中称年化运行率从 2025 年末约 90 亿美元升至超过 300 亿美元,随后在 5 月达到 470 亿美元以上。Anthropic 为私有公司,这些是管理层披露的运行率,不是公开的季度损益表或利润。

GLM-5.3 的信息是后训练能力变化,不是独立性能定论

Z.ai 文档称,GLM-5.3 与 5.2 使用相同基座,更新集中在后训练;并给出 Code Bench、Terminal-Bench、DeepSWE、Agents' Last Exam 等项目的提升。文档还列出 100 万上下文、128K 输出、工具调用、结构化输出、上下文缓存与 MCP 等接口能力。

这些能力对长任务很重要:任务不是只产生一段回答,而是需要读写环境、调用工具、跨步骤保留状态并在失败时继续推进。基准分数仍不足以证明真实工作流中的稳定性、成本或安全性。

指标本次披露口径与边界
GLM-5.3 基座与 GLM-5.2 相同Z.ai 归因主要为后训练变化。
上下文 / 输出1M / 128K官方文档列出的接口规格。
访问状态Coding Plan文档称 API 即将推出。

Harness 把模型能力放进可管理的执行循环

DeepSeek Harness 的架构将模型请求、工具调用和步骤记录组成一次代理回合;模型、工具、适配器和策略均可通过插件替换。这样,供应商模型不必决定整个运行时,执行环境也能保留审批、沙盒与状态。

这种可组合性降低了试验不同模型和工具的集成摩擦,但开发者预览明确提示兼容性破坏仍可能发生。它没有披露使用量、客户或收入,因此不能被当作算力需求已兑现的证据。

MODEL

推理与工具选择

模型在每一步生成请求,调用工具并基于结果继续。

RUNTIME

状态与治理

会话日志、审批、沙盒和持久化控制长任务如何执行。

ECONOMICS

可计费工作

只有任务被可靠执行并嵌入客户工作流,推理才可能形成持续收入。

Claude 的运行率是商业信号,不是因果证明

Anthropic 公告称其运行率超过 300 亿美元、客户中有超过 1,000 家年化支出超过 100 万美元的企业;5 月的融资公告又称运行率已超过 470 亿美元。它还披露了多吉瓦算力合作。

这支持“高价值企业代理任务正在商业化”的方向性判断,但不能证明 GLM-5.3 的能力或 DeepSeek Harness 的架构造成了 Claude 的增长,更不能用运行率直接换算为 token、GPU、MW、毛利或自由现金流。

反面也很重要:能力提升可能通过更少重试和更高效率降低单位任务 token;运行时的安全审批可能压低自主执行比例;私有公司数据无法让外部研究者验证客户、价格或使用结构。

IDC ATLAS VIEW

真正的需求变量不是模型排行榜,而是长任务能否在受控环境中连续完成、被企业采纳并稳定结算。模型、运行时与商业化三者正在靠近,但还没有公开证据把它们锁成一条可量化的因果链。

资料截止 2026 年 8 月 16 日(北京时间)。GLM-5.3 基准均为 Z.ai 自述;DeepSeek Harness 为开源开发者预览;Anthropic 为私有公司,文中运行率不等同于季度收入、利润、token、GPU 或 MW。

本网站内容仅用于信息展示与研究,不构成任何投资建议。