AnRouter
模型评测

GLM-5.3 技术深度解析:基座不变,后训练如何把编程与 Agent 效率推向极限?

GLM-5.3 沿用 5.2 基座,仅凭后训练便在 Terminal-Bench 3.0 斩获 6 倍得分提升,且代码输出 Token 减少 21.9%。本文深入剖析其工程环境合成、长程 Agent 状态管理及在 AnRouter 上的实战部署成本。

用大模型写单函数代码的时代早就过去了。今天开发者对 AI 的要求,是把它扔进一个复杂的真实代码库里:读懂几十个文件的依赖、复现报错、在终端敲命令改代码、跑自动化测试,遇到挂了还能自己纠错重试。

在这类长程工程任务(Long-horizon Tasks)中,大部分模型面临的不是“写不出代码”,而是推理链路太长导致 Context 溢出、开始说胡话、在终端盲目打转,最终烧掉数十万 Token 却以超时失败告终

智谱新发布的 GLM-5.3 恰恰切中了这个痛点。值得玩味的是,官方明确表示它与 GLM-5.2 基于完全相同的基础模型(Base Model),所有性能飞跃全部来自后训练(Post-training)。而在硬核的终端基准 Terminal-Bench 3.0 上,它的得分直接从 4.6 飙升至 28.3(超 6 倍提升);更关键的是,内部基准显示其代码输出 Token 消耗下降了 21.9%。 官方模型卡 | 官方技术文档

在不重新预训练的前提下,后训练到底是如何重塑模型解决复杂工程任务能力的?我们拆开来看。

规格拆解:753B MoE 与 1M 超长上下文

先理清 GLM-5.3 的底层参数与规格配置。它延续了智谱在稀疏 MoE 架构上的演进路线:

参数项规格说明工程意义
基础模型沿用 GLM-5.2 基座验证了后训练(RL + 优质合成数据)的上限
架构与参数MoE 架构,总参数 ~753B,激活 ~40B既拥有超大容量的代码知识库,又兼顾单步推理吞吐
上下文窗口1M tokens一次性塞入完整项目架构文档、大型日志及工具调用历史
最大输出128K tokens允许单次输出超长重构补丁或大规模测试脚本
推理档位low / high / max灵活平衡 Agent 单步思考耗时与求解成功率
权重开放官方 Hugging Face 仓库已公开便于私有化部署与二次微调评估

1M 的上下文空间,让模型在面对大型单体仓库或跨服务排障时,不再需要频繁做侵入式的 RAG 切片。但海量上下文本身是把双刃剑:如果模型注意力发散,越往后推理就越容易偏离原始需求。这也是 GLM-5.3 本次后训练改造的核心战场。

后训练机制:把真实研发环境“打包”成强化学习试验场

GLM-5.3 之所以能在终端交互场景大幅跃升,核心在于智谱把传统的“代码问答微调”彻底转变为“交互式环境中的强化学习”

1. 告别刷题,直面系统级工程任务

以往评测常考 LeetCode 式算法题,但生产环境真正耗费精力的是 Infra 与集成调试。官方披露的一个典型训练场景是:

给模型分配一个真实的计算集群、分布式存储、内部技术文档和性能瓶颈代码,要求模型定位训练性能瓶颈,修改源码,并通过端到端压测脚本验证加速比,同时保证计算结果完全等价。 训练环境说明

这种任务要求模型必须具备“观察 -> 假设 -> 验证 -> 修正”的闭环思维,单靠死记硬背代码模板根本无法通关。

2. 规模化环境合成流水线(Synthesis Pipeline)

要让强化学习跑起来,海量且可验证的高质量环境从何而来?智谱披露的流水线逻辑非常克制且精准:

[任务模式提取] 收集真实工作流,提取多步依赖与隐藏状态
       ↓
[可解性验证]   引入独立评估 Agent 尝试求解,剔除死局环境
       ↓
[黑盒验证器]   不看标答,只围绕交付成果与测试断言构建 Validator
       ↓
[排查作弊路径] 排查“通过测试但实际未解决问题”的 Reward Hacking 漏洞

特别是对 Reward Hacking(作弊捷径) 的清洗——比如很多 Agent 会通过直接修改单元测试断言、或提交空操作来伪造通过率。GLM-5.3 在训练管线中加入了已知正解、空操作和未完成态三重对抗拦截,确保只有真正修好 bug 的轨迹才能产生正向奖励。 环境合成机制

3. 长任务下的 Context 管理:抗遗忘与抗漂移

GLM-5.3 沿用了结合上下文压缩的 SAO 策略。当 Agent 在 Bash 终端反复执行命令、产生数万行冗余日志输出时,模型会自动提炼前序交互中的核心状态(已验证事实、当前定位进度、未决假设),避免有效指令被噪音掩埋。

编程与长程 Agent 表现:Terminal-Bench 提升超 6 倍

在衡量模型作为自主 Agent 解决软件工程问题的一系列权威基准上,GLM-5.3 展现出了明显的跨代优势: 官方评测数据源

评测基准GLM-5.2GLM-5.3绝对增幅说明
Terminal-Bench 3.04.628.3+23.7极其严苛的 Linux CLI 终端交互长任务
Terminal-Bench 2.181.088.2+7.2基础终端控制与工具链调度
DeepSWE v1.146.266.9+20.7解决真实 GitHub Issue 的综合工程能力
SWE-Marathon v1.119.442.5+23.1超长程多步工程任务通关率(提升超 1 倍)
AutomationBench26.248.2+22.0复杂工作流与流程自动化执行
ALE-CLI23.828.5+4.7专家级命令行综合能力考题

值得注意的是 Terminal-Bench 3.0 的评测设置:官方开启了 max 推理强度、400K 上下文并限制单条轨迹最多运行 600 轮交互或 10 小时。过去的大模型在这项测试中之所以普遍拿低分(如 GLM-5.2 的 4.6),是因为交互轮数一旦突破数十轮,模型极易陷入死循环或产生执行偏差。GLM-5.3 能跃升到 28.3,证明其在自主纠错与长线目标对齐上有质的突破。

Token 效率实测:不仅更聪明,而且不再“废话连篇”

对于企业和开发者而言,编程 Agent 的实际使用成本由两个因素决定:任务成功率完成单个任务消耗的总 Token 数。很多模型看似逻辑周密,实则在思考链(CoT)和调试日志中消耗了海量无效 Token,导致账单居高不下。

智谱公布的内部 Code Bench 数据展现了一个反直觉的优化趋势: Code Bench 详情

模型配置 / 推理强度任务解决率单任务平均输出 Token输出消耗变化
GLM-5.2 (max)23.4%~96,000基准线
GLM-5.3 (high)31.4%~50,000相比前代大幅下降 47.9%
GLM-5.3 (max)34.5%~75,000解决率提升 11.1 个百分点,Token 减少 21.9%

这意味着什么?

  1. 更高的思考信息密度:GLM-5.3 在同为 max 档位下,成功率提高了 11 个百分点,反而少吐了 21,000 多个 Token。这说明它减少了无效的代码重试与无意义排查,决策路径更短、更准。
  2. 极具性价比的 high 档位:如果你对成本极其敏感,high 档位仅耗费 ~50,000 Token 就拿下了 31.4% 的解决率,大幅超越前代 max 的效果,性价比极高。

安全领域衍生:从单纯找 Bug 到真实漏洞利用

后训练的另一个副产物是底层推理能力的溢出。GLM-5.3 将训练范式复制到了网络安全攻防场景,评测成绩同样出现跨越式上升:

安全评测基准GLM-5.2GLM-5.3核心看点
CyberGym 通过率77.2%84.5%针对真实历史 CVE 漏洞的复现与验证
ExploitBench 覆盖率24.4%54.4%2.23 倍跃升,考察深层利用链构造与推理
ExploitGym (2h 预算)29 个105 个短时间预算内自主挖掘并利用漏洞的数量
ExploitGym (6h 预算)39 个130 个长周期全自动化攻防测试成果

在代码安全审计中,单纯靠 AST 语法树或表面模式匹配只能报出误报成堆的假漏洞;而 GLM-5.3 在 ExploitBench 上的翻倍表现,印证了它已经能推演跨函数甚至跨服务的污点传播链条与执行状态

研发团队选型建议与落地场景

结合其 MoE 架构和推理特性,GLM-5.3 最适合切入以下研发流水线:

  • 代码库级迁移与重构(跨多文件):面对需要统一修改十几处模块调用、重构 API 协议的脏活累活,1M 上下文配合长程推理,能保证它始终紧扣接口规范,不会改到一半“串味”。
  • 全自主排障 Agent(Terminal/Devin 模式):结合 Docker 容器与 Bash 权限,让 GLM-5.3 挂载测试日志、代码库及排障工具,处理 nightly build 失败和回归测试修复。
  • SecOps 代码审计流水线:在 CI/CD 阶段接入,利用其安全攻防特化推理,对敏感模块做更深度的逻辑漏洞复现与补丁验证。

在 AnRouter 上快速接入 GLM-5.3

对于正在搭建 Agent 架构或评估多模型的团队,无需单独维护复杂的基础设施或单独对齐各厂商协议。AnRouter 已第一时间上线 GLM-5.3,提供 OpenAI 兼容的统一网关接口与极具竞争力的调用费率。

1. GLM-5.3 计费标准

当前模型 ID 为 glm-5.3,各层级套餐定价如下: 查看完整模型目录

适用套餐输入价格(/ 1M tokens)输出价格(/ 1M tokens)计费与适用模式
Default$0.30$1.00纯按量计费,无月费,适合轻量评估与测试
Pro$0.24$0.80$9.99 / 月,输入输出立享 8 折优惠
Max$0.12$0.40$99.99 / 月,超低 4 折特惠,专为高并发重度 Agent 打造

注:价格更新于 2026 年 9 月 7 日,最新详情请参阅 AnRouter 定价中心

2. 极简接入示例

通过标准 OpenAI SDK 或 LangChain / AutoGen,将 Base URL 换为 AnRouter,两行配置即可无缝切入:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.anrouter.com/v1",
    api_key="your-anrouter-api-key"
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {"role": "system", "content": "You are a professional software engineer agent."},
        {"role": "user", "content": "Analyze the repository bottleneck and fix failing tests."}
    ],
    # 复杂工程任务建议开启充分推理预算
    extra_body={"reasoning_effort": "max"}
)

print(response.choices[0].message.content)

总结

GLM-5.3 给行业带来了一个明确信号:大模型工程能力的下半场,拼的不再是单纯堆砌预训练算力,而是对真实研发场景的理解深度与强化学习反馈环境的构造能力。输出 Token 减少 21.9% 且解决率大幅攀升,让自主编程 Agent 的商业可行性又往前迈了一大步。

想亲自压测 GLM-5.3 在你本地工程环境中的表现?欢迎访问 AnRouter 模型体验中心 或查阅 开发者快速上手文档,立即开启高效率编码调用。

开始使用 AnRouter一个 OpenAI 兼容端点接入 DeepSeek、GLM、Kimi、MiniMax、Qwen,按用量计费,无需逐个模型签约。

立即开始
返回文章列表