Grok 4.5 转向编码与 Agent:速度、成本和真实应用生成能力究竟如何

SpaceXAI 与 Cursor 联合推出 Grok 4.5,把重点从聊天转向编码、长任务和工具驱动的 Agent 工作。官方基准、独立测试和真实应用截图显示,它在速度与成本上很有竞争力,但复杂交互任务仍需验证和重试机制。

浏览 52
Grok 4.5 转向编码与 Agent:速度、成本和真实应用生成能力究竟如何封面

Grok 4.5 最值得关注的变化,不是聊天语气又变了,而是 SpaceXAI 开始把它明确定位为编码、Agent 任务和知识工作的基础模型。它既进入 Grok Build,也进入 Cursor 的桌面端、Web、iOS、CLI 和 SDK,并通过 API 向开发者开放。

这意味着 Grok 的竞争对象正在从消费级聊天机器人扩展到 Codex、Claude Code 一类能读代码库、调用工具、执行命令并持续修改结果的工作型 Agent。只是,“适合 Agent”不等于模型可以脱离工作流独立交付;真正需要判断的是它能不能在真实环境里稳定地调查问题、调用工具、纠错和验证。

编码基准已经进入第一梯队,但不能只看一张榜单

SpaceXAI 的发布公告列出五组工程评估。Grok 4.5 在 DeepSWE 1.0 得到 62.0%,SWE Marathon 得到 29.0%,Terminal Bench 2.1 得到 83.3%,SWE Bench Pro 的解决率为 64.7%。其中 SWE Marathon 是官方表格里排名第一的项目;DeepSWE 和 SWE Bench Pro 则仍落后于部分领先模型。

Cursor 发布的 Grok 4.5 编码基准对比
Cursor 发布的 Grok 4.5 编码基准对比

图中数据来自 Cursor 的联合发布说明。Cursor 也给出了两条重要注释:部分第三方模型成绩来自各自发布者,而非统一环境下重跑;旧版 Cursor 代码快照曾被意外纳入 Grok 4.5 训练数据,因此可能让它在 CursorBench 上获得不公平优势,Cursor 最终没有采用该项结果。这种主动披露很重要,因为“模型分数”会同时受到训练数据、Agent 外壳、工具配置和评测预算影响。

独立评测机构 Artificial Analysis 把 Grok 4.5 放入 Grok Build 运行,在 Coding Agent Index 上给出 76 分,与 GPT-5.5 在 Codex 中的成绩相当,略低于 Fable 5 在 Claude Code 中的成绩。该指数由 DeepSWE、Terminal-Bench v2 和 SWE-Atlas QnA 组成,衡量的是“模型 + Agent 执行环境”的组合,不是裸模型能力。

Artificial Analysis 的编码 Agent 指数与模型组合对比
Artificial Analysis 的编码 Agent 指数与模型组合对比

更有现实意义的是任务经济性:Artificial Analysis 报告称,Grok 4.5 在这组编码 Agent 评测中平均每个任务成本约 2.49 美元,GPT-5.5 + Codex 约为 5.07 美元,Fable 5 + Claude Code 约为 11.80 美元。它使用的总 token 也更少。这个结果支持“性价比突出”,但不能推导出它在所有仓库、语言和任务长度上都更便宜。

Agent 能力来自长任务训练,也依赖工具与验证闭环

Cursor 对训练过程的说明比“会调用工具”更具体:Grok 4.5 使用了覆盖代码库和软件工具交互的 Cursor 数据,并在真实环境中的困难问题上进行强化学习,目标包括调查问题、使用工具、从错误中恢复以及验证结果。Cursor 还称其使用分布式 Agent 系统批量构建、测试和改进训练环境。

SpaceXAI 则表示,强化学习覆盖数十万个多步骤软件工程和技术任务,Agent rollout 可以持续数小时。两家公司都在强调长时间执行,而不是一次生成代码片段。

不过这里必须区分模型和产品系统。Grok 4.5 提供推理、函数调用和结构化输出能力,官方模型文档显示其上下文窗口为 50 万 token,并支持文本和图像输入;真正的文件读写、终端执行、搜索、权限隔离和回滚,仍由 Grok Build、Cursor 或开发者自己的 Agent 框架负责。官方文档里的“Multi Agent”还是另一项平台能力,不能直接当成 Grok 4.5 已经自带多 Agent 团队协作。

对开发团队而言,Grok 4.5 更适合被放进有检查点的流程:先分析仓库和约束,再小步修改、运行测试、检查差异,失败后允许重试,最后由人确认。它的价值不是替代这些控制,而是可能用更低成本完成更多轮调查与执行。

从一个提示词生成应用:成功案例漂亮,复杂状态仍会失败

SpaceXAI 展示了用一个提示词生成 Three.js 太阳系模拟的案例,包含轨道、星空、时间调节和现代化 HUD。官方称模型还可处理 Rust、C/C++ 和端到端应用构建。但厂商精选案例只能证明“做成过”,不能回答成功率。

独立测试 TryAI 用相同约束让四个模型生成三个单文件应用:不使用外部库和网络调用,每个任务原则上只给一次提示,只有完全无法渲染时允许重试一次。本文封面就是 Grok 4.5 成功生成并在真实浏览器中运行的粒子重力场:点击可以添加高质量吸引子,画面呈现出整洁的轨道和带颜色的粒子拖尾。打砖块任务也在第一次生成后即可运行,包含鼠标控制挡板、砖块、得分与生命值。

Grok 4.5 一次生成成功的打砖块游戏
Grok 4.5 一次生成成功的打砖块游戏

最难的 3D 魔方任务暴露了边界:第一次只出现标题和按钮,没有显示魔方;测试者使用唯一一次重试后,第二版才生成可打乱、求解并显示转动动画的彩色魔方。

Grok 4.5 重试后成功生成的 3D 魔方
Grok 4.5 重试后成功生成的 3D 魔方

这组测试样本很小,不能当成通用胜率,但它说明“能生成漂亮应用”和“每次都可靠”是两回事。对于真实产品,必须继续检查交互状态、边界条件、无障碍、性能和安全,而不是看到首屏就宣布交付完成。

速度与价格有吸引力,知识可靠性仍需单独评估

SpaceXAI 宣称 Grok 4.5 的服务速度为 80 tokens/s,并称它在 SWE Bench Pro 上平均输出 15,954 tokens,约为 Opus 4.8 的四分之一。API 基础价格是每百万输入 token 2 美元、输出 token 6 美元;Cursor 还提供价格更高的快速变体。对需要大量循环调用的编码 Agent 来说,速度、token 数和单价会共同决定一天能跑多少任务。

但效率不能替代事实核验。Artificial Analysis 的 Omniscience 测试显示,Grok 4.5 的知识准确率相较上一代提高,同时幻觉率也上升到 54%。这只是特定评测口径,不等于每两句话就有一句错误,却足以提醒用户:研究、法律、财务和线上运维任务仍需引用、工具结果与人工复核。

综合来看,Grok 4.5 已经是值得开发者实测的编码与 Agent 模型,尤其适合成本敏感、工具调用频繁、任务可自动验证的场景。它真正的优势可能不是单项榜首,而是把接近第一梯队的执行能力、较快输出和较低任务成本组合在一起。至于能否成为主力,应让它在自己的仓库里完成一组可复现任务,再根据一次成功率、测试通过率、人工返工量和总成本做决定。

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

52