这两个名字最近总是出现在同一批搜索里,常见的框架是"哪个更好"。这个问题本身就问错了。它们解决的是不同的问题,而这个对比的搜索量之所以持续上升,恰恰是因为有人在用一个工具做另一个工具该做的事。
这两个工具各自到底是为了什么?
Claude Code 是原生终端智能体。你把它对准一个任务运行,它读仓库、写代码、跑命令,然后在你已经开着的 CLI 里给你反馈。一个智能体,一件任务,仪式感最少。
Google Antigravity 是为自主的、多步骤智能体工作流打造的开发平台:工具编排、文件管理、代码执行,全部跑在一个安全的 Linux 沙箱里。它以独立桌面应用、CLI、Python SDK,以及 VS Code、JetBrains、Zed 的 IDE 插件形式发布。它的设计中心是协调多个智能体同时做不同的事,而不是一个智能体把一件事做好。
一句话测试。如果你正要描述的是一个有明确开始和结束的单一任务,那是 Claude Code 的形状。如果你正要描述的是一个有分支步骤、需要并行运行或彼此交接的工作流,那是 Antigravity 的形状。一旦把任务命名对了,"哪个更好"的困惑大多就消失了。
模型对比如何?
| Claude Code | Antigravity | |
|---|---|---|
| 模型 | Claude 家族 | Gemini 3.6 Flash(默认)、Gemini 3.5 Flash、Gemini 3.1 Pro、Claude Sonnet 4.6、Claude Opus 4.6、GPT-OSS 120B |
| 上下文窗口 | 取决于模型 | Gemini 3.x 系列最高 100 万 token;GPT-OSS 120B 上限 40 万 |
| 沙箱 | 跑在你的 shell 里 | 安全的 Linux 沙箱,与你的机器隔离 |
Antigravity 的模型列表才是这里更有意思的事实。它在同一个平台里,让 Claude Opus 和 Gemini 以及一个开放权重模型并存。这不是押注某一个模型家族去竞争,而是一个同时下了好几注的路由器。
哪个基准测试更好?
都不是全面领先,各自赢在不同的地方。
| 基准 | 衡量什么 | 领先者 |
|---|---|---|
| MCP Atlas | 跨多个 MCP 服务器的工具编排能力 | Antigravity,83.6% |
| SWE-bench Pro | 能通过审查的生产级代码质量,基于真实仓库 issue | Claude Opus 系列模型 |
看基准测量的是什么,而不是排行榜的位置。MCP Atlas 衡量的是把工具协调好。SWE-bench Pro 衡量的是写出能通过审查的代码。一个为编排多个智能体而生的平台,理应在前者领先。一个为亲自写代码而生的模型,理应在后者领先。这个结果不是矛盾,恰恰印证了每个工具都名副其实。
各自的花费是多少?
Claude Code 通过 Anthropic 的套餐和 API 计费。Antigravity 没有独立订阅:个人用户可以免费使用,或通过 Google AI Pro(每月 19.99 美元)或 Ultra(每月 100 至 200 美元)订阅获得,智能体配额按档位不同而变化。企业访问走 Gemini Enterprise,在 Google Cloud 上按用量计费。
这个差异比标价本身更重要。固定消费级订阅配额,和按用量计费的云计费,在工作流跑得久、或同时启动多个智能体时,行为完全不是一回事。即便 token 数相近,Antigravity 一次编排型多智能体运行的账单,形状也和 Claude Code 一次单会话完全不同。
那实际上该怎么选?
- 单一任务,终端优先,你想保持掌控:Claude Code。它正是为这种形状的工作而生的。
- 在 IDE 里,多个智能体并行跑不同子任务的工作流:Antigravity。那种协调正是它存在的理由。
- 你既想要 Claude 的代码质量,又想要 Antigravity 的编排能力:这个缺口是真实存在的,两个工具单独都补不上。Antigravity 可以把 Claude Opus 作为它的模型之一来调用,这是二者中最接近同时具备两种优势的方式。
两个工具背后有同一个约束:计量的预算决定了智能体被允许尝试什么。在 Verboo Code 上,模型跑在专用 GPU 且 token 不限量,所以一次长时间的单智能体会话和一次编排型多智能体运行,花费是一样的:每次尝试都不多花一分钱。
事实依据 2026 年 9 月 3 日的公开文档和基准报告核实。


