同样 2 美元一百万 Token,干一个活却差 14 倍?小编把本周三款新模型掰开看了
GPT-6.1 Sol、Claude Sonnet 5.5、Gemini 4 Argon 同一周发布,官方单价几乎一样。第三方实测写代码,GPT-6.1 Sol 每个任务约 1 美元,Sonnet 5.5 约 14 美元但得分最高;Gemini 4 Argon 目前只给受邀的网络安全机构用。
先说结论:按 Token 付费写代码,这三款里每个任务最省钱的是 GPT-6.1 Sol;追求最高分、又是用订阅的,可以选 Claude Sonnet 5.5;Gemini 4 Argon 普通人暂时用不上。小编一开始也纳闷,三款单价几乎一样,一个活凭什么差出十几倍?翻完第三方实测才明白,差别全在「话多不多」。
| 比什么 | GPT-6.1 Sol | Claude Sonnet 5.5 | Gemini 4 Argon |
|---|---|---|---|
| 发布 | 9 月 29 日 | 9 月 28 日 | 9 月 30 日 |
| 官方价(每百万 Token,输入 / 输出) | $2 / $10 | $2 / $10 | $2 / $10,优惠期后 $4 / $20 |
| 编程智能体得分 | 63 | 68 | 64 |
| 平均每个任务花费 | $1.04 | $14.2 | $5.84 |
| 平均每个任务耗时 | 15.5 分钟 | 1.5 小时 | 34.5 分钟 |
| 现在能在哪用 | ChatGPT Plus 及以上的 Codex 和 Work;API | Claude 免费版、Pro、Max(Pro 起含 Claude Code);API | 只给受邀的网络安全机构 |
得分、花费、耗时来自 Artificial Analysis 编程智能体指数(10 月 3 日),按 API 价格计算;Sonnet 5.5 用的是最高推理档,GPT-6.1 Sol 用的是次高档。
来源:Artificial Analysis 编程智能体指数,10 月 3 日。
单价一样,为什么差了十几倍
差别在完成一个任务要用掉多少 Token。Artificial Analysis 跑它的综合测试时,Sonnet 5.5 开到最高推理档,平均每道题输出约 19 万 Token,是它测过的模型里最多的,大约是 GPT-6 Astra 的 7 倍。
Anthropic 官方说,Sonnet 5.5 做同样的活比上一代省 Token,每个任务最多便宜 30%;它自己的测试图里,低档、中档就能超过 Sonnet 5 的最好成绩,花费只要十分之一左右。可开到最高档,第三方实测每道题反而比 Sonnet 5 贵约一半。省不省钱,要看你开到哪一档:Claude Code 和 Claude 应用默认是中档,API 默认是高档。

GPT-6.1 Sol 和贵五倍的 GPT-6 Astra 差多少
OpenAI 说 GPT-6.1 Sol 在编程、电脑操作上接近 GPT-6 Astra,单价却只有 Astra($10 / $50)的五分之一。第三方测试大体印证了这一点:它的综合智能分只比 Astra 低 1 分;在编程智能体测试里,得分反而比 Astra 高 1 分(63 对 62),每个任务的花费只有 Astra 的七分之一左右。

9 月 22 日才发布的 GPT-6 Sol,一周后就出了这个升级版,单价不变,旧版目前还能用。
排行榜名次看个大概就行
Arena 的智能体榜(10 月 2 日)上,Sonnet 5.5 排第 3,GPT-6.1 Sol 排第 5;但算上统计误差,两者可能的名次分别在第 1 到第 9、第 1 到第 10 之间,谁先谁后还说不准。
按你的情况选
- 已经订了 ChatGPT Plus 或更高:直接在 Codex 里用 GPT-6.1 Sol,命令行版已经默认是它,不用另外花钱。10 月 3 日 Codex 额度还刚全员重置过。
- 在用 Claude Code:Pro 起就能用 Sonnet 5.5。订阅不按 Token 收钱,上面的花费那一栏不直接适用;按量调 API 的话,开到最高档时同样的活可能比 GPT-6.1 Sol 贵得多,先用默认档小批量试。
- 在等 Gemini 4 Argon:Google 说之后先开放给付费 API 客户和 Google AI Ultra 订阅者,没给日期。首发价 $2 / $10 是优惠价,之后会涨到 $4 / $20。
- 只能通过中转买:两款都已大量上架,Sonnet 5.5 有 198 家在卖,GPT-6.1 Sol 有 316 家。Sonnet 5.5 我们测了 4 家中转站,3 家身份一致、1 家没测出结论。GPT-6.1 Sol 要多留个心:它和 GPT-6 Astra 太像,连官方通道我们也只能测到「高度相似」,所以「确认不了身份」本身不说明有问题;但测过的 5 家里,有 8 次测出来更像别的型号,大多最像官方价只有它十分之一的 GPT-5.6 Luna,5 家都出现过。买之前先用自己的 Key 在模真真验一次。
出处(14)
- Introducing GPT-6.1 Sol · OpenAI
- GPT-6.1 Sol API 价格 · OpenAI
- Codex 可用模型 · OpenAI
- API 模型停用列表 · OpenAI
- Claude Sonnet 5.5 · Anthropic
- Claude 套餐 · Anthropic
- Gemini 4 Argon 发布 · Google
- Fairwind 计划 · Google DeepMind
- 编程智能体指数 · Artificial Analysis
- Claude Sonnet 5.5 评测 · Artificial Analysis
- GPT-6.1 Sol 评测 · Artificial Analysis
- Arena 智能体榜 · Arena
- GPT-6.1 Sol 的中转报价与验真 · 模真真
- Claude Sonnet 5.5 的中转报价与验真 · 模真真
内容有误?告诉我们,核实后会更正,并在这里写明改了什么。