它有多强
成绩来自 Epoch AI, AI Benchmarking Hub (2026)11 / 20 项20 项评测里,这个模型测过 11 项
- 模型自己的成绩
- 6 项
- 配上工具的成绩
- 5 项
- 换不同设置跑出的成绩
- 11 次
这里只算能确认就是这个型号的公开成绩。没成绩不代表它不行,我们也不会给它记 0 分。
还有 9 项评测没测过这个模型
DeepResearchBenchGDPvalOSWorld 2Terminal-BenchEpoch Capabilities IndexHumanity's Last ExamMirrorCodeSimpleQA VerifiedVideo-MME可能是没人测过,也可能是名字对不上号。我们宁可空着,也不拿差不多的成绩硬凑。
这个模型还没有可比的综合成绩,下面是它的单项成绩。
模型自己的成绩
同一道题直接问模型,不给它工具。每项都标出参加这项评测的全部模型的中位分和最高分,方便对照。
ARC-AGI-2推理
新颖抽象规则归纳与泛化能力。
默认档0.00%
参加这项评测的全部模型 中位 9.86% · 最高 95.0% · 共 203 个成绩
每题成本 0.12 训练算力 3.35 × 10^25 FLOP评测于 2025年2月24日来源 Anthropic ↗许可 CC BY 4.0
FrontierMath数学
由专业数学家设计的前沿数学问题。
默认档3.10%±
参加这项评测的全部模型 中位 13.5% · 最高 52.4% · 共 101 个成绩
多次评分最佳 3.10%训练算力 3.35 × 10^25 FLOP评测于 2025年3月7日来源 Anthropic ↗看逐题日志 ↗许可 CC BY 4.0
GPQA Diamond推理
研究生级科学问答,衡量高难知识推理。
默认档66.0%±
参加这项评测的全部模型 中位 74.2% · 最高 95.8% · 共 313 个成绩
多次评分最佳 66.0%训练算力 3.35 × 10^25 FLOP评测于 2025年2月25日来源 Anthropic ↗看逐题日志 ↗许可 CC BY 4.0
LiveBench推理版本 LiveBench-2024-11-25
使用持续更新题目降低污染风险的综合能力评测。
默认档76.1
参加这项评测的全部模型 中位 52.4 · 最高 82.3 · 共 52 个成绩
训练算力 3.35 × 10^25 FLOP评测于 2025年2月24日来源 Anthropic ↗许可 CC BY 4.0
MATH Level 5数学
高难竞赛数学问题正确率。
默认档68.2%±
参加这项评测的全部模型 中位 59.4% · 最高 98.1% · 共 108 个成绩
多次评分最佳 68.2%训练算力 3.35 × 10^25 FLOP评测于 2025年2月25日来源 Anthropic ↗看逐题日志 ↗许可 CC BY 4.0
SimpleBench推理
以多次作答平均分衡量常识与推理能力。
默认档44.9%
参加这项评测的全部模型 中位 49.5% · 最高 81.9% · 共 102 个成绩
训练算力 3.35 × 10^25 FLOP评测于 2025年2月24日来源 Anthropic ↗许可 CC BY 4.0
配上 Agent 能做到什么
这不是模型自己的分数。下面的成绩是模型配上评测方的工具和运行环境跑出来的,换一套工具结果就会变。它们不算进上面的档位,也不能拿来排模型强弱。
Aider Polyglot编程
多语言代码编辑任务;结果包含 Aider 执行框架影响。
默认档60.4%
参加这项评测的全部模型 中位 53.8% · 最高 88.0% · 共 71 个成绩
训练算力 3.35 × 10^25 FLOP评测于 2025年2月24日来源 Anthropic ↗许可 Apache License 2.0
CyBench任务执行
在网络安全任务中无分步提示完成的比例;结果包含任务环境与执行流程。
默认档20.0%
参加这项评测的全部模型 中位 21.3% · 最高 93.0% · 共 22 个成绩
训练算力 3.35 × 10^25 FLOP评测于 2025年2月24日来源 Anthropic ↗许可 CC BY 4.0
METR Time Horizons任务执行
在 METR 任务分布中达到约 50% 成功率的任务时长(分钟);结果包含评测执行环境。
默认档60.4
参加这项评测的全部模型 中位 55.1 · 最高 1044.8 · 共 50 个成绩
训练算力 3.35 × 10^25 FLOP评测于 2025年2月24日来源 Anthropic ↗许可 CC BY 4.0
OSWorld多模态
在真实电脑环境中完成跨应用任务;成绩取决于模型、Agent 和工具环境。
默认档35.8%
参加这项评测的全部模型 中位 43.9% · 最高 72.1% · 共 9 个成绩
Agent:claude-3-7-sonnet-20250219 (50 steps)训练算力 3.35 × 10^25 FLOP评测于 2025年2月24日来源 Anthropic ↗许可 CC BY 4.0
SWE-bench Verified编程
在真实 GitHub 问题上修复代码;结果依赖 Agent 与工具链。
默认档61.0%±
参加这项评测的全部模型 中位 73.8% · 最高 83.5% · 共 33 个成绩
多次评分最佳 61.0%训练算力 3.35 × 10^25 FLOP评测于 2026年2月5日来源 Anthropic ↗看逐题日志 ↗许可 CC BY 4.0