Claude Opus 4.1
Claude · claude-opus-4-1-20250805
适用于深度推理、编程以及长周期智能体的旗舰级 Claude 模型
Claude Opus 4.1 官方已于 2026年8月5日 停止服务。中转站还在用这个名字卖,实际给你的可能是别的模型。真要买,先小额试用,或先去验真确认是不是原模型。
Claude · claude-opus-4-1-20250805
适用于深度推理、编程以及长周期智能体的旗舰级 Claude 模型
Claude Opus 4.1 官方已于 2026年8月5日 停止服务。中转站还在用这个名字卖,实际给你的可能是别的模型。真要买,先小额试用,或先去验真确认是不是原模型。
适用于深度推理、编程以及长周期智能体的旗舰级 Claude 模型
查看介绍来源不同地方写法可能不一样,列在这里方便你对上号。名字太模糊、认不准的不会公开。
| 计价项 | 适用范围 | 官方价格 |
|---|---|---|
| 缓存读取 | 全球 | 1.5 USD/ 1,000,000 token |
| 缓存写入 | 全球 | 18.75 USD/ 1,000,000 token |
| 输入 | 全球 | 15 USD/ 1,000,000 token |
| 输出 | 全球 | 75 USD/ 1,000,000 token |
这里只算能确认就是这个型号的公开成绩。没成绩不代表它不行,我们也不会给它记 0 分。
可能是没人测过,也可能是名字对不上号。我们宁可空着,也不拿差不多的成绩硬凑。
同一道题直接问模型,不给它工具。每项都标出参加这项评测的全部模型的中位分和最高分,方便对照。
由专业数学家设计的前沿数学问题。
参加这项评测的全部模型 中位 13.5% · 最高 52.4% · 共 101 个成绩
研究生级科学问答,衡量高难知识推理。
参加这项评测的全部模型 中位 74.2% · 最高 95.8% · 共 313 个成绩
以多次作答平均分衡量常识与推理能力。
参加这项评测的全部模型 中位 49.5% · 最高 81.9% · 共 102 个成绩
这不是模型自己的分数。下面的成绩是模型配上评测方的工具和运行环境跑出来的,换一套工具结果就会变。它们不算进上面的档位,也不能拿来排模型强弱。
在网络安全任务中无分步提示完成的比例;结果包含任务环境与执行流程。
参加这项评测的全部模型 中位 21.3% · 最高 93.0% · 共 22 个成绩
需要检索、综合与引用的深度研究任务;结果包含研究 Agent 与工具环境。
参加这项评测的全部模型 中位 47.9% · 最高 55.3% · 共 41 个成绩
面向真实经济任务的产出质量比较;结果依赖任务执行配置。
参加这项评测的全部模型 中位 34.8% · 最高 49.7% · 共 11 个成绩
在 METR 任务分布中达到约 50% 成功率的任务时长(分钟);结果包含评测执行环境。
参加这项评测的全部模型 中位 55.1 · 最高 1044.8 · 共 50 个成绩
在真实 GitHub 问题上修复代码;结果依赖 Agent 与工具链。
参加这项评测的全部模型 中位 73.8% · 最高 83.5% · 共 33 个成绩
终端环境中的真实任务完成率;结果依赖 Agent 框架。
参加这项评测的全部模型 中位 42.7% · 最高 84.7% · 共 59 个成绩
可以写下第一条评价。
你可以提出第一个问题。
适用于深度推理、编程以及长周期智能体的旗舰级 Claude 模型
适用于深度推理、编程以及长周期智能体的旗舰级 Claude 模型
查看介绍来源不同地方写法可能不一样,列在这里方便你对上号。名字太模糊、认不准的不会公开。
| 计价项 | 适用范围 | 官方价格 |
|---|---|---|
| 缓存读取 | 全球 | 1.5 USD/ 1,000,000 token |
| 缓存写入 | 全球 | 18.75 USD/ 1,000,000 token |
| 输入 | 全球 | 15 USD/ 1,000,000 token |
| 输出 | 全球 | 75 USD/ 1,000,000 token |
这里只算能确认就是这个型号的公开成绩。没成绩不代表它不行,我们也不会给它记 0 分。
可能是没人测过,也可能是名字对不上号。我们宁可空着,也不拿差不多的成绩硬凑。
同一道题直接问模型,不给它工具。每项都标出参加这项评测的全部模型的中位分和最高分,方便对照。
由专业数学家设计的前沿数学问题。
参加这项评测的全部模型 中位 13.5% · 最高 52.4% · 共 101 个成绩
研究生级科学问答,衡量高难知识推理。
参加这项评测的全部模型 中位 74.2% · 最高 95.8% · 共 313 个成绩
以多次作答平均分衡量常识与推理能力。
参加这项评测的全部模型 中位 49.5% · 最高 81.9% · 共 102 个成绩
这不是模型自己的分数。下面的成绩是模型配上评测方的工具和运行环境跑出来的,换一套工具结果就会变。它们不算进上面的档位,也不能拿来排模型强弱。
在网络安全任务中无分步提示完成的比例;结果包含任务环境与执行流程。
参加这项评测的全部模型 中位 21.3% · 最高 93.0% · 共 22 个成绩
需要检索、综合与引用的深度研究任务;结果包含研究 Agent 与工具环境。
参加这项评测的全部模型 中位 47.9% · 最高 55.3% · 共 41 个成绩
面向真实经济任务的产出质量比较;结果依赖任务执行配置。
参加这项评测的全部模型 中位 34.8% · 最高 49.7% · 共 11 个成绩
在 METR 任务分布中达到约 50% 成功率的任务时长(分钟);结果包含评测执行环境。
参加这项评测的全部模型 中位 55.1 · 最高 1044.8 · 共 50 个成绩
在真实 GitHub 问题上修复代码;结果依赖 Agent 与工具链。
参加这项评测的全部模型 中位 73.8% · 最高 83.5% · 共 33 个成绩
终端环境中的真实任务完成率;结果依赖 Agent 框架。
参加这项评测的全部模型 中位 42.7% · 最高 84.7% · 共 59 个成绩
Claude Opus 4.1 官方已于 2026年8月5日 停止服务。中转站还在用这个名字卖,实际给你的可能是别的模型。真要买,先小额试用,或先去验真确认是不是原模型。 去验真
下面是别人对这个模型做过的检测,按时间从新到旧排。
公开点评会展示在这里,登录后可以提交真实使用体验。
你可以提出第一个问题。