官方已下线(2026年3月26日 起)。官方不再推荐新项目使用这个版本,下面的评测成绩只反映它当时的表现。
模型介绍
gpt-4-0125-preview 是 ChatGPT 推出的对话模型。它支持提示缓存、工具调用。
模型基础信息
- 厂商
- ChatGPT
- 模型类型
- 文本与多模态
- 能调工具吗
- 可以能不能自动调用外部函数、查资料、执行动作
- 它会做什么
- 会聊天 · 支持缓存省钱 · 可以设定角色 · 会调工具
- 怎么计费
- 按 Token 计费官方按什么单位收钱
- 现在还能用吗
- 官方已下线 · 2026年3月26日 起 · 状态来源官方已停止提供,通常已经调不通了;页面上的成绩只反映它当时的表现。
- 这些资料是哪个地区的
- 全球按厂商全球公布的资料显示;国内没单独公布时,也用这一份。
它还叫这些名字(18 条)
GPT 4 0125 PREVIEWGPT 4 0125 PREVIEW(azure · international)GPT 4 0125 PREVIEW(openai-api · international)GPT-4-0125-PREVIEWGPT-4-0125-PREVIEW(azure · international)GPT-4-0125-PREVIEW(openai-api · international)GPT_4_0125_PREVIEWGPT_4_0125_PREVIEW(azure · international)GPT_4_0125_PREVIEW(openai-api · international)gpt 4 0125 previewgpt 4 0125 preview(azure · international)gpt 4 0125 preview(openai-api · international)gpt-4-0125-previewgpt-4-0125-preview(azure · international)gpt-4-0125-preview(openai-api · international)gpt_4_0125_previewgpt_4_0125_preview(azure · international)gpt_4_0125_preview(openai-api · international)不同地方写法可能不一样,列在这里方便你对上号。名字太模糊、认不准的不会公开。
官方价格
| 计价项 | 适用范围 | 官方价格 |
|---|
| 输入 | 全球 | 10 USD/ 1,000,000 token |
| 输出 | 全球 | 30 USD/ 1,000,000 token |
它有多强
成绩来自 Epoch AI, AI Benchmarking Hub (2026)3 / 20 项20 项评测里,这个模型测过 3 项
- 模型自己的成绩
- 2 项
- 配上工具的成绩
- 1 项
- 换不同设置跑出的成绩
- 3 次
这里只算能确认就是这个型号的公开成绩。没成绩不代表它不行,我们也不会给它记 0 分。
还有 17 项评测没测过这个模型
Aider PolyglotCyBenchDeepResearchBenchGDPvalOSWorldOSWorld 2SWE-bench VerifiedTerminal-BenchARC-AGI-2Epoch Capabilities IndexFrontierMathHumanity's Last ExamLiveBenchMirrorCodeSimpleBenchSimpleQA VerifiedVideo-MME可能是没人测过,也可能是名字对不上号。我们宁可空着,也不拿差不多的成绩硬凑。
这个模型还没有可比的综合成绩,下面是它的单项成绩。
模型自己的成绩
同一道题直接问模型,不给它工具。每项都标出参加这项评测的全部模型的中位分和最高分,方便对照。
GPQA Diamond推理
研究生级科学问答,衡量高难知识推理。
默认档42.3%±
参加这项评测的全部模型 中位 74.2% · 最高 95.8% · 共 313 个成绩
多次评分最佳 42.3%评测于 2025年1月27日来源 OpenAI ↗看逐题日志 ↗许可 CC BY 4.0
MATH Level 5数学
高难竞赛数学问题正确率。
默认档35.4%±
参加这项评测的全部模型 中位 59.4% · 最高 98.1% · 共 108 个成绩
多次评分最佳 35.4%评测于 2025年1月27日来源 OpenAI ↗看逐题日志 ↗许可 CC BY 4.0
配上 Agent 能做到什么
这不是模型自己的分数。下面的成绩是模型配上评测方的工具和运行环境跑出来的,换一套工具结果就会变。它们不算进上面的档位,也不能拿来排模型强弱。
METR Time Horizons任务执行
在 METR 任务分布中达到约 50% 成功率的任务时长(分钟);结果包含评测执行环境。
默认档5.4
参加这项评测的全部模型 中位 55.1 · 最高 1044.8 · 共 50 个成绩
评测于 2024年1月25日来源 OpenAI ↗许可 CC BY 4.0