GPT-4o (2024-08-06)
OpenAI · gpt-4o-2024-08-06
用于通用推理、写作、编程以及工具辅助任务的 GPT 模型
用于通用推理、写作、编程以及工具辅助任务的 GPT 模型
全球 · 价格附有适用条件
折扣与价格评分按全球的官方价计算
| 不分档 | 8.393 CNY/ 百万 Token |
|---|---|
| fine_tuned:true | 12.59 CNY/ 百万 Token |
| 不分档 | 16.79 CNY/ 百万 Token |
|---|---|
| fine_tuned:true | 25.18 CNY/ 百万 Token |
| 不分档 | 67.15 CNY/ 百万 Token |
|---|---|
| fine_tuned:true | 100.72 CNY/ 百万 Token |
全球 · 采集于 2026-10-02 · 查看价格来源
不同地方写法可能不一样,列在这里方便你对上号。名字太模糊、认不准的不会公开。
按第三方评测机构 Artificial Analysis 的智能指数,只跟当前在售的模型排名,每个模型按它最强的推理档位算:前 15% 为旗舰,15%–40% 为高端,40%–70% 为中端,其余为入门。只比能力,不看价格。
科学难题、数学和没见过的新题,看它想得清不清楚。
数学家出的前沿数学题,题目不公开、难以刷分。做数学、算法、量化时看这项。
研究生水平的物理、化学、生物难题。拿它做研究、分析复杂问题时看这项。
普通人一眼能答对、模型却容易掉坑的常识题。看它日常对话靠不靠谱。
答得对不对、会不会编造,查资料和写正式内容时最要紧。
简短的事实问答,答错或编造都扣分。拿它查资料、写要求准确的内容时看这项。
配上工具自己查资料、做长任务,适合交给它一整件事。标了「配工具」的成绩是模型加上评测方的工具和运行环境跑出来的,换一套工具结果会变,不算进上面的名次。
模型能独立做完多长时间的任务(按人类专家要花的分钟数算)。让它长时间自己干活时看这项。
厂商官方接口的实测中位数,看它回答快不快;不代表任何中转站线路的快慢。
厂商官方接口开始回答后,每秒能吐出多少 Token 的实测中位数。不代表中转站线路的快慢。
向厂商官方接口提问后,要等几秒才看到回答的第一个字(思考模型包括思考时间)的实测中位数。越短越好,不代表中转站线路。
这些评测停止更新、有成绩的模型太少或者和选购关系不大,成绩仅供参考,不影响上面的名次和用途筛选。
多语言代码编辑任务;结果包含 Aider 执行框架影响。
不再排行的原因:评测方已经很久没测新模型,排名反映不了现在的模型。
使用持续更新题目降低污染风险的综合能力评测。
不再排行的原因:评测方已经很久没测新模型,排名反映不了现在的模型。
竞赛数学里最难一档题目的正确率。
不再排行的原因:主流模型几乎都能做满分,已经分不出高低;评测方也已停止测新模型。
长短视频理解能力,采用无字幕正确率。
不再排行的原因:评测方已经很久没测新模型,排名反映不了现在的模型。
还没有人点评。用过的话,写下第一条真实体验,帮后来的人少踩坑。