基准测试
基准测试与方法论。
ChatGPT-6 如何对标当前前沿模型——完整表格、每个数字背后的注意事项,以及具体的编制方法。
最后更新:2026 年 9 月
大多数对比表只给你一个结论,却不提供依据。这张表先列出数字,然后告诉你这些数字从何而来、无法说明什么,以及为什么免费预览会扭曲计算结果。
ChatGPT-6 是抢先体验预览版,因此请将其数据视为趋势参考,而非最终结果——坦率地说,就是“前沿级质量,价格低到任何正式发布的模型都无法匹敌”。
完整表格
九个维度,五个模型,其中一列免费。
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| 智能指数 | 71* | 67 | 68 | 66 | 65 |
| 智能体编程 | 86* | 84 | 82 | 78 | 76 |
| 上下文窗口 | 400K | 400K | 1M | 2M | 500K |
| 最大输出 | 128K | 128K | 64K | 64K | 64K |
| 吞吐量(tps) | 58* | 70 | 55 | 92 | 120 |
| 价格 / 1M 输出代币 | $0 | $10 | $25 | $10 | $6 |
| 多模态 | |||||
| 开放权重 | |||||
| 免费使用 |
在推理、知识和数学基准测试上的综合得分(越高越好)。
参考性的智能体编程得分——使用工具完成真实世界的多文件任务(越高越好)。
模型在单次对话中可处理的最大代币数。
模型单次调用可生成的最大响应长度。
每秒代币数的输出速度中位数(越高越快)。
每百万输出代币的标价(越低越便宜)。
支持在文本之外输入图像。
可下载权重并自行托管。
目前可免费使用。
方法论
智能指数是由公开的推理、知识和数学基准测试综合得出的,理念上参考 Artificial Analysis Intelligence Index。智能体编程反映的是借助工具执行的真实世界多文件任务,而非孤立的代码片段。
上下文窗口、最大输出、吞吐量和价格均为供应商提供的数据。价格是每百万输出 token 的标价;输入 token 通常更便宜,为了让表格更易读,此处省略。
ChatGPT-6 目前处于早期访问预览阶段,因此其数据(标有 *)是社区报告的估算值,而非供应商数据表中的数值。随着模型不断调优,这些数据会发生变化——有更好的数据出现时,我们会更新此页面。
这个领域的数字变化很快。请将其作为选择模型的方向性指南,而不是正式的基准排行榜。如有疑问,请使用自己的提示词运行自己的评测。
亲自看看
数字只是一个方面。交给 ChatGPT-6 一项真实任务,亲自评判输出结果。