基准测试

基准测试与方法论。

ChatGPT-6 如何对标当前前沿模型——完整表格、每个数字背后的注意事项,以及具体的编制方法。

最后更新:2026 年 9 月

大多数对比表只给你一个结论,却不提供依据。这张表先列出数字,然后告诉你这些数字从何而来、无法说明什么,以及为什么免费预览会扭曲计算结果。

ChatGPT-6 是抢先体验预览版,因此请将其数据视为趋势参考,而非最终结果——坦率地说,就是“前沿级质量,价格低到任何正式发布的模型都无法匹敌”。

完整表格

九个维度,五个模型,其中一列免费。

Metric
ChatGPT-6
GPT-5.6
Opus 5
Gemini 3.7
Grok 4.6
智能指数71*67686665
智能体编程86*84827876
上下文窗口400K400K1M2M500K
最大输出128K128K64K64K64K
吞吐量(tps)58*705592120
价格 / 1M 输出代币$0$10$25$10$6
多模态
开放权重
免费使用
智能指数

在推理、知识和数学基准测试上的综合得分(越高越好)。

智能体编程

参考性的智能体编程得分——使用工具完成真实世界的多文件任务(越高越好)。

上下文窗口

模型在单次对话中可处理的最大代币数。

最大输出

模型单次调用可生成的最大响应长度。

吞吐量(tps)

每秒代币数的输出速度中位数(越高越快)。

价格 / 1M 输出代币

每百万输出代币的标价(越低越便宜)。

多模态

支持在文本之外输入图像。

开放权重

可下载权重并自行托管。

免费使用

目前可免费使用。

方法论

智能指数是由公开的推理、知识和数学基准测试综合得出的,理念上参考 Artificial Analysis Intelligence Index。智能体编程反映的是借助工具执行的真实世界多文件任务,而非孤立的代码片段。

上下文窗口、最大输出、吞吐量和价格均为供应商提供的数据。价格是每百万输出 token 的标价;输入 token 通常更便宜,为了让表格更易读,此处省略。

ChatGPT-6 目前处于早期访问预览阶段,因此其数据(标有 *)是社区报告的估算值,而非供应商数据表中的数值。随着模型不断调优,这些数据会发生变化——有更好的数据出现时,我们会更新此页面。

这个领域的数字变化很快。请将其作为选择模型的方向性指南,而不是正式的基准排行榜。如有疑问,请使用自己的提示词运行自己的评测。

亲自看看

数字只是一个方面。交给 ChatGPT-6 一项真实任务,亲自评判输出结果。

打开控制台