ベンチマーク
ベンチマークと手法。
ChatGPT-6が現在の最先端モデルとどのように肩を並べるのか — 完全な表、各数値の背景にある注意点、そしてその作成方法の詳細。
最終更新:2026年9月
ほとんどの比較表は、根拠を示さずに結論だけを押しつけます。この表では数値を公開し、その出所、数値からは分からないこと、そして無料プレビューが計算をどのように歪めるかを説明します。
ChatGPT-6 は早期アクセスプレビューです。そのため、数値は最終的なものではなく、方向性を示すものとしてご覧ください — 正直な要約は「どの提供モデルも追随できない価格で、フロンティアクラスの品質」です。
全比較表
9つの評価軸、5つのモデル、無料の列が1つ。
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| インテリジェンス指数 | 71* | 67 | 68 | 66 | 65 |
| エージェント型コーディング | 86* | 84 | 82 | 78 | 76 |
| コンテキストウィンドウ | 400K | 400K | 1M | 2M | 500K |
| 最大出力 | 128K | 128K | 64K | 64K | 64K |
| スループット(tps) | 58* | 70 | 55 | 92 | 120 |
| 出力 / 1M あたりの価格 | $0 | $10 | $25 | $10 | $6 |
| マルチモーダル | |||||
| オープンウェイト | |||||
| 無料で利用可能 |
推論、知識、数学のベンチマークにおける総合スコア(高いほど優れています)。
エージェント型コーディングの参考スコア — ツールを使った実世界の複数ファイルタスク(高いほど優れています)。
モデルが1回の会話で処理できる最大トークン数。
モデルが1回の呼び出しで生成する最大レスポンス。
1秒あたりのトークン数で測定した出力速度の中央値(高いほど高速)。
出力トークン1M個あたりの定価(低いほど安価)。
テキストと一緒に画像入力を受け付けます。
重みをダウンロードしてセルフホストできます。
現在は無料で利用できます。
方法論
Intelligence Indexは、Artificial Analysis Intelligence Indexに着想を得た、公開されている推論・知識・数学ベンチマークを組み合わせた指標です。エージェント型コーディングは、単独のコード断片ではなく、ツールを使って実行した現実世界の複数ファイルタスクを反映しています。
コンテキストウィンドウ、最大出力、スループット、価格はプロバイダーが公表している数値です。価格は出力トークン100万個あたりの定価で、通常は入力トークンのほうが安いため、表を見やすくするために省略しています。
ChatGPT-6は早期アクセスプレビュー中のため、*印の付いた数値はベンダーのデータシートではなく、コミュニティによる推定値です。モデルの調整に伴って変動するため、より良いデータが得られ次第、このページを更新します。
この分野では数値が急速に変化します。これはモデル選びの方向性を示すガイドとしてご利用ください。正式なベンチマークの順位表ではありません。迷った場合は、ご自身のプロンプトで独自に評価してください。
実際に試してみる
数値だけではわかりません。ChatGPT-6に実際のタスクを任せて、出力を評価してください。