Mga benchmark
Mga benchmark at metodolohiya.
Kung paano inihahambing ang ChatGPT-6 sa kasalukuyang frontier — ang buong talahanayan, ang mga limitasyon sa likod ng bawat numero, at kung paano ito eksaktong binuo.
Huling na-update: Setyembre 2026
Karamihan sa mga talahanayan ng paghahambing ay nagbibigay sa iyo ng hatol nang walang ebidensya. Inililista ng isang ito ang mga numero, pagkatapos ay sinasabi kung saan nanggaling ang mga ito, kung ano ang hindi nila masasabi sa iyo, at kung bakit binabago ng libreng preview ang mga kalkulasyon.
Ang ChatGPT-6 ay isang preview na may maagang access, kaya unawain ang mga bilang nito bilang gabay sa direksiyon sa halip na pinal na resulta — ang tapat na buod ay "kalidad na pang-frontier sa presyong hindi matutumbasan ng anumang modelong nasa produksyon."
Ang buong talahanayan
Siyam na pamantayan, limang modelo, isang kolum na libre.
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| Index ng intelligence | 71* | 67 | 68 | 66 | 65 |
| Agentic na coding | 86* | 84 | 82 | 78 | 76 |
| Window ng konteksto | 400K | 400K | 1M | 2M | 500K |
| Pinakamalaking output | 128K | 128K | 64K | 64K | 64K |
| Throughput (tps) | 58* | 70 | 55 | 92 | 120 |
| Presyo / 1M output | $0 | $10 | $25 | $10 | $6 |
| Multimodal | |||||
| Bukas na weights | |||||
| Libreng gamitin |
Pinagsamang score sa mga benchmark ng pangangatwiran, kaalaman, at matematika (mas mataas ay mas mahusay).
Tinatayang score sa agentic coding — mga gawain sa totoong mundo na may maraming file at mga tool (mas mataas ay mas mahusay).
Pinakamaraming token na kayang bigyang-pansin ng modelo sa isang pag-uusap.
Pinakamalaking tugon na bubuo ang modelo sa isang tawag.
Median na bilis ng output sa mga token bawat segundo (mas mataas ay mas mabilis).
Nakalistang presyo bawat milyong output token (mas mababa ay mas mura).
Tumatanggap ng image input kasabay ng text.
Maaaring i-download ang mga weight at i-self-host.
Magagamit nang walang bayad sa ngayon.
Harapang paghahambing
Gusto mo ng nakatuong pagsusuri, isa laban sa isa? Pumili ng match-up.
Metodolohiya
Ang Intelligence Index ay pinagsama-samang sukatan mula sa mga pampublikong benchmark sa pangangatwiran, kaalaman, at matematika, batay sa konsepto ng Artificial Analysis Intelligence Index. Sinusukat ng agentic coding ang mga gawain sa totoong mundo na may maraming file at isinasagawa gamit ang mga tool, hindi mga hiwalay na snippet lamang.
Ang context window, maximum na output, throughput, at presyo ay mga datos na iniulat ng provider. Ang presyo ay listahang halaga bawat isang milyong output token; karaniwang mas mura ang mga input token at hindi isinama upang manatiling madaling basahin ang talahanayan.
Nasa early-access preview ang ChatGPT-6, kaya ang mga numero nito (may markang *) ay mga pagtatantyang iniulat ng komunidad sa halip na datos mula sa vendor. Magbabago ang mga ito habang tina-tune ang modelo — nire-refresh namin ang pahinang ito kapag may lumalabas na mas mahusay na datos.
Mabilis magbago ang mga numero sa larangang ito. Gamitin ito bilang pangkalahatang gabay sa pagpili ng modelo, hindi bilang opisyal na leaderboard ng benchmark. Kapag may alinlangan, magsagawa ng sarili mong eval gamit ang sarili mong mga prompt.
Tingnan mismo
Isang bagay lang ang mga numero. Bigyan ng totoong gawain ang ChatGPT-6 at suriin ang output.