벤치마크
벤치마크 및 방법론.
ChatGPT-6이 현재 최첨단 모델들과 어떻게 비교되는지 — 전체 표, 각 수치의 근거가 되는 주의사항, 그리고 이 결과가 정확히 어떻게 도출되었는지를 확인하세요.
최종 업데이트: 2026년 9월
대부분의 비교표는 근거 없이 결론만 제시합니다. 이 표는 수치를 그대로 공개한 다음, 그 수치가 어디에서 나왔는지, 무엇을 말해 주지 못하는지, 그리고 무료 프리뷰가 계산을 왜곡하는 이유를 설명합니다.
ChatGPT-6은 얼리 액세스 프리뷰이므로, 수치는 최종 결과가 아닌 방향성을 보여 주는 지표로 읽어야 합니다. 솔직히 요약하면 "어떤 출시 모델도 따라올 수 없는 가격으로 제공되는 최첨단 수준의 품질"입니다.
전체 표
아홉 가지 평가 축, 다섯 모델, 무료인 열 하나.
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| 지능 지수 | 71* | 67 | 68 | 66 | 65 |
| 에이전트 코딩 | 86* | 84 | 82 | 78 | 76 |
| 컨텍스트 창 | 400K | 400K | 1M | 2M | 500K |
| 최대 출력 | 128K | 128K | 64K | 64K | 64K |
| 처리량 (tps) | 58* | 70 | 55 | 92 | 120 |
| 가격 / 1M 출력 토큰 | $0 | $10 | $25 | $10 | $6 |
| 멀티모달 | |||||
| 오픈 가중치 | |||||
| 무료 사용 가능 |
추론, 지식 및 수학 벤치마크 전반의 종합 점수(높을수록 좋음).
에이전트 코딩 점수의 참고값 — 도구를 사용하는 실제 다중 파일 작업(높을수록 좋음).
모델이 단일 대화에서 참조할 수 있는 최대 토큰 수.
모델이 한 번의 호출에서 생성하는 최대 응답 길이.
초당 토큰 단위의 중앙 출력 속도(높을수록 빠름).
출력 토큰 1백만 개당 정가(낮을수록 저렴함).
텍스트와 함께 이미지 입력을 지원합니다.
가중치를 다운로드하여 자체 호스팅할 수 있습니다.
현재 무료로 사용할 수 있습니다.
일대일 비교
집중해서 일대일로 비교해 보고 싶으신가요? 대결할 모델을 선택하세요.
방법론
지능 지수는 Artificial Analysis Intelligence Index의 취지에 따라 공개된 추론, 지식 및 수학 벤치마크를 종합한 지표입니다. 에이전트 코딩은 단독 코드 조각이 아니라 도구를 사용해 실행한 실제 멀티파일 작업을 반영합니다.
컨텍스트 창, 최대 출력, 처리량 및 가격은 제공업체가 보고한 수치입니다. 가격은 출력 토큰 100만 개당 정가이며, 일반적으로 더 저렴한 입력 토큰은 표를 읽기 쉽게 하기 위해 생략했습니다.
ChatGPT-6은 얼리 액세스 프리뷰 단계이므로 별표(*)가 표시된 수치는 제공업체의 데이터시트가 아닌 커뮤니티 보고 추정치입니다. 모델이 조정됨에 따라 수치는 변경되며, 더 나은 데이터가 나오면 이 페이지를 업데이트합니다.
이 분야의 수치는 빠르게 변합니다. 이 정보는 모델 선택을 위한 방향성 가이드로 활용하고, 공인 벤치마크 순위표로 보지는 마세요. 확실하지 않다면 직접 작성한 프롬프트로 직접 평가를 실행해 보세요.
직접 확인해 보세요
수치만으로는 알 수 없습니다. ChatGPT-6에 실제 작업을 맡기고 결과를 평가해 보세요.