벤치마크

벤치마크 및 방법론.

ChatGPT-6이 현재 최첨단 모델들과 어떻게 비교되는지 — 전체 표, 각 수치의 근거가 되는 주의사항, 그리고 이 결과가 정확히 어떻게 도출되었는지를 확인하세요.

최종 업데이트: 2026년 9월

대부분의 비교표는 근거 없이 결론만 제시합니다. 이 표는 수치를 그대로 공개한 다음, 그 수치가 어디에서 나왔는지, 무엇을 말해 주지 못하는지, 그리고 무료 프리뷰가 계산을 왜곡하는 이유를 설명합니다.

ChatGPT-6은 얼리 액세스 프리뷰이므로, 수치는 최종 결과가 아닌 방향성을 보여 주는 지표로 읽어야 합니다. 솔직히 요약하면 "어떤 출시 모델도 따라올 수 없는 가격으로 제공되는 최첨단 수준의 품질"입니다.

전체 표

아홉 가지 평가 축, 다섯 모델, 무료인 열 하나.

Metric
ChatGPT-6
GPT-5.6
Opus 5
Gemini 3.7
Grok 4.6
지능 지수71*67686665
에이전트 코딩86*84827876
컨텍스트 창400K400K1M2M500K
최대 출력128K128K64K64K64K
처리량 (tps)58*705592120
가격 / 1M 출력 토큰$0$10$25$10$6
멀티모달
오픈 가중치
무료 사용 가능
지능 지수

추론, 지식 및 수학 벤치마크 전반의 종합 점수(높을수록 좋음).

에이전트 코딩

에이전트 코딩 점수의 참고값 — 도구를 사용하는 실제 다중 파일 작업(높을수록 좋음).

컨텍스트 창

모델이 단일 대화에서 참조할 수 있는 최대 토큰 수.

최대 출력

모델이 한 번의 호출에서 생성하는 최대 응답 길이.

처리량 (tps)

초당 토큰 단위의 중앙 출력 속도(높을수록 빠름).

가격 / 1M 출력 토큰

출력 토큰 1백만 개당 정가(낮을수록 저렴함).

멀티모달

텍스트와 함께 이미지 입력을 지원합니다.

오픈 가중치

가중치를 다운로드하여 자체 호스팅할 수 있습니다.

무료 사용 가능

현재 무료로 사용할 수 있습니다.

방법론

지능 지수는 Artificial Analysis Intelligence Index의 취지에 따라 공개된 추론, 지식 및 수학 벤치마크를 종합한 지표입니다. 에이전트 코딩은 단독 코드 조각이 아니라 도구를 사용해 실행한 실제 멀티파일 작업을 반영합니다.

컨텍스트 창, 최대 출력, 처리량 및 가격은 제공업체가 보고한 수치입니다. 가격은 출력 토큰 100만 개당 정가이며, 일반적으로 더 저렴한 입력 토큰은 표를 읽기 쉽게 하기 위해 생략했습니다.

ChatGPT-6은 얼리 액세스 프리뷰 단계이므로 별표(*)가 표시된 수치는 제공업체의 데이터시트가 아닌 커뮤니티 보고 추정치입니다. 모델이 조정됨에 따라 수치는 변경되며, 더 나은 데이터가 나오면 이 페이지를 업데이트합니다.

이 분야의 수치는 빠르게 변합니다. 이 정보는 모델 선택을 위한 방향성 가이드로 활용하고, 공인 벤치마크 순위표로 보지는 마세요. 확실하지 않다면 직접 작성한 프롬프트로 직접 평가를 실행해 보세요.

직접 확인해 보세요

수치만으로는 알 수 없습니다. ChatGPT-6에 실제 작업을 맡기고 결과를 평가해 보세요.

콘솔 열기