Benchmarks

Benchmarks und Methodik.

So schneidet ChatGPT-6 im Vergleich zur aktuellen Spitzenklasse ab – die vollständige Tabelle, die Einschränkungen hinter jeder Zahl und genau, wie sie erstellt wurde.

Zuletzt aktualisiert: September 2026

Die meisten Vergleichstabellen präsentieren dir ein Urteil ohne Belege. Diese hier zeigt die Zahlen, erklärt dann, woher sie stammen, was sie nicht aussagen können und warum eine kostenlose Vorschau die Rechnung verzerrt.

ChatGPT-6 ist eine Vorschau mit frühem Zugriff. Lies die Zahlen daher als richtungsweisend, nicht als endgültig — die ehrliche Zusammenfassung lautet: „Qualität auf Frontier-Niveau zu einem Preis, mit dem kein kommerziell angebotenes Modell mithalten kann.“

Die vollständige Tabelle

Neun Achsen, fünf Modelle, eine kostenlose Spalte.

Metric
ChatGPT-6
GPT-5.6
Opus 5
Gemini 3.7
Grok 4.6
Intelligenzindex71*67686665
Agentisches Programmieren86*84827876
Kontextfenster400K400K1M2M500K
Maximale Ausgabe128K128K64K64K64K
Durchsatz (tps)58*705592120
Preis / 1 Mio. Ausgabetoken$0$10$25$10$6
Multimodal
Offene Gewichte
Kostenlos nutzbar
Intelligenzindex

Zusammengesetzte Punktzahl aus Benchmarks zu Schlussfolgerungen, Wissen und Mathematik (höher ist besser).

Agentisches Programmieren

Richtungsweisende Punktzahl für agentisches Programmieren — reale Aufgaben mit mehreren Dateien und Tools (höher ist besser).

Kontextfenster

Maximale Anzahl an Token, die das Modell in einer einzelnen Unterhaltung berücksichtigen kann.

Maximale Ausgabe

Größte Antwort, die das Modell in einem Aufruf erzeugt.

Durchsatz (tps)

Mediane Ausgabegeschwindigkeit in Token pro Sekunde (höher ist schneller).

Preis / 1 Mio. Ausgabetoken

Listenpreis pro Million Ausgabetoken (niedriger ist günstiger).

Multimodal

Unterstützt Bildeingaben zusammen mit Text.

Offene Gewichte

Gewichte können heruntergeladen und selbst gehostet werden.

Kostenlos nutzbar

Derzeit kostenlos nutzbar.

Methodik

Der Intelligence Index ist ein zusammengesetzter Wert aus öffentlichen Benchmarks für logisches Denken, Wissen und Mathematik, im Geist des Artificial Analysis Intelligence Index. Agentisches Programmieren bildet praxisnahe Aufgaben mit mehreren Dateien ab, die mit Tools statt anhand isolierter Codeausschnitte ausgeführt werden.

Kontextfenster, maximale Ausgabe, Durchsatz und Preisangaben stammen von den Anbietern. Der Preis ist der Listenpreis pro einer Million Ausgabetoken; Eingabetoken sind in der Regel günstiger und werden weggelassen, damit die Tabelle übersichtlich bleibt.

ChatGPT-6 befindet sich in einer frühen Zugriffsvorschau. Daher sind seine mit * gekennzeichneten Werte von der Community gemeldete Schätzungen und kein Datenblatt des Anbieters. Sie werden sich ändern, während das Modell weiter abgestimmt wird – wir aktualisieren diese Seite, sobald bessere Daten verfügbar sind.

Die Zahlen ändern sich in diesem Bereich schnell. Nutze dies als Orientierungshilfe bei der Auswahl eines Modells, nicht als maßgebliche Benchmark-Rangliste. Im Zweifel solltest du deine eigene Evaluierung mit deinen eigenen Prompts durchführen.

Überzeuge dich selbst

Zahlen sind das eine. Gib ChatGPT-6 eine echte Aufgabe und beurteile die Ausgabe.

Konsole öffnen