Benchmarks
Benchmarks und Methodik.
So schneidet ChatGPT-6 im Vergleich zur aktuellen Spitzenklasse ab – die vollständige Tabelle, die Einschränkungen hinter jeder Zahl und genau, wie sie erstellt wurde.
Zuletzt aktualisiert: September 2026
Die meisten Vergleichstabellen präsentieren dir ein Urteil ohne Belege. Diese hier zeigt die Zahlen, erklärt dann, woher sie stammen, was sie nicht aussagen können und warum eine kostenlose Vorschau die Rechnung verzerrt.
ChatGPT-6 ist eine Vorschau mit frühem Zugriff. Lies die Zahlen daher als richtungsweisend, nicht als endgültig — die ehrliche Zusammenfassung lautet: „Qualität auf Frontier-Niveau zu einem Preis, mit dem kein kommerziell angebotenes Modell mithalten kann.“
Die vollständige Tabelle
Neun Achsen, fünf Modelle, eine kostenlose Spalte.
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| Intelligenzindex | 71* | 67 | 68 | 66 | 65 |
| Agentisches Programmieren | 86* | 84 | 82 | 78 | 76 |
| Kontextfenster | 400K | 400K | 1M | 2M | 500K |
| Maximale Ausgabe | 128K | 128K | 64K | 64K | 64K |
| Durchsatz (tps) | 58* | 70 | 55 | 92 | 120 |
| Preis / 1 Mio. Ausgabetoken | $0 | $10 | $25 | $10 | $6 |
| Multimodal | |||||
| Offene Gewichte | |||||
| Kostenlos nutzbar |
Zusammengesetzte Punktzahl aus Benchmarks zu Schlussfolgerungen, Wissen und Mathematik (höher ist besser).
Richtungsweisende Punktzahl für agentisches Programmieren — reale Aufgaben mit mehreren Dateien und Tools (höher ist besser).
Maximale Anzahl an Token, die das Modell in einer einzelnen Unterhaltung berücksichtigen kann.
Größte Antwort, die das Modell in einem Aufruf erzeugt.
Mediane Ausgabegeschwindigkeit in Token pro Sekunde (höher ist schneller).
Listenpreis pro Million Ausgabetoken (niedriger ist günstiger).
Unterstützt Bildeingaben zusammen mit Text.
Gewichte können heruntergeladen und selbst gehostet werden.
Derzeit kostenlos nutzbar.
Direktvergleich
Möchtest du einen fokussierten Einzelvergleich? Wähle ein Duell.
Methodik
Der Intelligence Index ist ein zusammengesetzter Wert aus öffentlichen Benchmarks für logisches Denken, Wissen und Mathematik, im Geist des Artificial Analysis Intelligence Index. Agentisches Programmieren bildet praxisnahe Aufgaben mit mehreren Dateien ab, die mit Tools statt anhand isolierter Codeausschnitte ausgeführt werden.
Kontextfenster, maximale Ausgabe, Durchsatz und Preisangaben stammen von den Anbietern. Der Preis ist der Listenpreis pro einer Million Ausgabetoken; Eingabetoken sind in der Regel günstiger und werden weggelassen, damit die Tabelle übersichtlich bleibt.
ChatGPT-6 befindet sich in einer frühen Zugriffsvorschau. Daher sind seine mit * gekennzeichneten Werte von der Community gemeldete Schätzungen und kein Datenblatt des Anbieters. Sie werden sich ändern, während das Modell weiter abgestimmt wird – wir aktualisieren diese Seite, sobald bessere Daten verfügbar sind.
Die Zahlen ändern sich in diesem Bereich schnell. Nutze dies als Orientierungshilfe bei der Auswahl eines Modells, nicht als maßgebliche Benchmark-Rangliste. Im Zweifel solltest du deine eigene Evaluierung mit deinen eigenen Prompts durchführen.
Überzeuge dich selbst
Zahlen sind das eine. Gib ChatGPT-6 eine echte Aufgabe und beurteile die Ausgabe.