So entsteht der Modellkompass
Methode, Definitionen und Quellen. Zuletzt geprüft am 8. Oktober 2026.
Wie wir auswählen
Wir nutzen nur unabhängige Tests, die wir öffentlich zeigen dürfen, keine Herstellerzahlen. Pro Aufgabe zählt ein Haupttest, ein zweiter verfeinert die Reihenfolge. Je Test zählt der Platz, nicht der Rohwert; daraus bilden wir den Durchschnitt. Ältere Versionen einer Modellfamilie blenden wir aus, wenn die neuere überall dort buchbar ist, wo die ältere es war.
Wir zeigen Gruppen statt Plätze: 5 „Spitzengruppe“, 3 „Sehr gut“, 2 „Gut“, alle weiteren „Für leichte Aufgaben“. Favorit ist das bestplatzierte Modell, das es im jeweiligen Gebiet bei einem Anbieter gibt. Jeden Montag prüfen wir neu.
- Programmieren: Arena WebDev, FrontierCode (Epoch)
- Schreiben: Arena Text, Schreiben, Arena Text, Deutsch
- Agenten: Arena Agent, APEX-Agents (Epoch)
- Recherche: Arena Search, SimpleQA (Epoch)
- Dokumente & Daten: Arena Document, Arena Texterkennung
- Sprache & Audio: Open ASR Leaderboard, Deutsch (Hugging Face)
- Bilder: Arena Bilder
- Video: Arena Video
- Sortieren & Entscheiden: DecideBench
- Texterkennung (OCR): MDPBench, deutsche Seiten
Weltweit, EU und Deutschland
- Weltweit: Weltweit heißt: Es ist egal, wo das Modell gehostet wird. Das ist der Vergleichsmaßstab. Wo die Daten dann verarbeitet werden, legt der Anbieter fest.
- EU: Nur Angebote mit belegter Verarbeitung in der EU. Ein deutscher Anbieter kann hier gewinnen, wenn sein Angebot das stärkste ist.
- Deutschland: Nur Angebote mit belegter Verarbeitung in Deutschland. Hier siehst du, was du gegenüber EU und weltweit aufgibst.
Gemeint ist immer der Ort der Verarbeitung, nicht der Firmensitz. Ein Standort allein beantwortet nicht jede Datenschutzfrage. Bei jedem Anbieter zeigen wir deshalb auch Speicherung, Betreiber, Training und nötige Einstellungen.
Quellen und Lizenzen
- Preisseiten der Hersteller (Abos) · abgerufen am 8. Oktober 2026
- Arena, Datensatz bei Hugging Face · abgerufen am 8. Oktober 2026 · Lizenz CC BY 4.0 · Arena (arena.ai)
- DecideBench · abgerufen am 8. Oktober 2026 · Lizenz MIT
- Regionen fertiger KI-Dienste (Seiten der Anbieter) · abgerufen am 8. Oktober 2026
- Epoch AI Benchmarking Hub · abgerufen am 8. Oktober 2026 · Lizenz CC BY 4.0 · Epoch AI
- Hugging Face, Modellkarten · abgerufen am 8. Oktober 2026
- AWS Bedrock, Modelle je Region · abgerufen am 8. Oktober 2026
- Azure Foundry, Standard-Bereitstellungen je Region · abgerufen am 8. Oktober 2026 · Lizenz CC BY 4.0
- Azure Foundry, Marketplace-Modelle je Region · abgerufen am 8. Oktober 2026 · Lizenz CC BY 4.0
- Google Vertex AI, Datenresidenz je Modell · abgerufen am 8. Oktober 2026 · Lizenz CC BY 4.0
- IONOS AI Model Hub, Modellvergleich · abgerufen am 8. Oktober 2026
- IONOS AI Model Hub, Abkündigungen · abgerufen am 8. Oktober 2026
- OVHcloud AI Endpoints, Katalog · abgerufen am 8. Oktober 2026
- Scaleway Generative APIs, Produktkatalog · abgerufen am 8. Oktober 2026
- STACKIT AI Model Serving, verfügbare Modelle · abgerufen am 8. Oktober 2026
- STACKIT AI Model Serving, Release Notes (Abkündigungen) · abgerufen am 8. Oktober 2026
- T-Systems AI Foundation Services, Modelle · abgerufen am 8. Oktober 2026
- MDPBench (Texterkennung in 17 Sprachen) · abgerufen am 8. Oktober 2026 · Lizenz MIT
- OpenRouter, Nutzung je Aufgabe · abgerufen am 8. Oktober 2026 · Lizenz CC BY 4.0 · Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-08
- OpenRouter, Modelle mit EU-Verarbeitung · abgerufen am 8. Oktober 2026
- OpenRouter, EU-Anbieter je Modell · abgerufen am 8. Oktober 2026
- OpenRouter Modellliste · abgerufen am 8. Oktober 2026
- τ-Bench von Sierra · abgerufen am 8. Oktober 2026 · Lizenz MIT
- Open ASR Leaderboard, Deutsch (Hugging Face) · Stand 5. Oktober 2026, von Hand übernommen für Sprache & Audio
- τ³-Voice (Sierra) · Stand 9. September 2026, von Hand übernommen für Sprache & Audio
Jeder Abruf wird unverändert archiviert, mit Zeitpunkt und Fingerabdruck. So lässt sich jede Angabe auf dieser Seite bis zur Quelle zurückverfolgen.
Jede Woche neu geprüft
Jeden Montag holen wir alle Quellen neu ab. Ein Wochenbericht zeigt uns, wenn eine Quelle nicht erreichbar war, seit mehr als 45 Tagen nicht aktualisiert wurde, ein neues Modell noch ungetestet ist oder ein fertiger Dienst aus einer Region verschwunden ist. Erst nach unserer Freigabe ändert sich diese Seite. Diese Tests tragen die einzelnen Aufgaben:
- Programmieren: Arena WebDev (Stand 6. Oktober 2026), FrontierCode (Epoch) (Stand 8. Oktober 2026)
- Schreiben: Arena Text, Schreiben (Stand 2. Oktober 2026), Arena Text, Deutsch (Stand 2. Oktober 2026)
- Agenten: Arena Agent (Stand 2. Oktober 2026), APEX-Agents (Epoch) (Stand 8. Oktober 2026)
- Recherche: Arena Search (Stand 24. August 2026), SimpleQA (Epoch) (Stand 8. Oktober 2026)
- Dokumente & Daten: Arena Document (Stand 13. September 2026), Arena Texterkennung (Stand 2. Oktober 2026)
- Sprache & Audio: Open ASR Leaderboard, Deutsch (Hugging Face) (Stand 5. Oktober 2026)
- Bilder: Arena Bilder (Stand 7. Oktober 2026)
- Video: Arena Video (Stand 22. September 2026)
- Sortieren & Entscheiden: DecideBench (Stand 5. Oktober 2026)
- Texterkennung (OCR): MDPBench, deutsche Seiten (Stand 16. August 2026) . Fertige Dienste: wöchentliche Prüfung der Region auf der Seite des Anbieters
Neue Modelle und Aktualität
Als Releases zeigen wir die neuesten Modelle bekannter Labore. Das Datum ist der Tag, an dem OpenRouter das Modell aufgenommen hat; meist ist das der Tag der Veröffentlichung. Modelle, die OpenRouter nicht führt, tragen wir von Hand ein.
Tests hinken neuen Modellen oft hinterher. Fehlt eine neuere Version in den Tests einer Aufgabe, steht sie in der Rangliste unter „Noch nicht bewertet“, und beim Favoriten steht ein Hinweis.
Welche Modelle genutzt werden
Die Flächen zur Nutzung stammen von OpenRouter, einem Marktplatz, über den Firmen und Entwickler viele KI-Modelle nutzen. OpenRouter ordnet eine Stichprobe der Anfragen der letzten sieben Tage Aufgaben zu, etwa „Übersetzen“ oder „Code schreiben“, und nennt, welcher Anteil an welches Modell ging. Wir holen diese Daten jeden Montag über die offizielle Daten-Schnittstelle ab (Lizenz CC BY 4.0). Beliebt heißt nicht gut: Günstige Modelle liegen vorne, weil sie große Mengen einfacher Aufgaben erledigen. Unsere Favoriten richten sich deshalb nur nach unabhängigen Tests.
Wie wir Preis und Leistung vergleichen
Jeder Bereich hat sein eigenes Maß, deshalb vergleichen wir sie getrennt. Gezeigt werden nur buchbare Modelle, für die es nichts spürbar Besseres zum gleichen oder niedrigeren Preis gibt. Unterschiede unter 0,5 Prozent zählen als Messrauschen. Der Preis ist ein Mischpreis aus 3 Teilen Eingabe und 1 Teil Ausgabe.
- Chat: Leistung nach Wertung in der Arena Text, Stand 02.10.2026, Preis als Mischpreis je 1 Mio. Tokens, laut OpenRouter (logarithmische Achse).
- Programmieren: Leistung nach Wertung in der Arena WebDev, Stand 06.10.2026, Preis als Mischpreis je 1 Mio. Tokens, laut OpenRouter (logarithmische Achse).
- Schreiben: Leistung nach Wertung in der Arena Text, Schreiben, Stand 02.10.2026, Preis als Mischpreis je 1 Mio. Tokens, laut OpenRouter (logarithmische Achse).
- Agenten: Leistung nach Wertung in der Arena Agent, Stand 02.10.2026, Preis als Mischpreis je 1 Mio. Tokens, laut OpenRouter (logarithmische Achse).
- Recherche: Leistung nach Wertung in der Arena Search, Stand 24.08.2026, Preis als Mischpreis je 1 Mio. Tokens, laut OpenRouter (logarithmische Achse).
- Dokumente: Leistung nach Wertung in der Arena Document, Stand 13.09.2026, Preis als Mischpreis je 1 Mio. Tokens, laut OpenRouter (logarithmische Achse).
- Entscheiden: Leistung nach Wertung in der DecideBench, Stand 05.10.2026, Preis als Mischpreis je 1 Mio. Tokens, laut OpenRouter (logarithmische Achse).
Anbieter und Quellen
- Scaleway · Paris · Serverless · geprüft: 24. September 2026
- STACKIT · Germany South · Deutschland · geprüft: 24. September 2026
- IONOS · Deutsche Rechenzentren · geprüft: 24. September 2026
- Azure · EU Data Zone · kein einzelnes Rechenzentrum · geprüft: 24. September 2026
- Mistral · EU-Endpunkt · EU/EFTA · geprüft: 8. Oktober 2026
- AWS Bedrock · EU-Profil ab Frankfurt · 6 EU-Regionen · geprüft: 8. Oktober 2026
- Google Vertex AI · Frankfurt · EU-weite Option · geprüft: 7. Oktober 2026
- OVHcloud AI Endpoints · Gravelines · Frankreich · geprüft: 7. Oktober 2026
- T-Systems AI Foundation Services · Deutschland · teils EU · geprüft: 7. Oktober 2026
- Anthropic API · USA und weitere Regionen · geprüft: noch offen
- OpenAI API · USA und weitere Regionen · geprüft: noch offen
- Google Gemini API · USA und weitere Regionen · geprüft: noch offen
- TypeSafe API · USA und weitere Regionen · geprüft: noch offen
