Welche KI sortiert E-Mails und Tickets am besten, auch gehostet in Deutschland oder der EU?

Kurze Antwort

Wenn es egal ist, wo das Modell gehostet wird, dann ist unser Favorit DeepSeek V4 Flash 0731. Auch in der EU gehostet bekommt ihr es, bei Azure. Muss es in Deutschland laufen, ist es GLM 5.3 Flash bei T-Systems AI Foundation Services. Das beste Entscheidungsmodell im Test ist Jev 1.13.

Unsere Favoriten

Egal wo gehostet

DeepSeek V4 Flash 0731 €

bei DeepSeek

Platz 1 im Sortier-Test DecideBench.

Alle Modelle ↓

In der EU gehostet

DeepSeek V4 Flash 0731 €

bei Azure · EU Data Zone · kein einzelnes Rechenzentrum

Bestplatziertes Modell mit Verarbeitung in der EU: Platz 1 im Sortier-Test DecideBench.

Alle Modelle in der EU ↓

In Deutschland gehostet

GLM 5.3 Flash €

bei T-Systems AI Foundation Services · Deutschland · teils EU

Bestplatziertes Modell mit Verarbeitung in Deutschland: Platz 3 im Sortier-Test DecideBench.

Alle Modelle in Deutschland ↓

Alle KI-Modelle für das Sortieren von E-Mails im Ranking

Die ersten 1 von 1 Modellen mit Verarbeitung in Deutschland.

Spitzengruppe

  1. GLM 5.3 Flash €Z.ai · Open Source
    Z.aiweltweit

Für Abonnenten von AI Peanuts

Lies weiter: das ganze Ranking und worauf es ankommt

Gib die E-Mail ein, mit der du AI Peanuts liest, oder subscribe umsonst den Newsletter.

Jeden Dienstag die wichtigsten KI-News. Abbestellen mit einem Klick.

Datenschutz

Was ihr in der EU und in Deutschland aufgebt

In der EU gebt ihr nichts auf: DeepSeek V4 Flash 0731 bei Azure ist derselbe Favorit wie weltweit. In Deutschland ist es GLM 5.3 Flash bei T-Systems AI Foundation Services, aus der Spitzengruppe.

Worauf es beim Sortieren ankommt

Sortieren klingt einfach. Ob ein Modell aber 90 oder 99 Prozent der Mails richtig einordnet, hängt oft mehr an euren Kategorien und Beispielen als am Modell. Hier zahlt sich Vorbereitung am meisten aus.

  • Kategorien aus echten Mails ableiten: Legt eure Kategorien erst fest, nachdem ihr echte Mails gelesen habt, und rechnet damit, dass sie sich dabei ändern. Die Forscherin Shreya Shankar nennt das „criteria drift“: Erst beim Einordnen merkt man, welche Kategorien man braucht.
  • Hundert echte Fälle, eine verantwortliche Person: Die KI-Forscher Hamel Husain und Shreya Shankar empfehlen, rund 100 echte Mails von Hand einzuordnen, bis keine neuen Fehlerarten mehr auftauchen. Über strittige Fälle entscheidet eine fachkundige Person, kein Gremium. Daran messt ihr dann jedes Modell.
  • Seltene, teure Fälle einzeln messen: Eine Trefferquote von 95 Prozent hilft wenig, wenn ausgerechnet Kündigungen oder Anwaltsschreiben falsch landen. Messt für jede Kategorie einzeln, wie viele richtig erkannt und wie viele übersehen werden.
  • Ähnliche Beispiele mitgeben: Holt zu jeder neuen Mail automatisch ähnliche, schon eingeordnete Mails in die Anfrage. In Anthropics Anleitung stieg die Trefferquote dadurch von 71 auf 93 Prozent. Das hier ist ein typischer Fehler: Das Modell reagiert auf den Wutausbruch in der Mail statt auf das Anliegen, oder eine Mail enthält mehrere Anliegen und das Modell antwortet nur auf eines davon.
  • Der Selbsteinschätzung nicht trauen: Sagt ein Modell, es sei sich „zu 95 Prozent sicher“, ist das meist zu optimistisch. Lasst stattdessen dieselbe Mail mehrmals einordnen und gebt sie bei unterschiedlichen Ergebnissen an einen Menschen.
  • Vorsicht bei „Prompt Injections“: Wer euch schreibt, kann in der Mail Anweisungen an eure KI verstecken. Ein Sortier-Bot sollte deshalb nur einordnen und nicht zugleich interne Daten lesen und Mails verschicken dürfen. Bei Microsoft 365 Copilot reichte 2025 eine präparierte Mail, um ein Datenleck zu verursachen.

Häufige Fragen

01 Was ist ein Entscheidungsmodell?

Ein KI-Modell, das keinen Text schreibt, sondern auf eine feste Frage mit ja/nein, einer Kategorie oder einem Wert antwortet. Das ist schneller und günstiger als ein normales Sprachmodell. Den Anfang machte TypeSafe im September 2026 mit Jev. Seitdem ziehen andere nach, darunter OpenAI, Cloudflare und Perplexity.

02 Kann ich ein Entscheidungsmodell in Deutschland betreiben?

Bei einem Anbieter in Deutschland oder der EU bisher nicht. Die offenen Modelle Clef, Clef Flash und Kev könnt ihr aber auf eigenen Servern betreiben, auch in einem deutschen Rechenzentrum.

03 Reicht nicht ein normales Sprachmodell?

Oft ja. Im unabhängigen Test DecideBench liegen günstige Sprachmodelle sogar knapp vor den Entscheidungsmodellen, kosten dort aber ein Vielfaches. Entscheidungsmodelle (wie Jev von TypeSafe) lohnen sich vor allem bei großen Datenmengen und wenn Preis, Tempo und ein festes Antwortformat zählen.

04 Wie oft ändern sich eure Favoriten?

Wir prüfen jeden Montag. Ändert sich ein Favorit, steht das mit Datum oben auf dieser Seite.

Weiterlesen

Jeden Dienstag · Auf Deutsch · Kostenlos

Ab nächstem Dienstag schlauer.

Wir erklären die wichtigsten Neuigkeiten, recherchieren die Hintergründe und stellen Tools für deinen Alltag vor.

AI Peanuts · Kontakt

Schreib uns.

Fragen, Feedback oder eine Idee? Wir freuen uns auf deine Nachricht.

E-Mail schreiben