AI Models in 2026: What I Would Actually Pick - Jannik Reinhard

KI-Modelle 2026: Preise, Aufgabenkosten und EU-Hosting

Unterstützt vonAnzeige

Admin By Request
Admin By Request
Patch My PC App Catalog Sponsor
Patch My PC
Recast Software Compliance Efficiency Sponsor
Recast Software

Der niedrigste Tokenpreis führt nicht automatisch zur günstigsten erledigten Aufgabe. Genau das würde ich zuerst prüfen, wenn ich ein KI-Modell für einen Unternehmensagenten auswähle.

Dieser KI-Modellvergleich für 2026 betrachtet GPT-6, aktuelle Claude-Modelle, Gemini und eine europäische Open-Weight-Option. Ich vergleiche veröffentlichte API-Preise, erkläre die zusätzlichen Kosten und zeige, wie ich EU-Hosting-Anforderungen prüfen würde. Das Ergebnis ist eine Auswahl für einen Test, keine Rangliste mit einem universellen Sieger.

Aktualisiert am 28. September 2026. Die Preistabelle ersetzt den Juni-Stand. Es sind direkte Standard-API-Preise der Anbieter in US-Dollar pro Million Tokens, keine ChatGPT-, Claude- oder Microsoft-365-Abonnements. Für dieses Update habe ich keinen eigenen neuen Modellbenchmark durchgeführt. Die ursprünglichen Juni-Grafiken bleiben unten als klar gekennzeichnetes historisches Material erhalten.

Welche KI-Modelle würde ich aktuell vergleichen?

Für einen neuen Anwendungsfall würde ich einen günstigen und einen leistungsfähigeren Kandidaten mit derselben Aufgabe, denselben Tools und denselben Abnahmekriterien prüfen. Ein selbst betriebenes Modell kommt hinzu, wenn die betrieblichen Anforderungen das rechtfertigen.

Ausgangspunkt Kandidaten für einen Test Meine erste Prüffrage
Schwieriges Reasoning oder lange Agentenaufgaben GPT-6 Astra, Claude Fable 5.1 Senkt der Mehrpreis Fehler und manuelle Nacharbeit?
Coding und alltägliche Agentenaufgaben GPT-6 Sol, Claude Opus 5.5, Claude Sonnet 5 Stimmen Änderungen, Tests, Laufzeit und Tool-Nutzung?
Viele eng definierte Aufgaben GPT-6 Luna, Gemini 3.8 Flash, Claude Haiku 4.5 Wie hoch sind Fehlerquote und Eskalationskosten?
Open-Weight-Betrieb unter eigener Kontrolle Mistral Large 3 Welche Hardware, Wartung und Lizenzbedingungen sind nötig?

Das sind Startpunkte für eine Evaluation, keine gemessenen Platzierungen. Die aktuellen Kataloge unterscheiden die GPT-6-Familie sowie Fable, Opus, Sonnet und Haiku bei Claude. Verfügbarkeit in der direkten API bedeutet nicht, dass ein Modell auch in deiner Foundry-Region und im benötigten Deployment-Typ bereitsteht. OpenAI-Modellkatalog, Claude-Modellkatalog.

In Microsoft Foundry würde ich den Katalog im tatsächlichen Abonnement prüfen, bevor ich eine Architektur an einen Modellnamen binde. Modell, Region, Kontingent und Verarbeitungsgrenze müssen zusammenpassen. Den nächsten Schritt zeige ich im Foundry-Deployment-Guide.

API-Preise der KI-Modelle: September 2026

Die Tabelle trennt nicht gecachten Input und Output. Steuern, Tools, Suche, Speicher, Cache-Schreibvorgänge und Hosting sind nicht enthalten. Für OpenAI gelten die Standard-Preise im kurzen Kontextbereich. Lies für große Kontexte die vollständigen Preisregeln.

Modell Input / 1 Mio. Tokens Output / 1 Mio. Tokens Wichtige Einschränkung
GPT-6 Astra $10,00 $50,00 Standard, kurzer Kontextbereich
GPT-6 Sol $2,00 $10,00 Standard, kurzer Kontextbereich
GPT-6 Luna $0,10 $0,50 Standard, kurzer Kontextbereich
Claude Fable 5.1 $10,00 $50,00 Basis-API-Preis, nicht Fast Mode
Claude Opus 5.5 $4,00 $20,00 Basis-API-Preis, nicht Fast Mode
Claude Sonnet 5 $2,00 $10,00 Basis-API-Preis
Claude Haiku 4.5 $1,00 $5,00 Basis-API-Preis
Gemini 3.8 Flash $0,75 $3,75 Standard-Aktionspreis bis 31. Dezember 2026
Mistral Large 3 $0,50 $1,50 Gehostete API, nicht die Kosten des Eigenbetriebs

Für dieses Update geprüft: OpenAI-Preise, Claude-Preise, Gemini-Preise, Mistral Large 3.

Google nennt für Gemini 3.8 Flash ab dem 1. Januar 2027 Standard-Preise von $1,50 für Input und $7,50 für Output. Einen Business Case für ein ganzes Jahr würde ich deshalb nicht nur mit dem Aktionspreis rechnen. Auch bei anderen Anbietern ändern Verarbeitungsart und Zusatzfunktionen die Rechnung. Cloud-Marktplätze und individuelle Verträge können anders abrechnen.

Außerdem ist ein Token nicht bei jedem Modell dieselbe Textmenge. Dasselbe Dokument kann unterschiedlich viele Tokens erzeugen. Caching und Batch-Verarbeitung können Kosten senken, haben aber eigene Bedingungen für Cache-Schreibvorgänge, Speicher, Verfügbarkeit und Wartezeit.

Was kostet eine wirklich erledigte Aufgabe?

Ein Support-Agent liest einen Incident, prüft freigegebene Anleitungen und erstellt einen nachvollziehbaren Behebungsplan. Eine Anfrage ist dabei nicht automatisch ein erledigter Incident. Vielleicht wiederholt der Agent einen Tool-Aufruf, lädt Kontext erneut oder benötigt eine manuelle Korrektur.

Für mich ist diese Einheit hilfreicher:

Kosten pro akzeptierter Aufgabe =
  (Modell + Tools + Retrieval + Infrastruktur + manuelle Prüfung)
  / Anzahl der Aufgaben, die die Abnahmekriterien erfüllen

Das folgende Beispiel ist eine Rechnung, kein Leistungstest. Annahmen: 20.000 nicht gecachte Input-Tokens und 2.000 abrechenbare Output-Tokens je Lauf, innerhalb des angegebenen Preisbereichs, ohne Zusatzkosten.

Modell Berechnung Modellkosten pro Lauf
GPT-6 Luna 0,02 × $0,10 + 0,002 × $0,50 $0,003
GPT-6 Sol 0,02 × $2 + 0,002 × $10 $0,06
Claude Opus 5.5 0,02 × $4 + 0,002 × $20 $0,12
GPT-6 Astra oder Claude Fable 5.1 0,02 × $10 + 0,002 × $50 $0,30

Unter diesen Annahmen kosten fünf Sol-Läufe genauso viel wie ein Astra-Lauf. Das bedeutet nicht, dass Astra einen Versuch und Sol fünf benötigt. Es zeigt nur, welche wirtschaftliche Grenze wir messen müssen. Für einen engen Klassifizierungsfall kann Luna bereits zuverlässig genug sein.

Fehlgeschlagene Läufe gehören in den Zähler. Manuelle Nacharbeit muss bei allen Kandidaten gleich bewertet werden. Sonst gewinnt das günstige Modell nur deshalb, weil die Tabelle menschliche Hilfe kostenlos behandelt.

Wie ich echte Benchmarks nutzen würde

Benchmarks helfen mir bei der Vorauswahl, nicht bei der Produktionsfreigabe. Die offizielle SWE-bench-Rangliste unterscheidet unter anderem Verified, Lite und Multilingual. Verified umfasst 500 menschlich geprüfte Aufgaben. In der Bash-Only-Ansicht werden Modelle in derselben mini-SWE-agent-Umgebung verglichen.

Eine Punktzahl gehört immer zu einer Modellversion, einem Agenten, Tools, Budget und Test. Ergebnisse verschiedener Teilbenchmarks sind nicht austauschbar. Sie beweisen auch nicht, dass ein Agent eure Berechtigungen oder internen Dokumente korrekt behandelt.

Für einen Unternehmenstest würde ich eine kleine, versionierte Sammlung echter Aufgaben verwenden:

  1. Einen normalen Fall mit bekanntem korrektem Ergebnis.
  2. Einen unklaren Fall, bei dem der Agent nachfragen soll.
  3. Ein veraltetes Dokument, das der aktuellen Richtlinie widerspricht.
  4. Einen Tool-Fehler, der keine unkontrollierte Wiederholung auslösen darf.
  5. Eine Aktion, zu der der Nutzer nicht berechtigt ist.

Erfasst werden akzeptierte Ergebnisse, kritische Fehler, abrechenbare Nutzung, Dauer und manuelle Änderungen. Prompts und Tools bleiben vergleichbar. Mein Foundry-Walkthrough zu Tracing und Evaluation behandelt die operative Seite. Einen Benchmarkwert sollte man nur behaupten, wenn der entsprechende Test tatsächlich gelaufen ist.

EU-Hosting: das Deployment prüfen, nicht nur den Modellnamen

Ich trenne drei Fragen: Wo werden Daten gespeichert? Wo wird die Inferenz ausgeführt? Wer kontrolliert den Dienst und seine Abhängigkeiten? Eine europäische Ortsangabe im Ressourcennamen beantwortet das nicht vollständig.

Microsoft dokumentiert unterschiedliche Verarbeitungsgrenzen für Global, Data Zone und geografiebasierte Foundry-Deployments. Global kann in anderen Azure-Regionen verarbeiten. Data Zone bleibt in der festgelegten Microsoft-Datenzone, die nicht mit einem einzelnen Land gleichzusetzen ist. Nicht jedes Modell unterstützt jeden Typ. Foundry-Deployment-Typen.

Vor einer Freigabe würde ich Folgendes dokumentieren:

  • Exaktes Modell, Version, Anbieter und Deployment-Typ.
  • Datenflüsse von Prompts, Antworten, Dateien, Suche und Tools.
  • Aufbewahrung, Missbrauchsüberwachung, Logging und Zugriff.
  • Vertrag, Unterauftragnehmer und betriebliche Verantwortung.
  • Verhalten bei Failover und bei der Abkündigung eines Modells.

Eigenbetrieb gibt mehr Infrastrukturkontrolle, macht eine Anwendung aber nicht automatisch privat oder regelkonform. Ein lokales Modell kann weiterhin externe Tools aufrufen, Telemetrie senden oder sensible Inhalte protokollieren. Mistral Large 3 stellt Apache-2.0-Gewichte bereit, hat laut Modellkarte aber 675 Milliarden Parameter insgesamt. Das ist keine Zusage, dass das Modell auf eine einzelne Workstation-GPU passt. Kalkuliere die konkrete Inferenzkonfiguration, Betreuung und Kapazität.

Bei dieser Entscheidung gehören Datenschutz- und Sicherheitsverantwortliche dazu. Ein Blogvergleich kann keine pauschale Compliance-Freigabe für einen Anwendungsfall geben.

Meine praktische Empfehlung

Beginne mit dem günstigsten Kandidaten, der die fachlichen und betrieblichen Anforderungen erfüllen könnte. Vergleiche ihn mit einem stärkeren Modell. Eskaliere bei klar definierten Fehlern und begrenze Wiederholungen sowie Ausgaben.

Für Coding und Agenten würde ich GPT-6 Sol und einen aktuellen Claude-Kandidaten in den ersten Test aufnehmen. Für große Mengen eng definierter Aufgaben würde ich früh eine kleinere Option prüfen. Ist Eigenbetrieb zwingend, braucht es eine eigene Auswahl anhand der Betriebsanforderungen. Gehostete Tokenpreise beschreiben keine GPU-Gesamtkosten.

Am Ende möchte ich sagen können: Dieses Modell erledigt diese Aufgabe innerhalb dieser Datengrenze zu diesen gemessenen Kosten. Das hilft mehr als ein allgemeiner Testsieger.

Ursprüngliche Juni-Grafiken

Die folgenden Abbildungen stammen unverändert aus dem ursprünglichen Beitrag vom Juni 2026. Es sind historische redaktionelle Grafiken, keine aktuellen Preise, gemessenen Benchmarkwerte oder Compliance-Klassifizierungen. Einzelne Bezeichnungen und Annahmen sind durch dieses Update überholt. Für aktuelle Entscheidungen gelten die belegten Tabellen und Prüfschritte oben.

Ursprüngliche Juni-Grafiken anzeigen
Preis im Vergleich zur Leistungsfähigkeit der führenden KI-Modelle im Juni 2026
Output-Preis pro eine Million Tokens über die neuesten KI-Modelle von 2026
Datensouveränität im Vergleich zur Leistungsfähigkeit von KI-Modellen für europäische Unternehmen 2026

Stay healthy, Cheers Jannik

ALL-ABR — Beispiel-Screenshot für den Microsoft-365-Agents-Beitrag
Newsletter

Neue Beiträge direkt ins Postfach.

Praxisnahe Anleitungen zu Intune, KI und Azure.

190+ Anleitungen · 5x Microsoft MVP · Kein Spam, jederzeit abbestellbar · Datenschutz

Porträt von Jannik Reinhard

Über den Autor

Jannik Reinhard

Head of AI @ Epic Fusion · 5x Microsoft MVP

Ich helfe Unternehmen, sichere KI-Agenten in Produktion zu bringen. Ich bin Head of AI bei Epic Fusion und 5x Microsoft MVP für AI Platform und Security. Ich schreibe über Microsoft Foundry, Intune und Azure und veröffentliche die Implementierungsdetails, damit dein Team es ohne mich umsetzen kann.