Unterstützt vonAnzeige
Der niedrigste Tokenpreis führt nicht automatisch zur günstigsten erledigten Aufgabe. Genau das würde ich zuerst prüfen, wenn ich ein KI-Modell für einen Unternehmensagenten auswähle.
Dieser KI-Modellvergleich für 2026 betrachtet GPT-6, aktuelle Claude-Modelle, Gemini und eine europäische Open-Weight-Option. Ich vergleiche veröffentlichte API-Preise, erkläre die zusätzlichen Kosten und zeige, wie ich EU-Hosting-Anforderungen prüfen würde. Das Ergebnis ist eine Auswahl für einen Test, keine Rangliste mit einem universellen Sieger.
Aktualisiert am 28. September 2026. Die Preistabelle ersetzt den Juni-Stand. Es sind direkte Standard-API-Preise der Anbieter in US-Dollar pro Million Tokens, keine ChatGPT-, Claude- oder Microsoft-365-Abonnements. Für dieses Update habe ich keinen eigenen neuen Modellbenchmark durchgeführt. Die ursprünglichen Juni-Grafiken bleiben unten als klar gekennzeichnetes historisches Material erhalten.
Inhaltsverzeichnis
Welche KI-Modelle würde ich aktuell vergleichen?
Für einen neuen Anwendungsfall würde ich einen günstigen und einen leistungsfähigeren Kandidaten mit derselben Aufgabe, denselben Tools und denselben Abnahmekriterien prüfen. Ein selbst betriebenes Modell kommt hinzu, wenn die betrieblichen Anforderungen das rechtfertigen.
| Ausgangspunkt | Kandidaten für einen Test | Meine erste Prüffrage |
|---|---|---|
| Schwieriges Reasoning oder lange Agentenaufgaben | GPT-6 Astra, Claude Fable 5.1 | Senkt der Mehrpreis Fehler und manuelle Nacharbeit? |
| Coding und alltägliche Agentenaufgaben | GPT-6 Sol, Claude Opus 5.5, Claude Sonnet 5 | Stimmen Änderungen, Tests, Laufzeit und Tool-Nutzung? |
| Viele eng definierte Aufgaben | GPT-6 Luna, Gemini 3.8 Flash, Claude Haiku 4.5 | Wie hoch sind Fehlerquote und Eskalationskosten? |
| Open-Weight-Betrieb unter eigener Kontrolle | Mistral Large 3 | Welche Hardware, Wartung und Lizenzbedingungen sind nötig? |
Das sind Startpunkte für eine Evaluation, keine gemessenen Platzierungen. Die aktuellen Kataloge unterscheiden die GPT-6-Familie sowie Fable, Opus, Sonnet und Haiku bei Claude. Verfügbarkeit in der direkten API bedeutet nicht, dass ein Modell auch in deiner Foundry-Region und im benötigten Deployment-Typ bereitsteht. OpenAI-Modellkatalog, Claude-Modellkatalog.
In Microsoft Foundry würde ich den Katalog im tatsächlichen Abonnement prüfen, bevor ich eine Architektur an einen Modellnamen binde. Modell, Region, Kontingent und Verarbeitungsgrenze müssen zusammenpassen. Den nächsten Schritt zeige ich im Foundry-Deployment-Guide.
API-Preise der KI-Modelle: September 2026
Die Tabelle trennt nicht gecachten Input und Output. Steuern, Tools, Suche, Speicher, Cache-Schreibvorgänge und Hosting sind nicht enthalten. Für OpenAI gelten die Standard-Preise im kurzen Kontextbereich. Lies für große Kontexte die vollständigen Preisregeln.
| Modell | Input / 1 Mio. Tokens | Output / 1 Mio. Tokens | Wichtige Einschränkung |
|---|---|---|---|
| GPT-6 Astra | $10,00 | $50,00 | Standard, kurzer Kontextbereich |
| GPT-6 Sol | $2,00 | $10,00 | Standard, kurzer Kontextbereich |
| GPT-6 Luna | $0,10 | $0,50 | Standard, kurzer Kontextbereich |
| Claude Fable 5.1 | $10,00 | $50,00 | Basis-API-Preis, nicht Fast Mode |
| Claude Opus 5.5 | $4,00 | $20,00 | Basis-API-Preis, nicht Fast Mode |
| Claude Sonnet 5 | $2,00 | $10,00 | Basis-API-Preis |
| Claude Haiku 4.5 | $1,00 | $5,00 | Basis-API-Preis |
| Gemini 3.8 Flash | $0,75 | $3,75 | Standard-Aktionspreis bis 31. Dezember 2026 |
| Mistral Large 3 | $0,50 | $1,50 | Gehostete API, nicht die Kosten des Eigenbetriebs |
Für dieses Update geprüft: OpenAI-Preise, Claude-Preise, Gemini-Preise, Mistral Large 3.
Google nennt für Gemini 3.8 Flash ab dem 1. Januar 2027 Standard-Preise von $1,50 für Input und $7,50 für Output. Einen Business Case für ein ganzes Jahr würde ich deshalb nicht nur mit dem Aktionspreis rechnen. Auch bei anderen Anbietern ändern Verarbeitungsart und Zusatzfunktionen die Rechnung. Cloud-Marktplätze und individuelle Verträge können anders abrechnen.
Außerdem ist ein Token nicht bei jedem Modell dieselbe Textmenge. Dasselbe Dokument kann unterschiedlich viele Tokens erzeugen. Caching und Batch-Verarbeitung können Kosten senken, haben aber eigene Bedingungen für Cache-Schreibvorgänge, Speicher, Verfügbarkeit und Wartezeit.
Was kostet eine wirklich erledigte Aufgabe?
Ein Support-Agent liest einen Incident, prüft freigegebene Anleitungen und erstellt einen nachvollziehbaren Behebungsplan. Eine Anfrage ist dabei nicht automatisch ein erledigter Incident. Vielleicht wiederholt der Agent einen Tool-Aufruf, lädt Kontext erneut oder benötigt eine manuelle Korrektur.
Für mich ist diese Einheit hilfreicher:
Kosten pro akzeptierter Aufgabe =
(Modell + Tools + Retrieval + Infrastruktur + manuelle Prüfung)
/ Anzahl der Aufgaben, die die Abnahmekriterien erfüllen
Das folgende Beispiel ist eine Rechnung, kein Leistungstest. Annahmen: 20.000 nicht gecachte Input-Tokens und 2.000 abrechenbare Output-Tokens je Lauf, innerhalb des angegebenen Preisbereichs, ohne Zusatzkosten.
| Modell | Berechnung | Modellkosten pro Lauf |
|---|---|---|
| GPT-6 Luna | 0,02 × $0,10 + 0,002 × $0,50 | $0,003 |
| GPT-6 Sol | 0,02 × $2 + 0,002 × $10 | $0,06 |
| Claude Opus 5.5 | 0,02 × $4 + 0,002 × $20 | $0,12 |
| GPT-6 Astra oder Claude Fable 5.1 | 0,02 × $10 + 0,002 × $50 | $0,30 |
Unter diesen Annahmen kosten fünf Sol-Läufe genauso viel wie ein Astra-Lauf. Das bedeutet nicht, dass Astra einen Versuch und Sol fünf benötigt. Es zeigt nur, welche wirtschaftliche Grenze wir messen müssen. Für einen engen Klassifizierungsfall kann Luna bereits zuverlässig genug sein.
Fehlgeschlagene Läufe gehören in den Zähler. Manuelle Nacharbeit muss bei allen Kandidaten gleich bewertet werden. Sonst gewinnt das günstige Modell nur deshalb, weil die Tabelle menschliche Hilfe kostenlos behandelt.
Wie ich echte Benchmarks nutzen würde
Benchmarks helfen mir bei der Vorauswahl, nicht bei der Produktionsfreigabe. Die offizielle SWE-bench-Rangliste unterscheidet unter anderem Verified, Lite und Multilingual. Verified umfasst 500 menschlich geprüfte Aufgaben. In der Bash-Only-Ansicht werden Modelle in derselben mini-SWE-agent-Umgebung verglichen.
Eine Punktzahl gehört immer zu einer Modellversion, einem Agenten, Tools, Budget und Test. Ergebnisse verschiedener Teilbenchmarks sind nicht austauschbar. Sie beweisen auch nicht, dass ein Agent eure Berechtigungen oder internen Dokumente korrekt behandelt.
Für einen Unternehmenstest würde ich eine kleine, versionierte Sammlung echter Aufgaben verwenden:
- Einen normalen Fall mit bekanntem korrektem Ergebnis.
- Einen unklaren Fall, bei dem der Agent nachfragen soll.
- Ein veraltetes Dokument, das der aktuellen Richtlinie widerspricht.
- Einen Tool-Fehler, der keine unkontrollierte Wiederholung auslösen darf.
- Eine Aktion, zu der der Nutzer nicht berechtigt ist.
Erfasst werden akzeptierte Ergebnisse, kritische Fehler, abrechenbare Nutzung, Dauer und manuelle Änderungen. Prompts und Tools bleiben vergleichbar. Mein Foundry-Walkthrough zu Tracing und Evaluation behandelt die operative Seite. Einen Benchmarkwert sollte man nur behaupten, wenn der entsprechende Test tatsächlich gelaufen ist.
EU-Hosting: das Deployment prüfen, nicht nur den Modellnamen
Ich trenne drei Fragen: Wo werden Daten gespeichert? Wo wird die Inferenz ausgeführt? Wer kontrolliert den Dienst und seine Abhängigkeiten? Eine europäische Ortsangabe im Ressourcennamen beantwortet das nicht vollständig.
Microsoft dokumentiert unterschiedliche Verarbeitungsgrenzen für Global, Data Zone und geografiebasierte Foundry-Deployments. Global kann in anderen Azure-Regionen verarbeiten. Data Zone bleibt in der festgelegten Microsoft-Datenzone, die nicht mit einem einzelnen Land gleichzusetzen ist. Nicht jedes Modell unterstützt jeden Typ. Foundry-Deployment-Typen.
Vor einer Freigabe würde ich Folgendes dokumentieren:
- Exaktes Modell, Version, Anbieter und Deployment-Typ.
- Datenflüsse von Prompts, Antworten, Dateien, Suche und Tools.
- Aufbewahrung, Missbrauchsüberwachung, Logging und Zugriff.
- Vertrag, Unterauftragnehmer und betriebliche Verantwortung.
- Verhalten bei Failover und bei der Abkündigung eines Modells.
Eigenbetrieb gibt mehr Infrastrukturkontrolle, macht eine Anwendung aber nicht automatisch privat oder regelkonform. Ein lokales Modell kann weiterhin externe Tools aufrufen, Telemetrie senden oder sensible Inhalte protokollieren. Mistral Large 3 stellt Apache-2.0-Gewichte bereit, hat laut Modellkarte aber 675 Milliarden Parameter insgesamt. Das ist keine Zusage, dass das Modell auf eine einzelne Workstation-GPU passt. Kalkuliere die konkrete Inferenzkonfiguration, Betreuung und Kapazität.
Bei dieser Entscheidung gehören Datenschutz- und Sicherheitsverantwortliche dazu. Ein Blogvergleich kann keine pauschale Compliance-Freigabe für einen Anwendungsfall geben.
Meine praktische Empfehlung
Beginne mit dem günstigsten Kandidaten, der die fachlichen und betrieblichen Anforderungen erfüllen könnte. Vergleiche ihn mit einem stärkeren Modell. Eskaliere bei klar definierten Fehlern und begrenze Wiederholungen sowie Ausgaben.
Für Coding und Agenten würde ich GPT-6 Sol und einen aktuellen Claude-Kandidaten in den ersten Test aufnehmen. Für große Mengen eng definierter Aufgaben würde ich früh eine kleinere Option prüfen. Ist Eigenbetrieb zwingend, braucht es eine eigene Auswahl anhand der Betriebsanforderungen. Gehostete Tokenpreise beschreiben keine GPU-Gesamtkosten.
Am Ende möchte ich sagen können: Dieses Modell erledigt diese Aufgabe innerhalb dieser Datengrenze zu diesen gemessenen Kosten. Das hilft mehr als ein allgemeiner Testsieger.
Ursprüngliche Juni-Grafiken
Die folgenden Abbildungen stammen unverändert aus dem ursprünglichen Beitrag vom Juni 2026. Es sind historische redaktionelle Grafiken, keine aktuellen Preise, gemessenen Benchmarkwerte oder Compliance-Klassifizierungen. Einzelne Bezeichnungen und Annahmen sind durch dieses Update überholt. Für aktuelle Entscheidungen gelten die belegten Tabellen und Prüfschritte oben.
Ursprüngliche Juni-Grafiken anzeigen



Stay healthy, Cheers Jannik

Neue Beiträge direkt ins Postfach.
Praxisnahe Anleitungen zu Intune, KI und Azure.
190+ Anleitungen · 5x Microsoft MVP · Kein Spam, jederzeit abbestellbar · Datenschutz






