Viele Unternehmen bauen derzeit ihre ersten KI-Agenten. Die meisten testen den Agenten, indem sie im Playground ein paar Mal mit ihm chatten und es dann als erledigt bezeichnen. In diesem Blogbeitrag erkläre ich, wie man KI-Agenten in Microsoft Foundry (ehemals Azure AI Foundry) strukturiert evaluiert. Am Ende können Sie eine Evaluation für einen Testdatensatz im Portal oder mit dem SDK ausführen, die Ergebnisse lesen und eine kontinuierliche Evaluation für die Produktion einrichten.
Table of contents
Warum sollte ich KI-Agenten überhaupt bewerten?
Ein Agent, der im Playground „in Ordnung zu sein scheint“, kann in der Produktion immer noch fehlschlagen. Der Grund ist einfach. Ein Agent ist keine einzelne Antwort. Es handelt sich um eine Kette von Schritten: die Absicht verstehen, ein Tool auswählen, das Tool mit den richtigen Parametern aufrufen, das Tool-Ergebnis verwenden und die endgültige Antwort schreiben. Jeder Schritt kann schief gehen. Wenn ich manuell teste, sehe ich nur fünf oder zehn Happy-Path-Gespräche. Echte Benutzer senden Hunderte von chaotischen Fragen.
Evaluation behebt dieses Problem. Um KI-Agenten in Foundry zu bewerten, führen Sie sie mit einem Testdatensatz aus und lassen Evaluatoren jede Antwort bewerten. Die Evaluatoren funktionieren wie Unit-Tests für Ihren Agenten. Sie geben pro Testfall „Bestanden“ oder „Nicht bestanden“ zurück. Damit erhalten Sie eine Baseline und können ein Release-Gate definieren, zum Beispiel „85 % Task Adherence oder wir veröffentlichen nicht“. Sie können auch zwei Agentenversionen vergleichen und sehen, ob Ihre Prompt-Änderung zu einer Verbesserung oder Verschlechterung geführt hat.
Agenten waren das große Thema bei Microsoft Build 2026. Ich habe über den gesamten Agentenstapel in meiner Build-Zusammenfassung geschrieben. Evaluation ist der Teil dieses Stacks, der aus einer schönen Demo etwas macht, das Sie mit Zuversicht versenden können.
Welches Evaluators bietet Foundry an?
Foundry bringt eine Reihe integrierter Evaluators mit, um KI-Agenten aus verschiedenen Blickwinkeln zu bewerten. Die meisten von ihnen verwenden ein GPT-Modell als Beurteilung und geben ein Bestehen/Nichtbestehen-Ergebnis mit einer kurzen Begründung zurück. Es gibt drei Gruppen: Agent Evaluators, Qualität Evaluators und Sicherheit Evaluators. Diese finde ich am nützlichsten:
| Evaluator | Was es überprüft | Wenn ich es benutze |
|---|---|---|
| Task Adherence | Does the agent follow its system instructions and constraints? | Fast immer. Dies ist meine Basismetrik. |
| Intent Resolution | Hat der Agent richtig verstanden, was der Benutzer will? | Support- und Gesprächsagenten. |
| Aufgabenerledigung | Hat der Agent die Aufgabe vollständig mit einem brauchbaren Ergebnis abgeschlossen? | Zielorientierte Arbeitsabläufe und Automatisierung. |
| Tool Call Genauigkeit | Hat der Agent den richtigen Tools mit den richtigen Parametern aufgerufen? | Jeder Agent, der Tools oder APIs verwendet. |
| Groundedness | Wird die Antwort durch den bereitgestellten Kontext gestützt? | RAG-Agenten, um Halluzinationen einzufangen. |
| Relevanz | Geht die Antwort tatsächlich auf die Frage ein? | RAG- und Q&A-Szenarien. |
| Sicherheit Evaluators (Gewalt, Sexuell, Selbstverletzung, Hass/Ungerechtigkeit) | Enthält die Antwort schädliche Inhalte? | Vor jeder benutzerorientierten Veröffentlichung. |
Es gibt noch mehr, zum Beispiel Tool-Auswahl, Tool-Eingabegenauigkeit, Tool Call-Erfolg und Kundenzufriedenheit. Die vollständige Liste finden Sie in der integrierten Evaluators-Referenz.
Hinweis: Der KI-gestützte Evaluators benötigt ein Richtermodell. Sie müssen eine GPT-Bereitstellung in Ihrem Projekt haben (z. B. gpt-4.1-mini) und deren Bereitstellungsnamen an Evaluator übergeben. Dieses Richtermodell zählt auf Ihre Azure OpenAI-Quote.

Wie bewerte ich KI-Agenten im Foundry-Portal?
Das Portal ist der einfachste Weg, KI-Agenten gleich zu Beginn zu bewerten. Sie benötigen ein Foundry-Projekt mit einem Agenten, eine GPT-Bereitstellung für das Judge-Modell und die Rolle Foundry User. Dann:
- Melden Sie sich beim Microsoft Foundry-Portal (ai.azure.com) an und öffnen Sie Ihr Projekt.
- Klicken Sie im linken Bereich auf Evaluation → Erstellen. Sie können auch direkt von Ihrem Agent aus über den Reiter Evaluation starten.
- Wählen Sie das Ziel Evaluation aus. Wählen Sie Agent und dann Ihr Agent.
- Wählen Sie den Bereich aus: Vollständige Konversationen, um vollständige Chats mit mehreren Runden zu beurteilen, oder Einzelne Runden für Einzelantworten und Tool-Nutzung.
- Wählen Sie die Datenquelle aus. Sie können einen vorhandenen Datensatz hochladen (JSONL oder CSV mit Ihren Testabfragen), Foundry synthetische Daten generieren lassen oder vollständige Konversationen anhand von Szenariobeschreibungen simulieren.
- Wählen Sie die Testkriterien aus. Das Portal wählt den empfohlenen Evaluators voraus. Fügen Sie hinzu oder entfernen Sie, was Sie benötigen, zum Beispiel Task Adherence, Tool Call Genauigkeit und die Sicherheit Evaluators.
- Geben Sie einen Namen ein und klicken Sie auf Senden. Der Lauf dauert einige Minuten. Die Ergebnisse finden Sie unter Evaluation, mit Pass/Fail-Anzahl pro Evaluator und einer Begründung für jeden einzelnen Testfall.
Tipp: Klein anfangen. Ein Datensatz mit 10 bis 20 realistischen Abfragen zeigt Ihnen bereits, wo der Agent Probleme hat. Sie können den Datensatz später erweitern und für jede neue Agentenversion wiederverwenden.
Wie führe ich eine Evaluation mit dem SDK aus?
Für CI/CD-Pipelines bevorzuge ich die Bewertung von KI-Agenten anhand des Codes. Der Agent-Fluss Evaluation läuft über das Foundry SDK (azure-ai-projects). Sie laden einen Datensatz hoch, definieren Evaluators als Testkriterium und erstellen einen Lauf, der auf Ihren Agenten abzielt. Hier ist ein Minimalbeispiel, das eine Evaluation mit dem Task Adherence Evaluator erstellt:
# pip install "azure-ai-projects>=2.0.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
project = AIProjectClient(
endpoint=os.environ["AZURE_AI_PROJECT_ENDPOINT"],
credential=DefaultAzureCredential(),
)
client = project.get_openai_client()
evaluation = client.evals.create(
name="Agent Quality Evaluation",
data_source_config={
"type": "custom",
"item_schema": {"type": "object", "properties": {"query": {"type": "string"}}, "required": ["query"]},
"include_sample_schema": True,
},
testing_criteria=[{
"type": "azure_ai_evaluator",
"name": "Task Adherence",
"evaluator_name": "builtin.task_adherence",
"data_mapping": {"query": "{{item.query}}", "response": "{{sample.output_items}}"},
"initialization_parameters": {"deployment_name": os.environ["AZURE_AI_MODEL_DEPLOYMENT_NAME"]},
}],
)
Anschließend erstellen Sie einen Lauf mit Ihrem Agenten als Ziel und Ihrem hochgeladenen Datensatz als Quelle. Foundry sendet dann jede Testanfrage an den Agenten, erfasst die vollständige Antwort einschließlich Tool Calls und bewertet sie. Das vollständige Beispiel mit der Lauferstellung finden Sie im Bewerten Sie Ihren AI Agents-Leitfaden. Für lokales Evaluation auf Ihrem eigenen Computer gibt es auch das Python-Paket azure-ai-Evaluation, aber für agentenspezifische Ausführungen ist der obige Ablauf die aktuelle Vorgehensweise.
Wie bewerte ich KI-Agenten in der Produktion?
Ein einmaliger Evaluation ist eine Momentaufnahme. Der Produktionsverkehr ändert sich und Ihr Agent kann abdriften. Hierfür bietet Foundry fortlaufend Evaluation an. Es prüft die Antworten Ihrer Live-Agenten und führt automatisch Ihr ausgewähltes Evaluators darauf aus. Auf diese Weise bewerten Sie KI-Agenten anhand des realen Datenverkehrs und nicht nur anhand Ihres Testdatensatzes. Sie sehen die Bewertungen auf der Registerkarte Überwachen des Agenten, zusammen mit Latenz, Token-Nutzung und Ausführungserfolgsrate. In den Monitoreinstellungen können Sie auch geplante Evaluations für Ihren Testdatensatz aktivieren und Alarme konfigurieren.
Darüber hinaus gibt es den AI Red Teaming Agent. Es basiert auf dem Open-Source-PyRIT-Framework von Microsoft und simuliert gegnerische Angriffe gegen Ihren Agenten, um Sicherheitslücken zu finden, bevor es echte Angreifer tun. Sie können Scans lokal ausführen oder in der Cloud planen. Einzelheiten finden Sie in der Dokumentation zum AI Red Teaming Agent.
Hinweis: Continuous Evaluation benötigt eine Application Insights-Ressource, die mit Ihrem Projekt verbunden ist, und die vom Projekt verwaltete Identität benötigt die Rolle Foundry User. Ohne dies bleiben die Überwachungsdiagramme leer.

Die Bewertung von KI-Agenten ist keine einmalige Aufgabe. Mein Rhythmus ist einfach: Erstellen Sie frühzeitig einen kleinen Testdatensatz, führen Sie für jeden Agentenwechsel eine Evaluation aus, behalten Sie die Genauigkeit von Task Adherence und Tool Call als Release-Gates bei und lassen Sie Evaluation die Produktion kontinuierlich überwachen. Damit erfassen Sie die Probleme im Evaluation-Bericht und nicht in einer Benutzerbeschwerde. Ich hoffe, das ist eine kleine Hilfe.
Bleibt gesund, Grüße Jannik

