Repräsentative Anfragen messen die Weiterleitungsqualität je Kategorie, Sprache und schwierigem Randfall. Fälle mit geringer Sicherheit gehen in eine Prüfliste, statt automatisch weitergeleitet zu werden.
Ein klares Zielschema und Nachweise auf Feldebene machen die Extraktion prüfbar. Unübersichtliche Layouts, fehlende Werte und widersprüchliche Inhalte werden einbezogen, damit unsichere Ergebnisse markiert werden.
Der Wissensabruf wird auf Quellenabdeckung, Berechtigungen, nachvollziehbaren Kontext und die Fähigkeit zum bewussten Nicht-Antworten geprüft. Der Assistent soll Entscheidungen unterstützen, ohne unbelegte Aussagen als Fakten auszugeben.
Wiederkehrende Berichte werden anhand einer festen Vergleichsstruktur geprüft. Abweichungen, fehlende Angaben und unsichere Zusammenfassungen bleiben für die menschliche Freigabe sichtbar.
Beschriftete Druckverläufe zeigen, wie normaler Verbrauch und Pumpenstarts aussehen. Der Pilot misst, ob kleinere anhaltende Abweichungen früh erkannt werden, ohne eine unbrauchbar hohe Fehlalarmrate zu erzeugen.
Vor der Bewertung werden geeignete Kamerapositionen, Bildqualität und sichtbare Prüfkriterien festgelegt. Unsichere oder sicherheitsrelevante Befunde verbleiben bei einer qualifizierten menschlichen Prüfung.