Las solicitudes representativas permiten medir la calidad del enrutamiento por categoría, idioma y caso límite. Los elementos con baja confianza pasan a una cola de revisión en lugar de enviarse automáticamente.
Un esquema de destino claro y evidencias por campo hacen que la extracción sea comprobable. Se incluyen diseños difíciles, valores ausentes y contenidos contradictorios para marcar los resultados inciertos.
La recuperación se prueba por cobertura de fuentes, permisos, contexto trazable y capacidad de abstenerse. El asistente debe apoyar una decisión sin presentar texto no respaldado como un hecho operativo.
Los informes recurrentes se comparan con una estructura de referencia estable. Las diferencias, los datos ausentes y los resúmenes inciertos quedan visibles para la aprobación humana.
Los historiales de presión etiquetados establecen el consumo normal y los arranques de la bomba. El piloto mide si detecta antes desviaciones pequeñas y persistentes sin generar una tasa de falsas alarmas inutilizable.
Antes de evaluar el modelo se definen posiciones de cámara, calidad de imagen y criterios visibles de revisión. Los hallazgos inciertos o relacionados con la seguridad permanecen bajo revisión humana cualificada.