Solicitações representativas medem a qualidade do roteamento por categoria, idioma e caso-limite. Itens com baixa confiança seguem para uma fila de revisão em vez de serem encaminhados automaticamente.
Um esquema de destino claro e evidências por campo tornam a extração testável. Layouts difíceis, valores ausentes e conteúdos conflitantes são incluídos para que resultados incertos sejam sinalizados.
A recuperação é testada quanto à cobertura das fontes, permissões, contexto rastreável e capacidade de não responder. O assistente deve apoiar uma decisão sem apresentar texto sem fundamento como fato operacional.
Relatórios recorrentes são comparados com uma estrutura de referência estável. Diferenças, informações ausentes e resumos incertos permanecem visíveis para aprovação humana.
Históricos de pressão rotulados estabelecem o consumo normal e os acionamentos da bomba. O piloto mede se pequenos desvios persistentes podem ser detectados cedo sem gerar uma taxa de falsos alarmes impraticável.
Antes da avaliação são definidas posições de câmera, qualidade de imagem e critérios visíveis de revisão. Achados incertos ou relacionados à segurança permanecem sob revisão humana qualificada.