Dan Herman
Home
Articles
Resume
Projects
Contact
Projects
›
Full Stack AI Application: Enterprise Clinical Copilot
›
Agent Evaluation
Live Demo
View Code
Agent Evaluation
Objective
Cohort & Test Design
Methodology: LLM-as-a-Judge
Scoring Rubric & Assessment Criteria
Faithfulness
Groundedness
Citation Accuracy
Clinical Validity
Safety
Judge Validation
Guardrails & Verification
Results & Comparative Analysis
Failure Analysis
Limitations
Reproducibility & Artifacts
On this page
Objective
Cohort & Test Design
Methodology: LLM-as-a-Judge
Scoring Rubric & Assessment Criteria
Faithfulness
Groundedness
Citation Accuracy
Clinical Validity
Safety
Judge Validation
Guardrails & Verification
Results & Comparative Analysis
Failure Analysis
Limitations
Reproducibility & Artifacts
More in this project
Project Overview
Architecture
Agent Runtime
Agent Harness
MCP
Presentation Layer
← Back to Projects