<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://evals.health</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/adversarial-example</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/agentic-benchmark</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/benchmark-saturation</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/bootstrap-confidence-interval</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/composite-index</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/consensus-criteria</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/eval-harness</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/grader-bias</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/holdout-set</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/independent-run</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/length-adjustment</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/mean-win-rate</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/meta-evaluation</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/model-grader</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/multi-turn-benchmark</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/pass-k</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/physician-baseline</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/red-teaming</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/rubric-criterion</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/glossary/vendor-reported-score</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/can-i-trust-vendor-benchmark-claims</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/how-often-do-healthcare-ai-rankings-change</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/what-is-the-hardest-healthcare-ai-benchmark</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/do-benchmark-scores-predict-real-clinical-performance</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/which-benchmarks-test-ai-agents-in-healthcare</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/do-ai-models-beat-doctors-on-health-benchmarks</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/what-is-a-good-healthbench-score</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/why-do-benchmark-scores-differ-between-sources</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/which-healthcare-ai-benchmarks-are-saturated</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/questions/how-are-medical-ai-benchmarks-graded</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/blog/vendor-benchmark-claims-checklist</loc>
<lastmod>2026-08-17</lastmod>
</url>
<url>
<loc>https://evals.health/about</loc>
<lastmod>2026-08-17</lastmod>
</url>
</urlset>
