Referee agents that catch benchmark gaming in clinical multi-agent systems: shortcut cascades, blind metrics, and mutual oversight, measured.
medical-imaging multi-agent-systems ai-safety shortcut-learning clinical-ai llm-evaluation agentic-ai benchmark-gaming
-
Updated
Aug 5, 2026 - Python