Multi-agent judges are automated evaluation frameworks composed of multiple interacting artificial intelligence agents that collaborate to assess, score, or compare model outputs. Instead of relying on a single large language model to evaluate text, these systems assign distinct roles, such as critics, advocates, fact-checkers, and aggregators, across several agents to deliberate on the quality, factual accuracy, and reasoning of candidate responses. By employing structured interactions like iterative critique, multi-turn debate, and consensus voting, multi-agent judges aim to reduce individual model biases, mitigate evaluation errors, and deliver more robust and objective assessments on complex tasks.