MUD as AI Evaluation and LLM-judge distortion in ways aggregate κ misses

(lesswrong.com)

4 points | by joozio 10 hours ago

No comments yet.