MUD as AI evaluation and LLM-judge distortion in ways aggregate κ misses
Read the original at www.lesswrong.com→Original headline: "MUD as AI Evaluation and LLM-judge distortion in ways aggregate κ misses"
Coverage timeline
- Aug 2, 07:02 UTC Hacker News (AI) lead source MUD as AI Evaluation and LLM-judge distortion in ways aggregate κ misses