Comedic Fool's Gold: reward exploits and countermeasures in conversational humor explored via embedding-based surprise rewards and fluency filtering; results show word-shuffled replies pass as witty as original jokes
Read the original at arxiv.org→arXiv:2610.00197v1 Announce Type: new Abstract: We investigate automated rewards for training language models in conversational humor, focusing on reward exploits and countermeasures. Two approaches aim to capture...
Original headline: "Comedic Fool's Gold: Reward Exploits and Countermeasures in Conversational Humor"
Coverage timeline
- Oct 2, 04:00 UTC arXiv cs.AI lead source Comedic Fool's Gold: Reward Exploits and Countermeasures in Conversational Humor