Value leakage: a language model's answers are shaped by its own values
Read the original at arxiv.org→arXiv:2607.14345v1 Announce Type: new Abstract: People use language models for practical questions whose answers are difficult to verify. We show that models exhibit covert value leakage: the information they...
Original headline: "Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values"
Coverage timeline
- Jul 17, 04:00 UTC arXiv cs.LG lead source Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values