SynthSentry: detecting synthetic data contamination in language model training data
Read the original at arxiv.org→arXiv:2609.12353v1 Announce Type: new Abstract: Large language models trained recursively on their own or other models' outputs undergo model collapse, in which distributional tails and factual accuracy deteriorate...
Original headline: "SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data"
Coverage timeline
- Sep 14, 04:00 UTC arXiv cs.CL lead source SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data