Reliability-aware distillation can harm some samples in low-resource Bangla summarization; standard knowledge distillation yields negligible ROUGE-L gains on BanSum Bangla
Read the original at arxiv.org→arXiv:2607.19956v1 Announce Type: new Abstract: Knowledge distillation (KD) is a standard approach for compressing sequence-to-sequence models, but its per-sample effects are rarely examined. On the BanSum Bangla...
Original headline: "When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization"
Coverage timeline
- Jul 23, 04:00 UTC arXiv cs.CL lead source When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization