Attention triangle in audio-video diffusion models reveals cross-modal semantic leakage
Read the original at arxiv.org→arXiv:2609.03586v1 Announce Type: new Abstract: Audio-video diffusion models rely on cross-modal attention to coordinate text, sound, and visual content, yet this same mechanism can introduce subtle and systematic...
Original headline: "The Attention Triangle in Audio-Video Models"
Coverage timeline
- Sep 4, 04:00 UTC arXiv cs.AI lead source The Attention Triangle in Audio-Video Models