TencentARC/SCoPE adds camera sightlines as positional coordinates to a pretrained video diffusion transformer for motion-consistent video generation from a first frame, text prompt, and camera trajectory.
Read the original at old.reddit.com→SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers SCoPE adds camera sightlines as positional coordinates to a pretrained video diffusion transformer. Given a first frame, a text prompt,...
Original headline: "TencentARC/SCoPE · Hugging Face"
Coverage timeline
- Aug 19, 13:19 UTC r/LocalLLaMA lead source TencentARC/SCoPE · Hugging Face