k_llama.cpp adds MoE optimizations: expert residency, hybrid CPU/GPU execution, and Q2_0 support
Read the original at www.reddit.com→Finally finished my fork: https://github.com/IceFog72/ik_llama.cpp Nothing else I wanted to add/try currently works In short, it now has: Bandwidth-adaptive CPU/GPU execution Shared expert-residency ideas from...
Original headline: "k_llama.cpp MoE Optimizations: Expert Residency, Hybrid CPU/GPU Execution, Q2_0 Support"
Coverage timeline
- Oct 5, 23:33 UTC r/LocalLLaMA lead source k_llama.cpp MoE Optimizations: Expert Residency, Hybrid CPU/GPU Execution, Q2_0 Support