DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs
Read the original at arxiv.org→arXiv:2609.28570v1 Announce Type: new Abstract: Reinforcement learning (RL) is widely used to sharpen reasoning in multimodal large language models (MLLMs), yet its effect on hallucination is uneven. We trace this...
Coverage timeline
- Sep 25, 04:00 UTC arXiv cs.AI lead source DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs