DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
DobicVLM is a vision-language model for chest X-ray report generation that integrates supervised fine-tuning with Group Relative Policy Optimization (GRPO) and clinically-grounded programmatic rewards. Trained on 1,000 private image-report pairs, it uses interpretable, rule-based rewards to enforce clinical standards without relying on neural reward models. In blinded expert review on 69 held-out cases, DobicVLM outperformed Gemini 2.5 Flash in impression accuracy (27.2%) and use of medical terminology (86.5%), demonstrating improved clinical alignment.
Why it matters: This work shows that GRPO with programmatic rewards can transparently and efficiently improve clinical alignment in medical report generation, offering an alternative to neural reward models.
Full story at: arXiv Computer Vision ↗