Vision-language pipeline for visual math QA: custom vision-to-text adapter, MPS adapter training, MathVista evaluation (Qwen2.5-VL 0.717, +20.7pp visual ablation)
adapter deep-learning pytorch clip vlm visual-question-answering multimodal vision-language-model qwen llm-evaluation math-reasoning mathvista
-
Updated
Aug 2, 2026 - Python