From Pixels to Words -- Towards Native One-Vision Models at Scale
Haiwen Diao
Paranioar
AI & ML interests
Vision-and-Language, Parameter-efficient Transfer Learning, Multi-modal Large Language Model
Recent Activity
authored a paper 5 days ago
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning authored a paper 5 days ago
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning upvoted a paper 5 days ago
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning