VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro turns visual reasoning into a scalable, verifiable training and evaluation loop: 300 procedural tasks, aligned image/interleaved text-image/video solutions, and verifiable task-specific evaluation.

VBVR-Pro Leaderboard

Released aggregate results on the 100-task, 500-case VBVR-Pro Bench.

Modality
Type
# Model Type Modality Overall In-Domain Out-of-Domain
1 Open Source Interleaved 0.683 0.676 0.689
2 Pro Baseline Video 0.670 0.808 0.532
3 Pro Baseline Interleaved 0.638 0.811 0.464
4 Open Source Interleaved 0.565 0.533 0.597
5
Image Nano Banana Pro
Proprietary Interleaved 0.564 0.480 0.648
6 Pro Baseline Video 0.562 0.730 0.395
7
Image Seedream-5.0-Pro
Proprietary Image 0.557 0.485 0.629
8
Image VBVR-Wan2.2
Open Source Video 0.517 0.548 0.486
9
Image GPT-Image-2
Proprietary Interleaved 0.507 0.428 0.587
10
Image Seedance 2.0
Proprietary Video 0.499 0.451 0.547
11 Pro Baseline Video 0.470 0.641 0.300
12 Pro Baseline Video 0.425 0.527 0.324
13
Image VBVR-SenseNova-U1
Open Source Interleaved 0.408 0.469 0.347
14 Pro Baseline Image 0.407 0.484 0.330
15
Image Kling VIDEO 3.0
Proprietary Video 0.392 0.356 0.427
16 Pro Baseline Interleaved 0.373 0.402 0.344
17 Pro Baseline Image 0.322 0.332 0.311
18
Image Qwen-Image-2.0
Proprietary Image 0.313 0.248 0.378
19
Image Veo 3.1
Proprietary Video 0.309 0.312 0.305
20
Image Wan2.2-I2V-A14B
Open Source Video 0.182 0.157 0.207
21 Pro Baseline Image 0.172 0.168 0.176
22
Image FLUX.2-dev
Open Source Image 0.157 0.108 0.206
23
Image ThinkMorph-7B
Open Source Interleaved 0.154 0.113 0.195
24
Image Qwen-Image-Edit
Open Source Image 0.134 0.108 0.159
25
Image LTX-2.3-I2AV
Open Source Video 0.112 0.106 0.119
26
Image Wan2.1-I2V-14B-720P
Open Source Video 0.100 0.105 0.095
27
Image Wan2.2-TI2V-5B
Open Source Video 0.094 0.066 0.122
28
Image BAGEL-7B-MoT
Open Source Image 0.089 0.066 0.111
29
Image CogVideoX1.5-5B-I2V
Open Source Video 0.085 0.100 0.070
30
Image HunyuanVideo-I2V
Open Source Video 0.054 0.054 0.053
30 / 30 released model results

Citation

If you find VBVR-Pro useful in your research, please cite our paper.

BibTeX
@article{vbvrpro2026,
  title   = {VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning},
  author  = {Xu, Junxiang and Wang, Ruisi and Pu, Fanyi and Wang, Maijunxian and Ji, Ran and
             Zhou, Tongxi and Gu, Chenyang and Zuo, Jing and Xiao, Hongcan and Geng, Yimeng and
             Yin, Wanqi and Wei, Chen and Qian, Oscar and Yan, Zhengan and Huang, Ziqi and
             Diao, Haiwen and Pan, Liang and Li, Bo and Fan, Xiangyu and Luo, Dezhi and
             Yu, Fengyuan and Zhao, Zehong and Gao, Qingying and Zhu, Tinghui and Zhang, Yilan and
             Tong, Jingqi and Feng, Pinyuan and Jiang, Zhengze and Wang, Letian and Guo, Ziyu and
             Zhang, Renrui and Chen, Jieneng and Joseph, Sonia and Venhoff, Constantin and
             Motamed, Saman and Yang, Mengyue and Sripada, Chandra and Yuille, Alan and
             Torr, Philip and Zhang, Lvmin and Kumar, Vikash and Khashabi, Daniel and
             Kriegeskorte, Nikolaus and Milli{\`e}re, Rapha{\"e}l and M{\"u}ller, Vincent C. and
             Rao, Anyi and Wang, Quan and Liu, Ziwei and Lin, Dahua and Yang, Lei and
             Deng, Hokin and Cai, Zhongang},
  journal = {arXiv preprint arXiv:2608.26105},
  year    = {2026},
  url     = {https://arxiv.org/abs/2608.26105}
}