Towards Reasoning in Visual Generation Models!
We build open-source data, models, tools, and benchmarks for native visual reasoning.
Video-Reason investigates whether generative models can perform genuine reasoning—such as solving chess puzzles, navigating mazes, completing Sudoku, performing mental rotation, and solving Raven's matrices—directly through visual generation. VBVR provides scalable data generation and deterministic evaluation; VBVR-Pro closes the loop with supervised training, reinforcement learning, verifiable rewards, and controlled comparisons across image, interleaved-image, and video generation. All tools are open-source under Apache 2.0.
For documentation, benchmarks, generators, and project updates, visit Video-Reason.com.
VBVR-Pro — Training and Inference Code
Unified training and inference for the VBVR-Pro image, interleaved-image, and video model families.
VBVR-Pro-Bench — Verifiable Benchmark
Task-grounded evaluation and verifiable reward scorers for native visual reasoning.
Awesome-Video-Reasoning — Paper Collection
A curated list of research papers on reasoning with video generation models
- Website: Video-Reason.com
- VBVR Paper: A Very Big Video Reasoning Suite
- VBVR-Pro Paper: A Scalable and Verifiable Suite for Native Visual Reasoning
- VBVR-Pro Models: Browse the model family
- HuggingFace: Video-Reason
- Contact: hokinxqdeng@gmail.com
If you use our work in your research, please cite the corresponding paper.
@article{vbvr2026,
title = {A Very Big Video Reasoning Suite},
author = {Wang, Maijunxian and Wang, Ruisi and Lin, Juyi and Ji, Ran and
Wiedemer, Thadd{\"a}us and Gao, Qingying and Luo, Dezhi and
Qian, Yaoyao and Huang, Lianyu and Hong, Zelong and Ge, Jiahui and
Ma, Qianli and He, Hang and Zhou, Yifan and Guo, Lingzi and
Mei, Lantao and Li, Jiachen and Xing, Hanwen and Zhao, Tianqi and
Yu, Fengyuan and Xiao, Weihang and Jiao, Yizheng and
Hou, Jianheng and Zhang, Danyang and Xu, Pengcheng and
Zhong, Boyang and Zhao, Zehong and Fang, Gaoyun and Kitaoka, John and
Xu, Yile and Xu, Hua and Blacutt, Kenton and Nguyen, Tin and
Song, Siyuan and Sun, Haoran and Wen, Shaoyue and He, Linyang and
Wang, Runming and Wang, Yanzhi and Yang, Mengyue and Ma, Ziqiao and
Milli{\`e}re, Rapha{\"e}l and Shi, Freda and Vasconcelos, Nuno and
Khashabi, Daniel and Yuille, Alan and Du, Yilun and Liu, Ziming and
Lin, Dahua and Liu, Ziwei and Kumar, Vikash and Li, Yijiang and
Yang, Lei and Cai, Zhongang and Deng, Hokin},
journal = {arXiv preprint arXiv:2602.20159},
year = {2026},
url = {https://arxiv.org/abs/2602.20159}
}@misc{xu2026vbvrproscalableverifiablesuite,
title = {VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning},
author = {Junxiang Xu and Ruisi Wang and Fanyi Pu and Maijunxian Wang and Ran Ji and Tongxi Zhou and Chenyang Gu and Jing Zuo and Hongcan Xiao and Yimeng Geng and Wanqi Yin and Wei Chen and Oscar Qian and Zhengan Yan and Ziqi Huang and Haiwen Diao and Liang Pan and Bo Li and Xiangyu Fan and Dezhi Luo and Fengyuan Yu and Zehong Zhao and Qingying Gao and Tinghui Zhu and Yilan Zhang and Jingqi Tong and Pinyuan Feng and Zhengze Jiang and Letian Wang and Ziyu Guo and Renrui Zhang and Jieneng Chen and Sonia Joseph and Constantin Venhoff and Saman Motamed and Mengyue Yang and Chandra Sripada and Alan Yuille and Philip Torr and Lvmin Zhang and Vikash Kumar and Daniel Khashabi and Nikolaus Kriegeskorte and Rapha{\"e}l Milli{\`e}re and Vincent C. M{\"u}ller and Anyi Rao and Quan Wang and Ziwei Liu and Dahua Lin and Lei Yang and Hokin Deng and Zhongang Cai},
year = {2026},
eprint = {2608.26105},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2608.26105}
}