Ph.D. in Computer Science
Texas A&M University


Generative AI researcher working on video generation, controllable video editing, and world models.

Profile
I am a Computer Science Ph.D. student at Texas A&M University. My research focuses on generative video models, controllable video editing, and world models, with an emphasis on precise and physically grounded visual generation.
Academic path
Texas A&M University
University of Michigan, Ann Arbor
University of California, Irvine
Industry experience
Adobe Research
DiDi Global Inc., USA
Anhui Cowa ROBOT Co., Ltd, Shanghai, China
Research
Selected work in generative video, controllable editing, world models, and autonomous systems.

Jiongze Yu, Xiangbo Gao, Pooja Verlani, Akshay Gadde, Yilin Wang, Balu Adsumilli, Zhengzhong Tu
An interactive video super-resolution framework that propagates sparse user-selected high-resolution keyframes across a video.

Xiangbo Gao, Yuheng Wu, Runsheng Wang, Chenxi Liu, Yang Zhou, Zhengzhong Tu
A language-driven vehicle collaboration framework that cuts communication bandwidth by 96% while preserving closed-loop driving performance.

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu
A comprehensive benchmark for evaluating the trustworthiness of large vision-language models in autonomous driving.



Xiangbo Gao, Cheng Luo, Qinliang Lin, Weicheng Xie, Minmin Liu, Linlin Shen, Keerthy Kusumam, Siyang Song
A scale-free generator for transferable, defense-resistant, and visually realistic adversarial patterns.

Minmin Liu, Xuechen Li, Xiangbo Gao, Junliang Chen, Linlin Shen, Huisi Wu
Gradient-based hardness calibration improves long-tailed cervical cell detection by 7.8% mAP over standard classification loss.

Xiangbo Gao, Siyuan Yang, Ping He, Mingyang Wu, Yuheng Wu, Yushen Zuo, Jiongze Yu, Ryan Cui, Hongyuan Hua, Devin Ma, Xiao Jin, Yubo Yuan, Qing Yin, Jie Yang, Zhengzhong Tu
A live video model for prompt-switchable, hour-scale generation with real-time 4K output at 24 FPS.

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu
Rule-based planners provide faithful reasoning traces that keep a driving VLA's explanations structurally tied to its motion decisions.

Yuheng Wu, Xiangbo Gao, Tianhao Chen, Xinghao Chen, Qing Yin, Zhengzhong Tu, Dongman Lee
A trust-region training objective improves long-horizon consistency while keeping interactive video generation responsive to new events.

Xiangbo Gao, Sicong Jiang, Bangya Liu, Xinghao Chen, Minglai Yang, Siyuan Yang, Mingyang Wu, Jiongze Yu, Qi Zheng, Haozhi Wang, Jiayi Zhang, Jared Yang, Jie Yang, Zihan Wang, Qing Yin, Zhengzhong Tu
A 5,049-example human-annotated dataset, reward model, and benchmark for instruction-guided video editing quality.

Xiangbo Gao, Mingyang Wu, Siyuan Yang, Jiongze Yu, Pardis Taghavi, Fangzhou Lin, Zhengzhong Tu
Visual Chronometer estimates physical frame rate from motion and exposes temporal-scale failures in modern video generators.

Xiangbo Gao, Renjie Li, Xinghao Chen, Yuheng Wu, Suofei Feng, Qing Yin, Zhengzhong Tu
A video diffusion model that inserts instances with coherent appearance, motion, and interaction from only a few controlled keyframes.

Xiangbo Gao, Tzu-Hsiang Lin, Ruojing Song, Yuheng Wu, Kuan-Ru Huang, Zicheng Jin, Fangzhou Lin, Shinan Liu, Zhengzhong Tu
An agentic defense pipeline protects language-based collaborative driving against communication failures and semantic attacks.

Xiangbo Gao, Yuheng Wu, Fengze Yang, Xuewen Luo, Keshu Wu, Xinghao Chen, Yuping Wang, Chenxi Liu, Yang Zhou, Zhengzhong Tu
A large-scale dataset and benchmark for vehicle-to-drone collaboration using flexible aerial perception.
Community