Publications
A collection of my research work.

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Senqiao Yang*, Kaichen Zhang*, Zhaoyang Jia*, Jinghao Guo*, Yifei Shen*†, Xinjie Zhang*†, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu
arXiv preprint arXiv:2607.24904 2026
An efficient codec-native streaming multimodal foundation model that reduces visual token consumption by over 75% and achieves up to 3.5x wall-clock inference speedup.
Learning to Respond: A Large-Scale Benchmark and Progressive Learning Framework for Trigger-Centric Online Video Understanding
Jiawen Qian*, Hang Du*, Guoshun Nan, Shan Huang, Jiaqi Yu, Haoqing Wang, Jingfeng Chen, Mengxue Cai, Mengdi Yang, Jiarong Li, Zhilong Li, Hua Wang, Jun Liu, Xudong Jiang, Sicong Leng†
Under review 2025
A large-scale benchmark (TV-Online) and progressive learning framework for trigger-centric online video understanding.