Publications

A collection of my research work.

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Senqiao Yang*, Kaichen Zhang*, Zhaoyang Jia*, Jinghao Guo*, Yifei Shen*, Xinjie Zhang*, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

arXiv preprint arXiv:2607.24904 2026

An efficient codec-native streaming multimodal foundation model that reduces visual token consumption by over 75% and achieves up to 3.5x wall-clock inference speedup.

PaperProjectDOICode

Learning to Respond: A Large-Scale Benchmark and Progressive Learning Framework for Trigger-Centric Online Video Understanding

Jiawen Qian*, Hang Du*, Guoshun Nan, Shan Huang, Jiaqi Yu, Haoqing Wang, Jingfeng Chen, Mengxue Cai, Mengdi Yang, Jiarong Li, Zhilong Li, Hua Wang, Jun Liu, Xudong Jiang, Sicong Leng

Under review 2025

A large-scale benchmark (TV-Online) and progressive learning framework for trigger-centric online video understanding.