精选科研项目

本团队与合作者开源的研究系统,涵盖具身智能与机器人操作、自动驾驶、生成模型以及高效多模态基础模型等方向。

# 共同一作* 通讯作者

  1. AdaRoboVLG:跨机械手的真实场景机器人抓取
    arXiv 2026具身智能

    AdaRoboVLG: Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

    Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan, Fan Huang, Haoxuan Li, Yongkang Li, Yuhan Li, Bencheng Liao, Zeyu Zhang, Wenyu Liu, Hangxin Liu, Xinggang Wang

    任务自适应的视觉-语言-抓取框架,将物理抓取合成与任务理解解耦,通过可组合的基础模型先验实现跨不同机械手的泛化抓取。

  2. arXiv 2026世界动作模型

    DreamWAM: Beyond RGB Future Prediction for World Action Models

    Shanglin Yuan#, Weiheng Zhao#, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang*

    超越 RGB 的世界动作模型:将未来预测重构为结构化世界建模,从外观、运动、几何、语义四个互补视角表征未来状态,实现稳健的机器人操作。

  3. Faster-WAM:面向世界动作模型的推理时未来条件框架
    arXiv 2026世界动作模型

    Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

    Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Zhizhong Su, Wei Sui, Fan Huang, Xinggang Wang

    世界动作模型在推理时只计算一次未来表征并在动作去噪中选择性复用,大幅降低推理延迟,同时具备稳健的分布外泛化能力。

  4. ReWorld:面向世界动作模型的表示学习框架
    arXiv 2026自动驾驶

    ReWorld: Learning Better Representations for World Action Models

    Tianze Xia#, Lijun Zhou#, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang*

    首个面向自动驾驶世界动作模型的表示学习框架,无需外部编码器与教师模型,仅增加 0.3% 训练开销,显式优化从世界到动作的隐表征通路。

  5. Moebius:轻量级图像修复流水线
    ECCV 2026生成模型

    Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

    Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

    0.2B 轻量级图像修复框架,性能达到 10B 级别模型水平。

  6. UniDriveVLA:基于 Mixture-of-Transformers 的自动驾驶架构
    arXiv 2026自动驾驶

    UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

    Yongkang Li, Lijun Zhou, Sixu Yan, Bencheng Liao, Tianyi Yan, Kaixin Xiong, Long Chen, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Wenyu Liu, Xinggang Wang*

    基于 Mixture-of-Transformers 的统一驾驶视觉-语言-动作模型,将驾驶理解、场景感知与动作规划解耦到三个专家网络,通过掩码联合注意力协同工作。

  7. RAD-2:闭环规划的生成器-判别器框架
    arXiv 2026自动驾驶

    RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework

    Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang*

    闭环驾驶的生成器-判别器框架:扩散生成器产生多样化候选轨迹,强化学习优化的判别器按长期驾驶质量重排序,碰撞率较主流扩散规划器降低 56%。

  8. Senna-2:对齐 VLM 与端到端驾驶策略
    arXiv 2026自动驾驶

    Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

    Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang*

    显式对齐 VLM 高层决策与端到端策略低层规划的驾驶模型,通过面向一致性的三阶段训练与 3DGS 环境中的层次化强化学习,显著提升开环与闭环驾驶安全性。

  9. DriveLaW:在潜在驾驶世界中统一规划与视频生成
    CVPR 2026自动驾驶

    DriveLaW: Unifying Planning and Video Generation in a Latent Driving World

    Tianze Xia, Yongkang Li#, Lijun Zhou#, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang*

    统一视频生成与运动规划的驾驶世界模型:将视频生成器的隐表征直接注入扩散规划器,在 nuScenes 视频预测与 NAVSIM 规划上均达到最先进水平。

  10. DiffusionVL:将自回归模型转换为扩散视觉语言模型
    ECCV 2026多模态大模型

    DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

    Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

    将任意自回归模型转换为扩散式视觉语言模型的框架,兼具自回归预训练的知识优势与扩散并行解码的效率优势。

  11. VTP:面向生成的视觉 tokenizer 可扩展预训练
    ECCV 2026生成模型

    VTP: Towards Scalable Pre-training of Visual Tokenizers for Generation

    Jingfeng Yao, Yuda Song, Yucong Zhou, Xinggang Wang

    统一的视觉 tokenizer 预训练框架,联合优化对比学习、自监督与重建目标,揭示生成性能随 tokenizer 预训练算力、参数与数据扩展的新 scaling law。

  12. InfiniteVL:线性注意力与稀疏注意力协同的无限输入视觉语言模型
    arXiv 2025高效多模态模型

    InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models

    Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin, Qian Zhang, Wenyu Liu, Xinggang Wang*

    高效视觉语言模型:线性注意力维持紧凑的长期记忆,稀疏注意力保障精细视觉感知,支持恒定显存占用的无限输入流式理解。

  13. 4DLangVGGT:四维语言-视觉几何接地 Transformer
    arXiv 2025四维场景理解

    4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer

    Xianfeng Wu, Yajing Bai#, Minghan Li, Xianzu Wu, Xueqi Zhao, Zhongyuan Lai, Wenyu Liu, Xinggang Wang*

    首个基于 Transformer 的前馈式四维语言接地框架,在单一架构中联合几何感知(StreamVGGT)与语言对齐(语义桥接解码器),无需逐场景优化即可泛化到动态场景。

  14. TransLight:图像引导的定制化光照控制
    ICML 2026生成模型

    TransLight: Image-Guided Customized Lighting Control with Generative Decoupling

    Zongming Li, Lianghui Zhu, Haocheng Shen, Longjin Ran, Wenyu Liu, Xinggang Wang

    图像引导的定制化光照控制:通过生成式解耦将任意参考图像的光照效果迁移到用户内容上,实现无需文本描述的精确重光照。

  15. LENS:统一强化推理的万物分割
    AAAI 2026图像分割

    LENS: Learning to Segment Anything with Unified Reinforced Reasoning

    Lianghui Zhu, Bin Ouyang, Yuxuan Zhang, Tianheng Cheng, Rui Hu, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Li Yu, Wenyu Liu, Xinggang Wang

    统一强化推理的万物分割:多模态模型对复杂指代表达进行推理并输出精确分割掩码,全流程以强化学习端到端训练。

  16. ReCogDrive:端到端自动驾驶的强化认知框架
    ICLR 2026自动驾驶

    ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

    Yongkang Li#, Kaixin Xiong#, Xiangyu Guo, Fang Li, Sixu Yan, Gangwei Xu, Lijun Zhou, Long Chen, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang*

    强化认知驾驶框架:认知增强的视觉语言模型与扩散规划器相结合,并通过 DiffGRPO 强化学习进一步提升轨迹的安全性与舒适性。

  17. GaussTR:基础模型对齐的高斯 Transformer 自监督三维空间理解
    CVPR 2025三维感知

    GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding

    Haoyi Jiang, Liu Liu, Tianheng Cheng, Xinjie Wang, Tianwei Lin, Zhizhong Su, Wenyu Liu, Xinggang Wang

    自监督三维空间理解:将基于高斯的三维表征与基础模型特征对齐,无需人工三维标注即可实现开放词汇的三维感知。

  18. DiffusionDrive:端到端自动驾驶的截断扩散模型
    CVPR 2025自动驾驶

    DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving

    Bencheng Liao, Shaoyu Chen, Haoran Yin, Bo Jiang, Cheng Wang, Sixu Yan, Xinbang Zhang, Xiangyu Li, Ying Zhang, Qian Zhang, Xinggang Wang

    面向实时端到端驾驶的截断扩散策略,从锚定高斯先验出发仅需少量去噪步数即可生成多样、高质量的轨迹。

  19. Senna:连接大规模视觉语言模型与端到端自动驾驶
    IJCV 2026自动驾驶

    Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving

    Bo Jiang, Shaoyu Chen, Bencheng Liao, Xingyu Zhang, Wei Yin, Qian Zhang, Chang Huang, Wenyu Liu, Xinggang Wang

    连接大规模视觉语言模型与端到端自动驾驶的驾驶 VLM,将高层场景理解、推理与精确轨迹规划融为一体。

  20. VADv2:基于概率规划的端到端自动驾驶
    ICLR 2026自动驾驶

    VADv2: End-to-End Autonomous Driving via Probabilistic Planning

    Bo Jiang, Shaoyu Chen, Hao Gao, Bencheng Liao, Qian Zhang, Wenyu Liu, Xinggang Wang

    端到端矢量化自动驾驶:从大规模驾驶示范中学习动作的概率分布,并采样一个动作控制车辆,无需规则包装即可稳定运行。

  21. YOLO-World:实时开放词汇目标检测
    CVPR 2024开放词汇检测

    YOLO-World: Real-Time Open-Vocabulary Object Detection

    Tianheng Cheng, Lin Song, Yixiao Ge, Wenyu Liu, Xinggang Wang, Ying Shan

    实时开放词汇目标检测:通过可重参数化的 RepVL-PAN 与区域-文本对比预训练为 YOLO 注入视觉语言能力,LVIS 零样本检测达 35.4 AP / 52 FPS。

  22. Vision Mamba:双向状态空间模型的高效视觉表征学习
    ICML 2024视觉表征学习

    Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model

    Lianghui Zhu#, Bencheng Liao#, Qian Zhang, Xinlong Wang, Wenyu Liu, Xinggang Wang*

    基于双向状态空间模型的通用视觉骨干网络,以线性复杂度、无注意力机制达到 Transformer 级别的表征能力。

  23. 4DGaussians:实时动态场景渲染
    CVPR 2024四维重建

    4D Gaussian Splatting for Real-Time Dynamic Scene Rendering

    Guanjun Wu#, Taoran Yi#, Jiemin Fang, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Qi Tian, Xinggang Wang*

    用高斯泼溅与紧凑的时空联合表征建模动态场景,实现高质量新视角合成的实时渲染。

  24. MapTR:在线矢量化高精地图构建
    IJCV 2025自动驾驶

    MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction

    Bencheng Liao, Shaoyu Chen, Yunchi Zhang, Bo Jiang, Qian Zhang, Wenyu Liu, Chang Huang, Xinggang Wang

    在线矢量化高精地图构建的端到端框架,将地图元素建模为点集并通过层次化查询设计实现实时结构化地图学习。

  25. EVA:规模化掩码视觉表征学习的极限探索
    CVPR 2023视觉表征学习

    EVA: Exploring the Limits of Masked Visual Representation Learning at Scale

    Yuxin Fang#, Wen Wang, Binhui Xie, Quan Sun, Ledell Wu, Xinggang Wang*, Tiejun Huang, Xinlong Wang*, Yue Cao*

    将掩码图像建模扩展到十亿参数级视觉 Transformer:仅用掩码图像建模预训练的原始 ViT 即可在大量下游视觉任务上达到最先进水平。

  26. ByteTrack:关联每一个检测框的多目标跟踪
    ECCV 2022多目标跟踪

    ByteTrack: Multi-Object Tracking by Associating Every Detection Box

    Yifu Zhang, Peize Sun, Yi Jiang, Dongdong Yu, Fucheng Weng, Zehuan Yuan, Ping Luo, Wenyu Liu, Xinggang Wang

    简单而高效的多目标跟踪:关联每一个检测框而非仅高分框,从低分检测中找回真实目标并过滤背景,已成为集成进 YOLOv8 等框架的标准跟踪器。

  27. FairMOT:多目标跟踪中检测与重识别的公平性
    IJCV 2021多目标跟踪

    FairMOT: On the Fairness of Detection and Re-Identification in Multiple Object Tracking

    Yifu Zhang#, Chunyu Wang, Xinggang Wang*, Wenjun Zeng, Wenyu Liu

    一站式多目标跟踪器:在同构网络中公平地平衡检测与重识别两个任务,解决了将重识别作为次要任务所带来的固有偏差。

  28. CCNet:语义分割的十字交叉注意力
    TPAMI 2023语义分割

    CCNet: Criss-Cross Attention for Semantic Segmentation

    Zilong Huang#, Xinggang Wang#*, Yunchao Wei, Lichao Huang, Humphrey Shi, Wenyu Liu, Thomas Huang

    十字交叉注意力以稀疏的十字路径替代稠密注意力捕获全图上下文,是分割领域广泛使用的高效长程依赖模块,并被 AlphaFold 采用。