精选科研项目

本团队与合作者开源的研究系统,涵盖具身智能与机器人操作、自动驾驶、生成模型以及高效多模态基础模型等方向。

# 共同一作* 通讯作者

  1. AdaRoboVLG:跨机械手的真实场景机器人抓取
    arXiv 2026具身智能

    AdaRoboVLG: Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

    Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan, Fan Huang, Haoxuan Li, Yongkang Li, Yuhan Li, Bencheng Liao, Zeyu Zhang, Wenyu Liu, Hangxin Liu, Xinggang Wang

    任务自适应的视觉-语言-抓取框架,将物理抓取合成与任务理解解耦,通过可组合的基础模型先验实现跨不同机械手的泛化抓取。

  2. arXiv 2026世界模型具身智能

    DreamWAM: Beyond RGB Future Prediction for World Action Models

    Shanglin Yuan#, Weiheng Zhao#, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang*

    超越 RGB 的世界动作模型:将未来预测重构为结构化世界建模,从外观、运动、几何、语义四个互补视角表征未来状态,实现稳健的机器人操作。

  3. Faster-WAM:面向世界动作模型的推理时未来条件框架
    arXiv 2026世界模型具身智能

    Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

    Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Zhizhong Su, Wei Sui, Fan Huang, Xinggang Wang

    世界动作模型在推理时只计算一次未来表征并在动作去噪中选择性复用,大幅降低推理延迟,同时具备稳健的分布外泛化能力。

  4. ReWorld:面向世界动作模型的表示学习框架
    arXiv 2026世界模型自动驾驶

    ReWorld: Learning Better Representations for World Action Models

    Tianze Xia#, Lijun Zhou#, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang*

    首个面向自动驾驶世界动作模型的表示学习框架,无需外部编码器与教师模型,仅增加 0.3% 训练开销,显式优化从世界到动作的隐表征通路。

  5. Moebius:轻量级图像修复流水线
    ECCV 2026生成模型

    Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

    Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

    0.2B 轻量级图像修复框架,性能达到 10B 级别模型水平。

  6. CoRL 2026具身智能

    MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model

    Shanglin Yuan, Weiheng Zhao, Xianda Guo, Wei Sui, Li Yu, Wenyu Liu, Xinggang Wang

    将严格过去帧的几何运动压缩为紧凑、可查询的轨迹场 token 注入 VLA,为策略提供时间连续的运动历史,提升长时程操作能力。

  7. RAD-2:闭环规划的生成器-判别器框架
    arXiv 2026自动驾驶

    RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework

    Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang*

    闭环驾驶的生成器-判别器框架:扩散生成器产生多样化候选轨迹,强化学习优化的判别器按长期驾驶质量重排序,碰撞率较主流扩散规划器降低 56%。

  8. UniDriveVLA:基于 Mixture-of-Transformers 的自动驾驶架构
    arXiv 2026自动驾驶

    UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

    Yongkang Li, Lijun Zhou, Sixu Yan, Bencheng Liao, Tianyi Yan, Kaixin Xiong, Long Chen, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Wenyu Liu, Xinggang Wang*

    基于 Mixture-of-Transformers 的统一驾驶视觉-语言-动作模型,将驾驶理解、场景感知与动作规划解耦到三个专家网络,通过掩码联合注意力协同工作。

  9. MoDA:混合深度注意力架构与可见性关系
    arXiv 2026高效 LLM

    MoDA: Mixture-of-Depths Attention

    Lianghui Zhu, Yuxin Fang, Bencheng Liao, Shijie Wang, Tianheng Cheng, Zilong Huang, Chen Chen, Lai Wei, Yutao Zeng, Ya Wang, Yi Lin, Yu Li, Xinggang Wang*

    深度扩展注意力原语:每个注意力头同时关注当前层序列 KV 与前序层的深度 KV,配套硬件高效的 Triton kernel,在 64K 序列长度下达到 FlashAttention-2 的 97.3% 效率。

  10. Senna-2:对齐 VLM 与端到端驾驶策略
    arXiv 2026自动驾驶多模态大模型

    Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

    Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang*

    显式对齐 VLM 高层决策与端到端策略低层规划的驾驶模型,通过面向一致性的三阶段训练与 3DGS 环境中的层次化强化学习,显著提升开环与闭环驾驶安全性。

  11. DriveLaW:在潜在驾驶世界中统一规划与视频生成
    CVPR 2026自动驾驶世界模型

    DriveLaW: Unifying Planning and Video Generation in a Latent Driving World

    Tianze Xia, Yongkang Li#, Lijun Zhou#, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang*

    统一视频生成与运动规划的驾驶世界模型:将视频生成器的隐表征直接注入扩散规划器,在 nuScenes 视频预测与 NAVSIM 规划上均达到最先进水平。

  12. DiffusionVL:将自回归模型转换为扩散视觉语言模型
    ECCV 2026多模态大模型

    DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

    Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

    将任意自回归模型转换为扩散式视觉语言模型的框架,兼具自回归预训练的知识优势与扩散并行解码的效率优势。

  13. VTP:面向生成的视觉 tokenizer 可扩展预训练
    ECCV 2026生成模型

    VTP: Towards Scalable Pre-training of Visual Tokenizers for Generation

    Jingfeng Yao, Yuda Song, Yucong Zhou, Xinggang Wang

    统一的视觉 tokenizer 预训练框架,联合优化对比学习、自监督与重建目标,揭示生成性能随 tokenizer 预训练算力、参数与数据扩展的新 scaling law。

  14. InfiniteVL:线性注意力与稀疏注意力协同的无限输入视觉语言模型
    arXiv 2025多模态大模型

    InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models

    Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin, Qian Zhang, Wenyu Liu, Xinggang Wang*

    高效视觉语言模型:线性注意力维持紧凑的长期记忆,稀疏注意力保障精细视觉感知,支持恒定显存占用的无限输入流式理解。

  15. 4DLangVGGT:四维语言-视觉几何接地 Transformer
    arXiv 20253D / 4D 视觉

    4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer

    Xianfeng Wu, Yajing Bai#, Minghan Li, Xianzu Wu, Xueqi Zhao, Zhongyuan Lai, Wenyu Liu, Xinggang Wang*

    首个基于 Transformer 的前馈式四维语言接地框架,在单一架构中联合几何感知(StreamVGGT)与语言对齐(语义桥接解码器),无需逐场景优化即可泛化到动态场景。

  16. VGT:将预训练 VLM 转变为图像生成模型的视觉生成调优流程
    arXiv 2025生成模型多模态大模型

    VGT: Visual Generation Tuning

    Jiahao Guo#, Sinan Du#, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang*

    通过对齐 VLM 语义编码器与像素解码器(VGT-AE)并调优轻量流匹配头(VGT-AR),让任意预训练 VLM 获得视觉生成能力——GenEval 0.82、DPG-Bench 81.28,收敛提速 20 倍。

  17. MobileI2V:移动端快速高分辨率图生视频
    arXiv 2025生成模型

    MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices

    Shuai Zhang#, Bao Tang#, Siyuan Yu#, Yueting Zhu, Jingfeng Yao, Ya Zou, Shanglin Yuan, Li Yu, Wenyu Liu, Xinggang Wang*

    面向移动设备的 0.27B 图生视频模型——比 SVD-XT 小 5.55 倍且画质相当,移动端 2.24 秒生成 720p 视频,A100 上提速 199 倍。

  18. TransLight:图像引导的定制化光照控制
    ICML 2026生成模型

    TransLight: Image-Guided Customized Lighting Control with Generative Decoupling

    Zongming Li, Lianghui Zhu, Haocheng Shen, Longjin Ran, Wenyu Liu, Xinggang Wang

    图像引导的定制化光照控制:通过生成式解耦将任意参考图像的光照效果迁移到用户内容上,实现无需文本描述的精确重光照。

  19. LENS:统一强化推理的万物分割
    AAAI 2026图像分割多模态大模型

    LENS: Learning to Segment Anything with Unified Reinforced Reasoning

    Lianghui Zhu, Bin Ouyang, Yuxuan Zhang, Tianheng Cheng, Rui Hu, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Li Yu, Wenyu Liu, Xinggang Wang

    统一强化推理的万物分割:多模态模型对复杂指代表达进行推理并输出精确分割掩码,全流程以强化学习端到端训练。

  20. ReCogDrive:端到端自动驾驶的强化认知框架
    ICLR 2026自动驾驶多模态大模型

    ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

    Yongkang Li#, Kaixin Xiong#, Xiangyu Guo, Fang Li, Sixu Yan, Gangwei Xu, Lijun Zhou, Long Chen, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang*

    强化认知驾驶框架:认知增强的视觉语言模型与扩散规划器相结合,并通过 DiffGRPO 强化学习进一步提升轨迹的安全性与舒适性。

  21. GroundingSuite:与 RefCOCO、gRefCOCO、GranD 对比的多粒度像素接地任务
    ICCV 2025图像分割多模态大模型

    GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding

    Rui Hu#, Lianghui Zhu#, Yuxuan Zhang, Tianheng Cheng, Lei Liu, Heng Liu, Longjin Ran, Xiaoxin Chen, Wenyu Liu, Xinggang Wang*

    综合性的像素接地框架:基于 VLM 的自动标注流水线(比 GLaMM 快 4.5 倍)、956 万条多样指代表达的训练集,以及 3800 条精心构建的评测基准。

  22. OmniMamba:基于 Mamba-2 的统一多模态理解与生成架构
    ECCV 2026多模态大模型生成模型

    OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models

    Jialv Zou, Bencheng Liao, Qian Zhang, Wenyu Liu, Xinggang Wang*

    首个基于线性模型的统一多模态理解与视觉生成模型——仅用 2M 数据训练即具竞争力,长序列生成相比 Transformer 提速最高 119.2 倍、显存降低 63%。

  23. LightningDiT:VA-VAE 对齐潜空间扩散系统的 ImageNet-256 生成样本
    CVPR 2025生成模型

    LightningDiT & VA-VAE: Taming the Reconstruction-Generation Dilemma in Latent Diffusion Models

    Jingfeng Yao, Bin Yang, Xinggang Wang

    将 VAE 潜空间与视觉基础模型对齐(VA-VAE),配合增强版 DiT 基线(LightningDiT)——ImageNet-256 上 FID 1.35、rFID 0.28,收敛比原版 DiT 快 21.8 倍(64 个 epoch 即达 FID 2.11)。CVPR 2025 Oral。

  24. GaussTR:基础模型对齐的高斯 Transformer 自监督三维空间理解
    CVPR 20253D / 4D 视觉

    GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding

    Haoyi Jiang, Liu Liu, Tianheng Cheng, Xinjie Wang, Tianwei Lin, Zhizhong Su, Wenyu Liu, Xinggang Wang

    自监督三维空间理解:将基于高斯的三维表征与基础模型特征对齐,无需人工三维标注即可实现开放词汇的三维感知。

  25. DiffusionDrive:端到端自动驾驶的截断扩散模型
    CVPR 2025自动驾驶

    DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving

    Bencheng Liao, Shaoyu Chen, Haoran Yin, Bo Jiang, Cheng Wang, Sixu Yan, Xinbang Zhang, Xiangyu Li, Ying Zhang, Qian Zhang, Xinggang Wang

    面向实时端到端驾驶的截断扩散策略,从锚定高斯先验出发仅需少量去噪步数即可生成多样、高质量的轨迹。

  26. Senna:连接大规模视觉语言模型与端到端自动驾驶
    IJCV 2026自动驾驶多模态大模型

    Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving

    Bo Jiang, Shaoyu Chen, Bencheng Liao, Xingyu Zhang, Wei Yin, Qian Zhang, Chang Huang, Wenyu Liu, Xinggang Wang

    连接大规模视觉语言模型与端到端自动驾驶的驾驶 VLM,将高层场景理解、推理与精确轨迹规划融为一体。

  27. ControlAR:自回归模型的可控图像生成
    ICLR 2025生成模型

    ControlAR: Controllable Image Generation with Autoregressive Models

    Zongming Li#, Tianheng Cheng#, Shoufa Chen, Peize Sun, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Wenyu Liu, Xinggang Wang*

    通过在控制序列上条件解码,为自回归图像生成模型加入空间控制(边缘、深度、分割图)——无需手工特殊 token,支持任意分辨率生成。

  28. DiG:门控线性注意力扩散模型的高分辨率生成样本
    CVPR 2025生成模型

    DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention

    Lianghui Zhu, Zilong Huang*, Bencheng Liao, Jun Hao Liew, Hanshu Yan, Jiashi Feng, Xinggang Wang*

    将门控线性注意力引入扩散骨干网络,参数开销极小——256² 分辨率下超越 DiT,高分辨率下效率优势显著:DiG-S/2 在 1792² 比 DiT-S/2 快 2.5 倍、省 75.7% 显存,DiG-XL/2 在 2048² 比 FlashAttention-2 版 DiT 快 1.8 倍。

  29. VADv2:基于概率规划的端到端自动驾驶
    ICLR 2026自动驾驶

    VADv2: End-to-End Autonomous Driving via Probabilistic Planning

    Bo Jiang, Shaoyu Chen, Hao Gao, Bencheng Liao, Qian Zhang, Wenyu Liu, Xinggang Wang

    端到端矢量化自动驾驶:从大规模驾驶示范中学习动作的概率分布,并采样一个动作控制车辆,无需规则包装即可稳定运行。

  30. EVA-X:面向胸部 X 光基础模型的自监督预训练流程
    npj Digital Medicine 2025医学影像

    EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-Supervised Learning

    Jingfeng Yao, Xinggang Wang*, Yuehao Song, Huangxuan Zhao, Jun Ma, Yajie Chen, Wenyu Liu, Bo Wang*

    首个同时捕捉语义与几何信息的 X 光自监督 ViT 基础模型,覆盖 20 余种胸部疾病,在 11 项以上检测任务中取得领先结果,并具备出色的少样本学习能力。

  31. MIM4D:多视角视频双重掩码建模与 3D 体渲染监督
    IJCV 2025自动驾驶3D / 4D 视觉

    MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning

    Jialv Zou#, Bencheng Liao#, Qian Zhang, Wenyu Liu, Xinggang Wang*

    面向多视角驾驶视频的双重掩码图像建模预训练范式,通过 3D 体素可微渲染监督伪 3D 特征——在 nuScenes 上提升端到端规划(碰撞率降 9%)、BEV 分割(+8.7% IoU)、3D 检测(+3.5% mAP)与高精地图构建(+1.4% mAP)。

  32. YOLO-World:实时开放词汇目标检测
    CVPR 2024检测与跟踪

    YOLO-World: Real-Time Open-Vocabulary Object Detection

    Tianheng Cheng, Lin Song, Yixiao Ge, Wenyu Liu, Xinggang Wang, Ying Shan

    实时开放词汇目标检测:通过可重参数化的 RepVL-PAN 与区域-文本对比预训练为 YOLO 注入视觉语言能力,LVIS 零样本检测达 35.4 AP / 52 FPS。

  33. Vision Mamba:双向状态空间模型的高效视觉表征学习
    ICML 2024视觉表征

    Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model

    Lianghui Zhu#, Bencheng Liao#, Qian Zhang, Xinlong Wang, Wenyu Liu, Xinggang Wang*

    基于双向状态空间模型的通用视觉骨干网络,以线性复杂度、无注意力机制达到 Transformer 级别的表征能力。

  34. 4DGaussians:实时动态场景渲染
    CVPR 20243D / 4D 视觉

    4D Gaussian Splatting for Real-Time Dynamic Scene Rendering

    Guanjun Wu#, Taoran Yi#, Jiemin Fang, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Qi Tian, Xinggang Wang*

    用高斯泼溅与紧凑的时空联合表征建模动态场景,实现高质量新视角合成的实时渲染。

  35. WeakTr:基于纯 ViT 与自适应注意力融合的弱监督语义分割框架
    IEEE TIP 2026图像分割

    WeakTr: Exploring Plain Vision Transformer for Weakly-Supervised Semantic Segmentation

    Lianghui Zhu#, Yingyue Li#, Jiemin Fang, Yan Liu, Xin Hao, Wenyu Liu, Xinggang Wang*

    探索纯 ViT 用于弱监督语义分割:以可学习的注意力头权重自适应融合自注意力图,端到端生成高质量 CAM,并配合梯度裁剪解码器在线重训练——VOC12 上 78.5% mIoU、COCO14 上 51.1% mIoU。

  36. MapTR:在线矢量化高精地图构建
    IJCV 2025自动驾驶3D / 4D 视觉

    MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction

    Bencheng Liao, Shaoyu Chen, Yunchi Zhang, Bo Jiang, Qian Zhang, Wenyu Liu, Chang Huang, Xinggang Wang

    在线矢量化高精地图构建的端到端框架,将地图元素建模为点集并通过层次化查询设计实现实时结构化地图学习。

  37. EVA:规模化掩码视觉表征学习的极限探索
    CVPR 2023视觉表征

    EVA: Exploring the Limits of Masked Visual Representation Learning at Scale

    Yuxin Fang#, Wen Wang, Binhui Xie, Quan Sun, Ledell Wu, Xinggang Wang*, Tiejun Huang, Xinlong Wang*, Yue Cao*

    将掩码图像建模扩展到十亿参数级视觉 Transformer:仅用掩码图像建模预训练的原始 ViT 即可在大量下游视觉任务上达到最先进水平。

  38. ByteTrack:关联每一个检测框的多目标跟踪
    ECCV 2022检测与跟踪

    ByteTrack: Multi-Object Tracking by Associating Every Detection Box

    Yifu Zhang, Peize Sun, Yi Jiang, Dongdong Yu, Fucheng Weng, Zehuan Yuan, Ping Luo, Wenyu Liu, Xinggang Wang

    简单而高效的多目标跟踪:关联每一个检测框而非仅高分框,从低分检测中找回真实目标并过滤背景,已成为集成进 YOLOv8 等框架的标准跟踪器。

  39. FairMOT:多目标跟踪中检测与重识别的公平性
    IJCV 2021检测与跟踪

    FairMOT: On the Fairness of Detection and Re-Identification in Multiple Object Tracking

    Yifu Zhang#, Chunyu Wang, Xinggang Wang*, Wenjun Zeng, Wenyu Liu

    一站式多目标跟踪器:在同构网络中公平地平衡检测与重识别两个任务,解决了将重识别作为次要任务所带来的固有偏差。

  40. CCNet:语义分割的十字交叉注意力
    TPAMI 2023图像分割

    CCNet: Criss-Cross Attention for Semantic Segmentation

    Zilong Huang#, Xinggang Wang#*, Yunchao Wei, Lichao Huang, Humphrey Shi, Wenyu Liu, Thomas Huang

    十字交叉注意力以稀疏的十字路径替代稠密注意力捕获全图上下文,是分割领域广泛使用的高效长程依赖模块,并被 AlphaFold 采用。