本团队与合作者开源的研究系统,涵盖具身智能与机器人操作、自动驾驶、生成模型以及高效多模态基础模型等方向。
# 共同一作* 通讯作者
任务自适应的视觉-语言-抓取框架,将物理抓取合成与任务理解解耦,通过可组合的基础模型先验实现跨不同机械手的泛化抓取。
超越 RGB 的世界动作模型:将未来预测重构为结构化世界建模,从外观、运动、几何、语义四个互补视角表征未来状态,实现稳健的机器人操作。
首个面向自动驾驶世界动作模型的表示学习框架,无需外部编码器与教师模型,仅增加 0.3% 训练开销,显式优化从世界到动作的隐表征通路。
0.2B 轻量级图像修复框架,性能达到 10B 级别模型水平。
基于 Mixture-of-Transformers 的统一驾驶视觉-语言-动作模型,将驾驶理解、场景感知与动作规划解耦到三个专家网络,通过掩码联合注意力协同工作。
闭环驾驶的生成器-判别器框架:扩散生成器产生多样化候选轨迹,强化学习优化的判别器按长期驾驶质量重排序,碰撞率较主流扩散规划器降低 56%。
显式对齐 VLM 高层决策与端到端策略低层规划的驾驶模型,通过面向一致性的三阶段训练与 3DGS 环境中的层次化强化学习,显著提升开环与闭环驾驶安全性。
统一视频生成与运动规划的驾驶世界模型:将视频生成器的隐表征直接注入扩散规划器,在 nuScenes 视频预测与 NAVSIM 规划上均达到最先进水平。
首个基于 Transformer 的前馈式四维语言接地框架,在单一架构中联合几何感知(StreamVGGT)与语言对齐(语义桥接解码器),无需逐场景优化即可泛化到动态场景。
图像引导的定制化光照控制:通过生成式解耦将任意参考图像的光照效果迁移到用户内容上,实现无需文本描述的精确重光照。
统一强化推理的万物分割:多模态模型对复杂指代表达进行推理并输出精确分割掩码,全流程以强化学习端到端训练。
强化认知驾驶框架:认知增强的视觉语言模型与扩散规划器相结合,并通过 DiffGRPO 强化学习进一步提升轨迹的安全性与舒适性。
自监督三维空间理解:将基于高斯的三维表征与基础模型特征对齐,无需人工三维标注即可实现开放词汇的三维感知。
端到端矢量化自动驾驶:从大规模驾驶示范中学习动作的概率分布,并采样一个动作控制车辆,无需规则包装即可稳定运行。
实时开放词汇目标检测:通过可重参数化的 RepVL-PAN 与区域-文本对比预训练为 YOLO 注入视觉语言能力,LVIS 零样本检测达 35.4 AP / 52 FPS。
用高斯泼溅与紧凑的时空联合表征建模动态场景,实现高质量新视角合成的实时渲染。