在行动前,先推演世界
联合建模环境的未来演化与动作生成,让未来二维视觉和三维空间状态成为当前决策的训练信号。
- 3D WORLD
- LATENT FORESIGHT
我目前是同济大学硕士研究生,师从宋井宽教授,27年毕业;同时在上海人工智能实验室(AI Lab)进行科研实习,mentor 为马浩翔研究员。
我的研究聚焦VLA / WAM 基础模型与大模型 Infra, 重点探索 world dynamics 与 action generation 的联合建模,以及模型在不同任务、 场景和机器人本体间的泛化。相关工作覆盖 MoT 模型架构、大规模预训练、embodied data pipeline、distributed training,以及仿真 / 真机评测与部署。
联合建模环境的未来演化与动作生成,让未来二维视觉和三维空间状态成为当前决策的训练信号。
我的研究主要关注机器人如何理解空间与物理变化,并把已有经验迁移到新的任务、场景与机器人本体。围绕这一目标,我的工作涉及 VLA、WAM、Human–Robot Mutual Imitation、Latent Foresight 与高效模型部署,也包括早期在视觉学习和弱监督分割方向的探索。
01现有机器人基础模型通常直接从二维图像和语言指令预测动作,却较少显式描述动作将如何改变三维世界。WSA₁ 关注机器人能否在行动前形成对未来空间状态的判断,并让世界变化与动作生成彼此约束。
为此,WSA₁ 采用以三维为中心的 World–Spatial–Action 建模,在统一框架中连接未来二维视觉、未来三维世界状态与连续动作生成。它探索了一条利用大规模多源数据学习空间规律,并将这种理解迁移到不同任务和机器人本体的通用控制路径。
实验中,WSA₁ 在 RoboTwin 2.0 与 LIBERO 上分别取得 93.1% 和 98.2% 的成功率,并在真实机器人控制任务中相较代表性方法平均提升 20%。团队以 WSA₁ 为核心方案参加 CVPR 2026 RoboChallenge,最终获得总榜第 4,并取得高校团队最高排名。
02大规模人类视频和仿真数据为 VLA 预训练提供了可扩展的数据来源,但视角、外观与本体形态差异使这些经验很难直接迁移到真实机器人。MiVLA 从人手与机械臂之间共享的行为结构出发,探索如何将人类行为经验和机器人操作数据放进同一套预训练体系。
方法通过人机互模仿与双向动作空间对齐,让模型在不同本体的示范之间学习可迁移的行为表示。真实人类视频的行为真实性与仿真数据的任务多样性由此相互补充,帮助模型适应新的视角、场景外观和机器人平台。
03统一的 VLA 模型既需要保留视觉语言模型的语义理解能力,也需要学习物理动态和连续控制。直接加入像素级未来预测容易造成多目标干扰并增加推理成本,因此 InternVLA-A1.5 将“理解、预见、行动”组织为相互协同但职责清晰的能力。
模型在原生 VLM 骨干上持续学习视觉问答和子任务预测,并使用统一动作专家生成连续控制信号。未来信息由少量潜在查询在训练阶段提炼,部署时无需运行视频生成分支,从而兼顾复杂指令理解、长时序操作与实时控制。
04Transformer 中 Softmax 与 GeLU 的长尾激活,在低比特下难以用均匀或 Log2 的固定间隔表示,导致裁剪误差与舍入误差难以兼顾。CFQuant 移除激活量化区间的结构约束,通过 Lloyd-Max 迭代自适应学习量化值与决策边界,仅需少量校准样本,无需重新训练模型。
方法进一步用 ESA 对齐校准与推理分布,并以 MM-LUT 查表矩阵乘法加速低比特计算。Qwen3-8B 在 W4/A4 下的六项零样本平均准确率达 67.21%,较 PrefixQuant 提升 25.49 个百分点;DeiT-S 部署实验实现约 8× 模型压缩和 3.7× 端到端加速。
05小麦穗分割面临标注规模有限、采集条件差异大以及伪标签噪声累积等问题。这项工作以 Global Wheat 竞赛场景为背景,研究如何更充分地利用未标注数据,获得对复杂田间图像更稳健的语义分割模型。
方案以 SegFormer 为基础,结合两阶段混合训练、数据增强和迭代 teacher–student 自训练,在每轮训练中逐步修正伪标签并扩大有效监督。它更强调数据利用与训练流程的系统设计,也为类似的有限标注视觉任务提供了可迁移的思路。

Research Intern · 物理智能中心
参与下一代 VLA / WAM 基础模型研发,负责模型架构与训练方法的设计、实现和实验验证,持续推进预训练、微调与评测流程迭代。
研究 Muon 在 VLA 与 MoT 训练中的适用性,搭建 AdamW / Muon 参数分组和消融流程,从收敛性、训练吞吐、显存占用及下游性能等维度评估配置。
构建具身预训练数据自动标注 pipeline,基于 VLM 完成 subtask 切分与层级语义标注,并完善数据清洗、质量检查和训练格式转换流程。
参与真机实验测试与结果验证,协助完成模型在真实操作任务中的部署、测试和任务迭代优化。
负责 InternVLA-A1.5 实体 Demo 的方案设计与搭建,推动模型能力转化为可展示、可复现的真机演示。
算法工程师 · 具身智能方向
面向智能化服务场景,构建由 LLM / VLM 与 VLA 协同的“大脑—小脑”多模态双机械臂系统:LLM / VLM 负责理解视觉与自然语言输入,并将复杂指令拆解为可执行的原子任务;VLA 将原子任务映射为机械臂动作序列。基于 LLaMA-Factory 对 PaliGemma2-3B 进行任务拆解微调,接入 Whisper / CosyVoice 完成语音交互,并通过 ROS、HTTP 与多进程通信打通模型服务、双臂控制和执行反馈,实现时延可控的复杂人机协作。
相关成果:第一作者软件著作权 1 项;第一作者受理中专利 1 项。
CVPR 2026 Workshop · GigaBrain Challenge · Real-Robot Track
RoboChallenge 是 CVPR 2026 GigaBrain Challenge 的真实机器人评测赛道,基于 Table30 V2 开展全在线真机测试。参赛模型需要以单一模型完成 20+ 类多样化操作任务,综合检验感知、决策、控制与跨任务泛化能力。
MagicBot 团队以 WSA₁ 为核心方案参赛,最终在 100+ 支队伍中获得总榜第 4,并取得高校团队第 1。
CVPR 2026 Workshop · GigaBrain Challenge · Simulation Track
RoboTwin Track 面向 VLA 模型的仿真泛化评测,基准覆盖 50+ 个双臂协作任务与 5 种机器人平台,考察模型在复杂多任务操作中的泛化能力。
MagicBot 团队使用 WSA₁ 参赛,最终获得赛道第 3 名,官方得分 89.3。
Global Wheat 2025 · Full Semantic Segmentation
比赛聚焦复杂田间环境下的小麦器官像素级全语义分割,提供 1,096 张标注图像与 52,078 张未标注图像,重点考察低标注条件下的精细识别与跨环境泛化。
方案最终在 142 位参赛者中获得第 2 名,测试集 mIoU 为 0.7099;后续整理为第一作者扩展摘要,发表于 ICCV 2025 CVPPA Workshop。
VLA / WAM 基础模型 · 大模型 Infra · Robot Learning