跳到主要内容

关于我

ABOUT ME

我目前是同济大学硕士研究生,师从宋井宽教授,27年毕业;同时在上海人工智能实验室(AI Lab)进行科研实习,mentor 为马浩翔研究员。

我的研究聚焦VLA / WAM 基础模型大模型 Infra, 重点探索 world dynamics 与 action generation 的联合建模,以及模型在不同任务、 场景和机器人本体间的泛化。相关工作覆盖 MoT 模型架构、大规模预训练、embodied data pipeline、distributed training,以及仿真 / 真机评测与部署。

RESEARCH CONSTELLATION / 2026 AUTO 03S · 点击即停
WORLD–ACTION MODELING

在行动前,先推演世界

联合建模环境的未来演化与动作生成,让未来二维视觉和三维空间状态成为当前决策的训练信号。

  • 3D WORLD
  • LATENT FORESIGHT
查看 WSA₁
OBSERVATIONWORLD MODELACTION

论文与研究

PUBLICATIONS & RESEARCH

我的研究主要关注机器人如何理解空间与物理变化,并把已有经验迁移到新的任务、场景与机器人本体。围绕这一目标,我的工作涉及 VLA、WAM、Human–Robot Mutual Imitation、Latent Foresight 与高效模型部署,也包括早期在视觉学习和弱监督分割方向的探索。

WSA₁ 模型概览图
arXiv, 2026

WSA₁: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

Jiahao Jiang, Jianing Zhang, Zhenhan Yin, Ruidong Chen, et al.

现有机器人基础模型通常直接从二维图像和语言指令预测动作,却较少显式描述动作将如何改变三维世界。WSA₁ 关注机器人能否在行动前形成对未来空间状态的判断,并让世界变化与动作生成彼此约束。

为此,WSA₁ 采用以三维为中心的 World–Spatial–Action 建模,在统一框架中连接未来二维视觉、未来三维世界状态与连续动作生成。它探索了一条利用大规模多源数据学习空间规律,并将这种理解迁移到不同任务和机器人本体的通用控制路径。

实验中,WSA₁ 在 RoboTwin 2.0 与 LIBERO 上分别取得 93.1% 和 98.2% 的成功率,并在真实机器人控制任务中相较代表性方法平均提升 20%。团队以 WSA₁ 为核心方案参加 CVPR 2026 RoboChallenge,最终获得总榜第 4,并取得高校团队最高排名。

MiVLA 人机互模仿方法概览图
CVPR 2026 Findings

MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training

Zhenhan Yin, Xuanhan Wang, Jiahao Jiang, Kaiyuan Deng, Pengqi Chen, et al.

大规模人类视频和仿真数据为 VLA 预训练提供了可扩展的数据来源,但视角、外观与本体形态差异使这些经验很难直接迁移到真实机器人。MiVLA 从人手与机械臂之间共享的行为结构出发,探索如何将人类行为经验和机器人操作数据放进同一套预训练体系。

方法通过人机互模仿与双向动作空间对齐,让模型在不同本体的示范之间学习可迁移的行为表示。真实人类视频的行为真实性与仿真数据的任务多样性由此相互补充,帮助模型适应新的视角、场景外观和机器人平台。

InternVLA-A1.5 模型概览图
arXiv, 2026

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, et al., Jiahao Jiang, et al.

统一的 VLA 模型既需要保留视觉语言模型的语义理解能力,也需要学习物理动态和连续控制。直接加入像素级未来预测容易造成多目标干扰并增加推理成本,因此 InternVLA-A1.5 将“理解、预见、行动”组织为相互协同但职责清晰的能力。

模型在原生 VLM 骨干上持续学习视觉问答和子任务预测,并使用统一动作专家生成连续控制信号。未来信息由少量潜在查询在训练阶段提炼,部署时无需运行视频生成分支,从而兼顾复杂指令理解、长时序操作与实时控制。

CFQuant 无约束训练后量化框架概览图
《自动化学报》,录用,2026

针对低比特 Transformer 的无约束训练后量化

江佳浩,尹鹏,王轩瀚,曾鹏鹏,宋井宽

Transformer 中 Softmax 与 GeLU 的长尾激活,在低比特下难以用均匀或 Log2 的固定间隔表示,导致裁剪误差与舍入误差难以兼顾。CFQuant 移除激活量化区间的结构约束,通过 Lloyd-Max 迭代自适应学习量化值与决策边界,仅需少量校准样本,无需重新训练模型。

方法进一步用 ESA 对齐校准与推理分布,并以 MM-LUT 查表矩阵乘法加速低比特计算。Qwen3-8B 在 W4/A4 下的六项零样本平均准确率达 67.21%,较 PrefixQuant 提升 25.49 个百分点;DeiT-S 部署实验实现约 8× 模型压缩和 3.7× 端到端加速。

小麦穗语义分割方法与结果图
ICCV 2025 CVPPA Workshop

Pseudo-Label Refinement for Robust Wheat Head Segmentation via Two-Stage Hybrid Training

Jiahao Jiang, Zhangrui Yang, Xuanhan Wang, Jingkuan Song

小麦穗分割面临标注规模有限、采集条件差异大以及伪标签噪声累积等问题。这项工作以 Global Wheat 竞赛场景为背景,研究如何更充分地利用未标注数据,获得对复杂田间图像更稳健的语义分割模型。

方案以 SegFormer 为基础,结合两阶段混合训练、数据增强和迭代 teacher–student 自训练,在每轮训练中逐步修正伪标签并扩大有效监督。它更强调数据利用与训练流程的系统设计,也为类似的有限标注视觉任务提供了可迁移的思路。

工作与实习经历

EXPERIENCE
EXP / 01

上海人工智能实验室

Research Intern · 物理智能中心

01
PRIMARY WORK

InternVLA-A2 核心研发

参与下一代 VLA / WAM 基础模型研发,负责模型架构与训练方法的设计、实现和实验验证,持续推进预训练、微调与评测流程迭代。

PROJECT VIDEOInternVLA-A1.5 · Model Overview01:42
  1. 02
    Muon 优化器研究

    研究 Muon 在 VLA 与 MoT 训练中的适用性,搭建 AdamW / Muon 参数分组和消融流程,从收敛性、训练吞吐、显存占用及下游性能等维度评估配置。

  2. 03
    具身数据自动标注

    构建具身预训练数据自动标注 pipeline,基于 VLM 完成 subtask 切分与层级语义标注,并完善数据清洗、质量检查和训练格式转换流程。

  3. 04
    InternVLA-A1.5 真机验证

    参与真机实验测试与结果验证,协助完成模型在真实操作任务中的部署、测试和任务迭代优化。

  4. 05
    实体 Demo

    负责 InternVLA-A1.5 实体 Demo 的方案设计与搭建,推动模型能力转化为可展示、可复现的真机演示。

EXP / 02

上海码极客人工智能科技有限公司

算法工程师 · 具身智能方向

PROJECT VIDEO多模态双机械臂协作系统 · 项目演示01:43
PROJECT / 项目工作

“大脑—小脑”多模态双机械臂协作系统

面向智能化服务场景,构建由 LLM / VLM 与 VLA 协同的“大脑—小脑”多模态双机械臂系统:LLM / VLM 负责理解视觉与自然语言输入,并将复杂指令拆解为可执行的原子任务;VLA 将原子任务映射为机械臂动作序列。基于 LLaMA-Factory 对 PaliGemma2-3B 进行任务拆解微调,接入 Whisper / CosyVoice 完成语音交互,并通过 ROS、HTTP 与多进程通信打通模型服务、双臂控制和执行反馈,实现时延可控的复杂人机协作。

相关成果:第一作者软件著作权 1 项;第一作者受理中专利 1 项。

竞赛与荣誉

COMPETITIONS & AWARDS

CVPR GigaBrain Challenge · RoboTwin Track

CVPR 2026 Workshop · GigaBrain Challenge · Simulation Track

最终成绩
第 3 名
官方得分
89.3
赛事介绍

RoboTwin Track 面向 VLA 模型的仿真泛化评测,基准覆盖 50+ 个双臂协作任务与 5 种机器人平台,考察模型在复杂多任务操作中的泛化能力。

参赛表现

MagicBot 团队使用 WSA₁ 参赛,最终获得赛道第 3 名,官方得分 89.3。

Global Wheat Full Semantic Segmentation Competition

Global Wheat 2025 · Full Semantic Segmentation

最终成绩
2 / 142
测试 mIoU
0.7099
成果发表
ICCV CVPPA
赛事介绍

比赛聚焦复杂田间环境下的小麦器官像素级全语义分割,提供 1,096 张标注图像与 52,078 张未标注图像,重点考察低标注条件下的精细识别与跨环境泛化。

参赛表现

方案最终在 142 位参赛者中获得第 2 名,测试集 mIoU 为 0.7099;后续整理为第一作者扩展摘要,发表于 ICCV 2025 CVPPA Workshop。

CONTACT / 联系

研究交流与合作

VLA / WAM 基础模型 · 大模型 Infra · Robot Learning