💭 Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA
Published in Arxiv, 2026
Arxiv地址:https://arxiv.org/abs/2607.26807
Project Page:https://gleeacast.github.io/KinRT/
GitHub:https://github.com/gleeacast/KinRT
1. 关键词 (Keywords)
- Vision-Language-Action (VLA) / 视觉-语言-动作模型
- Mixture-of-Experts (MoE) / 混合专家
- Kinematics-Supervised Routing / 运动学监督路由
- Kinematic Archetype / 运动学原型
- Learning Using Privileged Information (LUPI) / 特权信息学习
- Flow-Matching Action Generation / 流匹配动作生成
- Robot Manipulation / 机器人操作
- DIYRobot / 低成本双臂实机平台
2. 背景与动机 (Background & Motivation)
问题定义
VLA 模型希望在同一策略中统一视觉感知、语言理解和连续动作生成。但随着操作任务增多,不同任务的运动学结构可能完全不同:单臂抓放、双臂交接、接触拖拽与腕部旋转对动作模式的要求差异很大。将这些模式压缩在一组密集参数中,容易造成多任务梯度干扰与少数运动模式学习不足。
MoE 为这个问题提供了自然的容量拆分机制,但关键不只是“有多个专家”,而是“路由器是否把每个样本交给了合适的专家”。传统 MoE 路由通过任务损失隐式学习,输入主要是视觉与语言表示;而机器人操作中真正决定专家分工的信号,往往是动作轨迹的运动学结构。
核心矛盾:外观相似不等于动作相似
论文用两类错位说明观测空间不适合直接充当运动专家的分组依据:
- “抬起杯子”与“拧开杯盖”的视觉场景很接近,但动作轨迹不同;
- “推盘子”与“推书”的物体外观不同,却可共享运动学模式。
难点在于,作为最直接监督信号的未来动作轨迹在部署时并不存在。因此,KinRT 的问题可以概括为:能否在训练时用动作运动学教会路由器,却在推理时只依赖当前的视觉-语言观测完成专家分派?

Figure 1 展示了“运动学原型收缩”:语义不同的操作任务并不需要一任务一专家,大量动作帧会收缩到少量共享的运动模式。这一观察是 KinRT 设定少量运动学专家、而不是为每个任务建立独立专家的出发点。
3. 核心方法 (Core Methodology)
整体思路:用动作监督路由,用观测执行路由
KinRT 是一篇以路由学习为核心的 model/method paper,同时贡献了 DIYRobot 实机平台与配套评测数据。其主线是一个非对称桥接机制:
- 离线观察训练集中的未来动作块,提取位置和速度特征;
- 将动作帧聚类为少量运动学原型,把原型 ID 当作 router 的显式标签;
- 训练 router 从视觉-语言上下文预测运动学原型;
- 部署时只计算一次全局路由,后续的 flow-matching 去噪循环使用选中专家生成动作。

Figure 2 把这条链路分成“训练期动作空间建标签”与“部署期观测空间做路由”两部分。它支持的核心判断是:KinRT 不是把未来动作偷渡到推理输入,而是将训练期可见的运动学结构蒸馏到观测条件下的路由判断中。
基础架构:共享分支 + 路由专家
策略使用 18 层 Transformer block。前缀流用冻结的 SigLIP 编码多视角图像,并通过冻结的 PaliGemma-2B 生成语言/视觉上下文;后缀流结合 Gemma-300M 与 MoE 扩展生成连续动作块。
动作头每层的 FFN 被拆为两个并行分支:
- shared branch:始终激活预训练 FFN,保留通用能力与稳定初始化;
- routed branch:从 4 个宽度为
d_model = 1024、d_mlp = 4096的专家中做 Top-1 选择,学习增量运动专业化。
两个分支固定以 1/2 : 1/2 融合。这样的目的不是用稀疏专家取代原策略,而是让专家只学不同运动模式之间的增量差异。
运动学原型构建
对每个时刻,KinRT 取未来 H = 50 步的 14 维动作:左/右机械臂各 6 维,左/右夹爪各 1 维。位置序列展平后为 700 维,相邻动作之差构成 686 维速度特征,二者拼接成 1386 维描述子。随后依次进行标准化、PCA 降到 64 维、帧级 K-means 聚类。
在 RoboTwin 的 162,545 个动作帧上,论文使用 4 个原型:
- Cluster 0(36.3%):左臂主导的早-中期准备阶段;
- Cluster 1(46.0%):右臂主导的中-后期执行阶段;
- Cluster 2(4.4%):大幅度双臂协同,也是最少见、最复杂的模式;
- Cluster 3(13.3%):主要对应红色积木交接任务的特定模式。
因此,4 个专家不与 8 个任务一一对应,而与 4 类动作阶段/原型对齐。
全局路由与显式监督
原始视觉-语言表示之间的余弦相似度高于 0.95,区分度不足。KinRT 将 PaliGemma 所有有效前缀 token 做 masked mean pooling,得到 2048 维上下文向量,再通过一个线性层预测原型分布。
路由决策只计算一次,并广播到全部 18 层,而不是每层独立路由。训练时,原型 ID 通过交叉熵直接监督 router;同时在 logits 上加入探索噪声,推理时关闭噪声。由于原型分布明显不平衡,训练还使用 α = 0.5 的重采样:它介于完全保留原分布(α = 0)与类别均匀采样(α = 1)之间。
观测条件下的动作生成
路由器选定专家后,动作头仍使用 flow matching 生成 50 步动作块。训练时将干净动作与高斯噪声混合,时间步从 Beta(1.5, 1) 采样,用 MSE 拟合从动作指向噪声的速度场。推理时,视觉-语言前缀只计算一次路由,各去噪步共享同一组专家与路由权重。
4. 实验设计 (Experimental Design)
数据集与平台
- RoboTwin:8 个机器人操作任务;每个任务在 Clean 与 Random 设定下各有 50 条训练演示,共 800 条。每个任务、每种设定测试 100 次,每个模型共 1,600 次仿真测试。
- DIYRobot:作者用 3D 打印构建的 14-DoF 双臂机器人,整体成本低于 2,000 美元。基准包含 Handover Pen、Pick Box、Rotate Screwdriver、Pull Bottle 和 Press Button 5 个任务,每个任务 100 条演示,共 500 条;评测时每个任务运行 50 次。
训练设置与对比方法
对比包括密集 VLA(OpenVLA、RDT-1B、π0、π0.5)与 MoE VLA(Hi-MoE、AdaMoE),并将 KinRT 接入 OpenVLA、π0 和 AdaMoE 以检验是否依赖特定 backbone。论文同时报告 full-parameter 与 LoRA 微调;LoRA rank 对视觉-语言 backbone/动作专家分别为 32/64,LoRA alpha 为 1。
论文的统一训练设置为 10,000 optimization steps、effective batch size 32、两张 NVIDIA L20,动作 horizon 为 50。KinRT 使用 4 个专家、Top-1 路由、路由监督 loss coefficient 0.05 和重采样系数 0.5,未叠加 load-balancing、contrastive-routing 或 dead-expert 正则。两个基准的主指标都是每任务成功次数及其平均值。
5. 实验结果与分析 (Results & Analysis)
主结果:密集、隐式 MoE 与 KinRT

Table 1 中的数值是“平均成功次数”,需结合每个任务的测试次数解读,不应直接把 40.8 当作任意口径下的通用百分比:
- RoboTwin Clean / Random:KinRT-LoRA 达到 40.8 / 38.8,相比最强密集对照 π0.5-LoRA 的 33.1 / 34.1,绝对提升为 +7.7 / +4.7,相对提升为 23.26% / 13.78%。
- DIYRobot:KinRT-Full 达到 35.6/50,高于最强密集对照 π0.5-Full 的 29.6/50,绝对提升 +6.0,相对提升 20.27%。
- 显式路由 vs. 隐式路由:AdaMoE 在 RoboTwin 上为 32.1 / 29.4、DIYRobot 上为 21.4;对应的 KinRT 主结果分别提高 +8.7 / +9.4 和 +14.2 次成功。Hi-MoE 的平均结果只有 6.8 / 6.4 和 8.0,表明“扩成 MoE”本身并不保证有效专业化。
结果更强的支持是:运动学标签作为路由监督在两个平台上都优于所列密集与隐式 MoE 对照。它并不单独证明了“所有 VLA 都应该使用 4 个专家”,也没有将跨更多机器人构型的泛化问题完全解决。
可插拔性与 sim-to-real 适配差异
KinRT 接入其他 backbone 后仍有一致改善:
- π0-LoRA:
13.9 / 12.6 → 15.8 / 14.4; - π0-Full:
8.9 / 8.8 → 11.1 / 10.8; - OpenVLA:
4.1 / 4.4 → 7.6 / 6.5; - AdaMoE 在 DIYRobot 上:
21.4 → 28.4。
另一个值得保留的结论是 full fine-tuning 和 LoRA 的排名并不一致:RoboTwin 上 KinRT-LoRA 的 40.8 / 38.8 高于 KinRT-Full 的 36.0 / 28.9,但 DIYRobot 上 KinRT-Full 的 35.6 高于 KinRT-LoRA 的 23.8。论文将其解释为:仿真中 LoRA 的参数效率与正则化更有利,实机数据与预训练分布差异更大时,full fine-tuning 需要更强的适配容量。这是基于当前两个基准的经验解释,不应视为已证明的普遍规律。
平衡采样消融

Table 2 中,α = 0.5 的 RoboTwin Clean 平均成功次数为 40.8,高于不平衡重采样的 α = 0(34.4)和完全均匀采样的 α = 1(36.6)。这说明两个极端都有代价:保留原分布会让少数原型训练不足,完全拉平分布又会过度扰动主流动作模式;例如 Open Laptop 在 α = 1 时从 84 降到 72。
路由标签来源消融

Table 3 是对核心假设更直接的验证。用 VLM 表示聚类只得到 21.8,动作范围、使用哪条机械臂、任务 ID、速度和绝对动作分别为 23.8 / 26.8 / 26.0 / 27.0 / 33.0;将绝对动作与速度结合后达到 40.8。这表明空间位形与时序变化是互补信号,而手工任务类别会错过“任务不同但动作同构”和“同一任务内动作分阶段”的结构。
表示空间与运动学空间的错位

Figure 3 给出 Table 3 背后的机制性证据:VLM 表示的样本对余弦相似度几乎全部挤在 [0.96, 1.00],但在固定的 VLM 相似度下,运动学相似度仍能跨越 [-0.75, 1.0]。按 KinRT 原型分组后,组内运动学相似度分布明显更紧凑。这个图支持“VLM 相似度无法替代运动学监督”,但它本身仍是当前数据分布上的表示统计,不是对所有 VLM 表示的普遍否定。
实机案例

Figure 4 给出 Handover Pen、Pick Box、Press Button、Pull Bottle 和 Rotate Screwdriver 的时序帧,覆盖双臂交接、抓取后重定向、精细垂直定位、持续接触拖拽与手腕旋转。它表明方法确实运行在物理平台上,但精选成功序列不能代替 Table 1 的完整成功次数,也不能单独证明鲁棒性。
6. 总结与贡献 (Conclusion & Contribution)
KinRT 的关键贡献不是又增加一种 MoE 结构,而是重新定义了 VLA 中“专家应该因何而分工”:不按外观、语言或手工任务 ID 分组,而按动作与速度共同描述的运动学同构性分组。它把 LUPI 思路用在 router 而不是策略输出上,从而实现“训练时看动作、部署时只看观测”。
论文的主要证据包括:在 RoboTwin 与 DIYRobot 上同时超过所列密集和隐式 MoE 对照;对 OpenVLA、π0 与 AdaMoE 的插件式改善;以及聚类标签消融中 action + velocity 相比 VLM 表示的 40.8 vs. 21.8。其中最具诊断价值的是后一点:它不只说方法更好,还将改善与“观测语义不能稳定表征动作同构性”的设计动机对齐起来。
我会把这项工作看成一个有明确归纳偏置的路由方法,而不是通用 VLA 规模化结论。它最值得继续追踪的问题是:当动作空间、机器人形态与任务时域大幅扩展时,运动学原型能否继续保持少量、稳定且可迁移,以及路由错误如何被可观测地诊断。