VLA · 连续操作Qwen-RobotManip
把 Qwen-VLA 往机械臂操作推进,重点是多本体 state-action 对齐与操作数据规模化。
- Qwen3.5-4B VL backbone + flow-matching DiT action expert。
- 80 维 canonical state-action vector:左右臂、EEF、夹爪、灵巧手固定语义槽位。
- camera-frame EEF delta 减少跨本体几何冲突。
- human-to-robot synthesis 与开源机器人轨迹共同构成约 38,100 小时操作预训练语料 ⚠️。
判断:数据对齐是关键贡献,但最终目标仍是 manipulation policy。
