一、行业痛点:机器人的 “物理经验缺口”

ChatGPT 可以流畅读写、大模型能看懂图文,但通用机器人拿起桌上水杯却频频失败。

根本原因在于:大模型生长在符号世界,依托海量文本、图像完成学习;而机器人身处真实物理空间,极度缺少人类空间判断、抓取避障的多模态示范数据,也就是「物理经验断层」。

同时,当前两条路线均存在明显短板:传统编程机器人只能固定场景复用;纯自主抓取算法在杂乱、薄件场景容错率极低。

论文视频:MR双臂遥操作 + Point-and-Grasp

针对这一双重痛点,西班牙瓦拉多利德大学联合 CARTIF 发布《Intuitive bimanual teleoperation in mixed reality with assisted grasp autonomy》MR 双臂遥操作框架,搭建人机共享控制体系,同时解决两大核心需求:

  1. 操作侧降低普通人遥操作门槛,零基础人员也能远程操控双臂机器人;
  2. 算法侧构建标准化示教数据链路,每次操控自动生成 VLA、模仿学习可用的完整操作数据,打通「人类意图 - 3D 感知 - 自主抓取 - 真机执行」完整 Physical AI 闭环。

二、系统核心架构:三层虚实协同链路

整套 MR 共享控制框架总图

整套平台由交互层、感知层、机器人控制层双向联动,依靠 TCP/IP 实现 Unity 与 ROS 实时数据互通:

1、交互层(Meta Quest 3 MR 头显)
捕捉人手六维运动,映射机械臂末端速度;提供三种可视化反馈,实测双目立体视觉综合效果最优

2D/点云/立体视觉三组视觉模态对比图

  • 2D 视频:画面直观,但缺少深度,易误判距离;
  • 点云重建:具备三维几何,但噪点多、轮廓破碎;
  • 双目立体视觉:保留真实纹理 + 原生深度感知,任务耗时减少 40%,操作负荷最低,可用性评分 87.25。

2、感知层(ZED Mini RGB-D 相机)

同步输出 RGB 图像与深度图,完成场景稠密点云重建,配合 SAM 模型实现目标物体实例分割,为抓取规划提供完整三维几何信息。

3、执行层(Kinova Gen3 双臂协作机器人)
ROS+MoveIt 负责运动解算、轨迹规划;支持双臂物体传递、精细堆叠、取放等复合操作,适配各类平行夹爪。

三、核心创新:Point-and-Grasp 一键自主抓取管线

本论文最大亮点是几何驱动的辅助抓取模式,操作员仅需在 MR 视野射线点选物体,系统全自动完成抓取全流程:

Point-and-Grasp 抓取全流程示意图
  1. 射线交点 3D 反投影,生成分割种子点;
  2. SAM 分割目标,提取独立物体点云 + 全局场景点云(用于碰撞检测);
  3. 围绕物体几何采样 525 组抓取候选姿态,自动旋转、后退规避碰撞;
  4. 六维可解释几何准则加权打分,优先匹配物体主轴、抓取深度、夹持均衡度;
  5. 坐标转换至机器人基坐标系,机械臂自主执行无碰撞抓取。
算法真机实测对比(40 组杂乱桌面场景)

抓取方案

成功率

算力需求

核心优势

本文

Point-and-Grasp

92.5%

仅 CPU

无域偏移,薄小件稳定性强

GPD

87.5%

可选 GPU

成熟采样,但窄间隙易失效

Contact-GraspNet/HGGD

70%~80%

强制 GPU

遮挡场景缺少可行 3D 抓取位姿

启用辅助抓取后,四类标准操作任务(取放 / 旋转 / 堆叠 / 双臂传递)完成时长平均缩短 30%,抓取尝试次数、主观操作负荷显著下降。

四大标准化实操任务实拍

四、为什么这套系统是 Physical AI 优质基础设施

1. 搭建「人类经验→机器人数据→AI 模型」闭环
  • 旧方案:固定代码驱动机器人,仅适配单一标准化场景,无泛化数据产出;
  • 新方案:MR 示教同步录制 RGB-D、点云、关节轨迹、抓取决策全量数据,直接用于模仿学习、VLA 视觉动作模型训练;
  • 未来方向:海量人类示范数据训练具身基础模型,机器人自主理解语言指令完成复杂操作。
2.标准化硬件平台三位一体组合

  • ZED Mini双目3D相机:机器人三维感知 “眼睛”,近距高精度 RGB-D 输出,低延迟支撑 MR 虚实融合与抓取几何计算;
  • Kinova Gen3双臂机器人:高精度执行本体,7 轴冗余自由度,原生适配 ROS,安全轻量化,支撑双臂协同精细操作;
  • MR 遥操作系统:人类经验输入入口,低成本批量生成高质量示教数据。

三者组合适配高校实验室、具身 AI 创业公司算法迭代、工业机器人预研场景。

五、现存局限与未来研发方向

论文客观标注系统边界,也是行业通用突破点:

  1. 仅单 RGB-D 视角,物体遮挡 / 背面无几何信息,少数姿态抓取失效;
  2. 纯视觉规划,未接入力觉、触觉反馈,无法自适应柔性物体、防滑抓取;
  3. 仅抓取环节自动化,放置、工具连续操作仍依赖人工引导。

后续优化路线:多视角主动补全三维模型、集成六维力 / 指尖触觉、接入视觉语言大模型实现全流程任务自主规划。

结尾总结

未来机器人赛道的核心壁垒不再是硬件参数,而是高质量人类操作数据集储备。
MR 人机共享控制平衡了人类高层意图与机器底层自主运算,依托双目 3D 视觉 + 双臂协作机器人,构建低成本、高稳定的 Physical AI 数据工厂,是人形、协作机器人研发的新一代虚实融合操作底座。

参考文献

论文原文:https://www.sciencedirect.com/science/article/pii/S0262885626002179

抓取开源代码:https://github.com/MiguelGarciaUVa/PointAndGrasp

欢迎关注 “欣佰特科技” ,持续为大家带来 “具身智能领域”前沿技术及应用!详情可邮件咨询sales@cnbestec.com

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐