# 1、Virtual Reality-based Solo Teleoperation for Aerial Manipulator Collaboration System **作者**:Jiayu Liu **会议**:International Conference on Guidance, Navigation and Control, 2024•Springer --- **背景**:空中机械臂系统(Aerial Manipulator System, AMS)由配备机械臂的无人机(UAV)组成,与传统无人机相比,它支持与环境的主动交互,因此具有更广泛的应用潜力,包括运输、抓取和维护等复杂的空中作业,能够替代工人在危险的空中任务中工作。 **目的**:针对上述问题(分散的控制和沉重的认知负担),本文旨在建立一个**基于虚拟现实(VR)技术的“一体化”(all-in-one)AMS遥操作框架**,创新性地提出一种遥操作方案,**仅需一名未经事先培训的操作员**即可控制AMS完成空中任务。 为实现这一目标,该方案主要采用以下方法: 1. 利用Unity开发数字孪生模型,提供沉浸式场景(在头戴式显示器(HMD)中),使操作员和AMS共享相同的观察和动作空间。 2. 利用VR控制器和追踪器提供的直观操作方法,即使操作员**仅用一只手臂**,也能直观地控制机械臂的状态,即使其运动学未知。 3. 提供一种**无人机与机械臂协同规划**的方法,利用机械臂的运动意图来指导无人机的位置,从而使机械臂能够在舒适的区域内操作。 **结果与讨论**: * **实时性和精度:** 实验结果(如图 6 所示)表明,该系统在机械臂控制方面具有**良好的实时性和准确性**,这确保了空中操作的高精度。 * **位置跟踪和鲁棒性:** 尽管机械臂的运动给AMS带来了一定的干扰,但**位置仍能被跟踪**,且AMS能够到达目标点附近执行接触任务。 * **系统验证:** 实验验证了所提出的遥操作系统具有**鲁棒的协同能力**。此外,实验验证了该遥操作系统能够使**未经培训的操作员有效地控制AMS执行空中任务**。 **结论**: 本文提出了一种**基于VR的遥操作系统,以提高AMS的操作质量**。 * 该系统利用Unity强大的图形渲染和数据传输能力,建立了**高保真度的数字孪生模型**。 * 通过利用VR技术的沉浸式和交互式特性,实现了**直观的控制方案**。 * 实验结果表明,**即使未经培训的操作员也能有效地控制AMS执行任务**,证明了该系统的**可靠性和鲁棒性**。 [zotero阅读注释](./zotero_comment/Virtual Reality-based Solo Teleoperation for Aerial Manipulator Collaboration System.md) # 2、End-to-End Training of Deep Visuomotor Policies **作者**:Levine **会议**:arxiv(Robot Learning的开山之作) --- **背景**:机器人要实现自主操作,设计其感知和控制软件仍然是一个重大挑战,即使是对于基础任务也是如此。现有挑战如下: * 依赖手工设计组件: 传统的策略搜索(Policy search)方法通常依赖于许多**手工设计的组件**来进行感知、状态估计和低级控制。特别地,视觉系统通常很复杂且容易出错,并且在策略训练期间通常不会改进或适应任务目标。 * 深度学习的挑战:尽管深度神经网络(DNNs)在计算机视觉和语音识别等领域取得了巨大成功,但将其用于现实世界的传感器运动策略(例如,将图像像素和关节角度映射到电机扭矩的机器人控制器)面临独特的挑战。 * 数据稀缺与缺乏直接监督:成功的 DNN 应用通常需要**大量数据**和**直接监督**,这两者在机器人控制中都缺乏。现实世界中的机器人交互数据稀缺,且任务完成由高级别的成本函数定义,学习算法必须自行确定在每个时间点采取的动作。 * 不完全观测:机器人传感器的观测($o_t$)并不能提供完整的系统状态($x_t$),例如,任务相关物体的位置信息必须从摄像头图像中推断出来。 需要解决的核心问题是:**联合训练感知和控制系统是否能比分开训练提供更好的性能?** **目的**: 1. 开发端到端学习方法: 开发一种能够学习策略的方法,该策略将**原始图像观测 ($o_t$) 直接映射到机器人电机的扭矩 ($u_t$)**,实现感知和控制系统的联合训练。 2. 验证联合训练的优势:通过实验验证,**端到端训练**(即联合训练感知和控制系统)是否能为传感器运动控制获得比分开训练更有效的策略。 3. 应用引导策略搜索:利用**引导策略搜索 (Guided Policy Search, GPS)** 方法来训练复杂的深度卷积神经网络 (CNNs) 策略。GPS 将策略搜索问题转化为有监督学习问题,由轨迹中心的强化学习方法提供监督。 4. 设计新型网络架构:提出一种**新颖的 CNN 架构**(拥有约 92,000 个参数和 7 层)专为机器人控制而设计,特别是包含**空间特征点转换**(spatial feature point transformation)以提供准确的空间推理并减少过拟合。 **结果与讨论**: 1. 引导策略搜索 (GPS) 的高效性: ​ 在模拟实验中,GPS 方法(特别是结合高斯混合模型 GMM 先验时)比包括 REPS、RWR、CEM 和 PILCO 在内的多种先前策略搜索方法,**用更少的样本**找到了更有效的控制器。GPS 尤其适用于训练**高维神经网络策略**。在插栓(peg insertion)和运动任务中,训练中等规模的神经网络策略对于许多先前的策略搜索算法来说非常困难。在 PR2 机器人上的实验表明,轨迹优化算法**对广泛的机器人操作任务有效**,如堆叠乐高积木、将环套在桩上等。学习每个控制器所需的样本数量约为 **20-25 个轨迹**,总学习时间大约 10 分钟,其中只有 3-4 分钟是系统交互时间。 2. 端到端联合训练的性能优势: ​ 在真实世界操作任务(如挂衣架、拧瓶盖、形状分类)中,**完整的端到端训练**策略的成功率显著高于两个基线方法(姿态特征基线和姿态预测基线)。**姿态预测基线**(模仿标准模块化方法,先训练视觉系统定位目标,再训练控制策略)性能较差,表明任务的公差(仅几毫米)要求机器人精度高,而**端到端训练**能够学习到提高机器人精度的视觉特征和控制策略。这证明了**联合端到端训练**在一致性和泛化能力上优于分别训练感知和控制组件的方法。通过端到端训练,策略能够获取**目标驱动的视觉特征**,从而提高了机器人的精确度和性能。 3. 新型 CNN 架构的有效性: ​ **空间 Softmax 和预期位置 (Spatial Softmax and Expected Position)** 转换层将像素级特征转化为空间坐标表示的**特征点**,这有助于空间推理,并显著提高了姿态估计的准确性。该架构通过强制网络学习特征点,减少了过拟合,使其能够在相对较小的数据集上进行训练。经过端到端训练后,模型倾向于在**任务相关对象**和**机器人操作臂**上发现更多特征点,而在背景对象上发现较少,这表明策略通过获取**目标驱动的视觉特征**来提高性能。 4. 泛化和鲁棒性: ​ 策略对于**训练目标位置和抓取方式的变动**具有很好的泛化能力(例如,在衣架和方块任务中,对未见过的目标位置和新抓取方式的测试中仍保持高成功率) ​ 策略对与目标对象在视觉上分离的干扰物表现出**适度的容忍度**,部分归功于空间 Softmax 的横向抑制效应。但面对背景的剧烈变化或干扰物遮挡操纵对象时,性能会下降。 **结论**: * **方法可行性:** 论文提出了一种新方法,成功实现了学习使用**单目摄像头原始输入**的机器人控制策略。 * **核心贡献:** 采用**引导策略搜索 (GPS)** 算法,将策略搜索分解为使用**完整状态**的轨迹优化阶段和仅使用**观测值**的有监督学习阶段。这种分解使得优化极高维的策略变得更加简单可行,并利用了最先进的有监督学习工具。 * **主要发现:** 实验结果证明,**端到端训练**的视觉运动策略显著优于使用为姿态预测训练的固定视觉层的基线方法。这表明联合训练使感知层能够适应任务性能优化,并使运动控制层能够适应不完善的感知。 * **未来方向:** 展望未来工作,作者希望探索更复杂的策略架构(如能处理大范围遮挡的循环策略)、扩展到更广泛的任务和丰富的感官模态(如触觉和听觉),并结合无监督状态空间学习来解决训练时需要完全观测状态空间的局限性。 # 3、Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection **作者**:Levine **会议**:arxiv,robot learning关键论文 --- **背景**:传统的机器人操作行为往往过度依赖于预先规划和分析,以及相对简单的反馈(如轨迹跟随)来保证执行过程的稳定性。将复杂的传感器输入(如视觉)直接整合到反馈控制器中极具挑战性。现有的视觉伺服技术(Visual Servoing)虽然可以提供持续的视觉反馈,但通常需要手动指定视觉特征,并且需要手动或自动校准来确定相机与机器人末端执行器之间的精确几何关系。作者指出,在数据驱动的抓取方法中,大多数工作侧重于预测抓取配置,许多方法需要人类标注或基于离线计算的几何标准。相比之下,本研究旨在提出一种完全数据驱动的方法,能够实现持续反馈,并且不需要相机与机器人之间的精确校准。 **目的**: 1. 实现端到端学习: 提出一种基于学习的方法,通过端到端训练,将单目相机图像像素直接映射到任务空间的机械手运动,从而实现眼手协调,并伺服机器人抓取器到可能成功抓取的位置。 2. 避免校准依赖: 证明所提出的方法可以在无需知晓相机与末端执行器之间精确几何关系或校准的情况下,利用视觉线索来确定抓取器和物体之间的空间关系,从而实现成功抓取。 3. 实现连续伺服控制: 开发一种机制,能够实时地连续重新计算最有希望的运动指令,使机器人能够持续整合感官信息,对干扰做出反应,并调整抓取以最大化成功概率。 **实验方法**:该方法包括两个主要组件:抓取成功预测网络(CNN)和连续伺服机制。 1. 大规模数据采集 (Large-Scale Data Collection) 为了训练网络,研究人员使用了一个包含 6 到 14 个机器人机械手的集群,在数月内共收集了超过 800,000 次抓取尝试数据。该数据集已被公开。每个机器人单元包括一个 7 自由度机械臂、一个两指抓取器和一个安装在机器人肩部上方的相机。每次抓取尝试包含$T$个时间步。每个样本由($\mathbf{I}_t^i, \mathbf{p}_T^i - \mathbf{p}_t^i, \ell_i$)构成,即当前图像$\mathbf{I}_t^i$、从当前姿态到最终姿态的向量 $\mathbf{p}_T^i - \mathbf{p}_t^i$,以及整个抓取的成功标签$\ell_i$。 2. CNN 抓取成功预测网络($g(I_t, v_t)$) 这是一个深度卷积神经网络 (CNN),用于预测执行给定的任务空间运动$v_t$将导致成功抓取的概率。 输入: 网络接收当前图像$I_t$和一张抓取前记录的未被抓取器遮挡的图像$I_0$,并将它们连接起来。此外,网络还接收表示任务空间运动指令的向量$v_t$(包含 3D 平移和一个垂直轴旋转变化的编码)。 ![image-20251126174141069](./Picture/飞行机械臂模仿学习/image-20251126174141069.png) 该架构接收两种类型的输入:一是图像输入,包括抓取前的初始图像($I_0$)和当前时刻的图像($I_t$),两者均为包含3个颜色通道的 $472 \times 472$ 像素图片;二是运动指令($v_t$),即代表机器人计划执行动作的向量。 在网络处理流程上,图像数据首先进入视觉特征提取流,经过一个步长为2的 $6 \times 6$ 卷积层和 ReLU 激活函数,随后通过 $3 \times 3$ 的最大池化层进行降维。接着,图像特征会经过一系列重复的 $5 \times 5$ 卷积层(共6层)以及第二个 $3 \times 3$ 最大池化层(Pool2),从而提取出高维的深层视觉特征。与此同时,非图像数据的运动指令向量($v_t$)通过一个全连接层处理后,经过一个关键的“空间平铺”(Spatial Tiling)步骤,将一维向量在空间维度上复制,使其形状与图像特征图的尺寸完全一致。 随后,处理后的图像特征与平铺后的运动指令特征进行逐点相加(Pointwise Addition),实现视觉信息与动作信息的融合。融合后的特征继续经过一系列 $3 \times 3$ 卷积层、$2 \times 2$ 最大池化层以及后续的卷积层处理,以学习视觉场景与拟执行动作之间的交互关系。最终,数据通过两个拥有64个单元的全连接层,并由 Sigmoid 激活函数输出一个 0 到 1 之间的标量。这个数值代表了“抓取成功概率”,即模型充当了一个评估器,帮助机器人在多个候选动作中选择成功率最高的那一个。此外,整个网络中的每个卷积层之后都应用了批量归一化(Batch Normalization)以优化训练。 3. 连续伺服机制 (*f*(*It*​)) 该机制使用训练好的预测网络$g(I_t,v_t)$来持续控制机器人,将抓取器伺服到成功的抓取位置。 控制启发式: 机制使用启发式规则来决定何时停止移动并尝试抓取,以及何时抬高抓取器:如果网络预测不移动($v_t=\varnothing$)成功概率接近于最优运动 ($v_t$) 成功概率的 90%,则立即关闭抓取器;如果不移动的成功概率低于最优运动成功概率的 50%,则修改 *vt*∗ 抬高抓取器高度。 | 评估 | 评估“不运动” ($\varnothing$) 的成功概率与最优运动 $v_t$成功概率的比值 p。 | $p=\frac{g(I_t,\varnothing)}{g(I_t,v_t)}$。 | | ------------------------- | ------------------------------------------------------------ | ------------------------------------------------------------ | | 条件判断 1 (停止抓取) | 如果p>0.9(即不运动成功的概率至少为最优运动的 90%)。 | 输出 ∅(不移动),关闭抓取器。停止移动并执行抓取。 | | 条件判断 2 (抬高抓取器) | 如果 *p*≤0.5(即不运动成功的概率低于最优运动的 50%)。 | 修改$v_t$抬高抓取器高度,并执行修改后的$v_t$。这用于当抓取器处于不利位置时,防止撞到物体。抬高高度通常在4到10cm 之间随机选择。 | | 条件判断 3 (执行最优运动) | 否则(即 0.5