Being-H0.8:一种大规模的潜触觉世界-行动模型(下) 26年7月来自智在无界博客的论文“Being-H0.8: A Latent Tactile World-Action Model at Scale”https://research.beingbeyond.com/being-h08。。。。。。。继续。。。。。。TactoHand可扩展的人体视频触觉标注以自我为中心的视频能够大规模捕捉物理交互但无法直接记录触摸。TactoHand 从时间视觉证据中恢复这一缺失的信号。给定一个跟踪的手部片段它会在标准的 MANO 曲面上预测两个密集场一个用于定位接触点的二值场和一个用于测量接触点接近程度的连续场。这两个场共同描述了接触事件及其发生时间。TactoHand 用几何监督取代成本高昂的触觉标注。在不同的手-物体交互帧中已注册的手部和物体网格提供与曲面对齐的目标。曲面间的距离和方向决定接触点而距离也定义一个分级接近信号。时间模型学习从视频中推断这两个场并利用运动上下文来解决在单帧中仍然存在歧义的交互。UniHand 3.0 通过重建和跟踪每只手将模型应用于生成的片段并将预测结果映射回共享的 MANO 拓扑结构从而将 TactoHand 扩展到未标注的以自我为中心的视频。不可靠的重建结果会被屏蔽而不是被错误地标记为无接触。其结果是为通用触觉编码器提供密集的、拓扑对齐的伪触觉监督。在可测量触觉信号的情况下设备特定的解剖映射会将稀疏的接触和压力观测值投影到同一个标准手部表面上。因此接触、接近和压力共享一个空间界面而不会混淆它们各自不同的含义或有效性。标准化异构机器人数据机器人数据是连接人机视频预训练和实际部署的关键桥梁。然而机器人数据集在不同的实现方式和采集流程中差异很大通常使用不兼容的关节轴和符号约定、末端执行器定义、坐标系、相机设置和状态-动作表示。未经校准就将它们组合在一起会在具身预训练中引入系统性的不一致性。为了管理这种异构性将每个数据源拆分为可重用的平台级实现规范和数据集级元数据。标准化过程由此简化为两个易于操作的步骤首先将机器人平台映射到共享的具身接口然后进行针对特定数据集的标定、同步和验证。对于每个支持的平台一个规范的URDF定义机械臂的运动学、双手几何结构、关节约定以及腕部或末端执行器的坐标系。从机器人几何结构、记录的元数据和视觉观察中恢复的标定参数将原始状态和动作映射到这个共享规范中。然后动作以相机坐标系中的腕部姿态表示。每个对齐的数据集都会进行数据完整性、跨流同步、运动学一致性和语言-视频一致性检查。不合格的样本会被过滤或路由到专门的重新处理流程而高质量的片段仅使用几何一致的变换进行增强以保持图像、状态、动作和语言之间的一致性。合成人机对齐数据大规模机器人基础模型需要广泛且多样化的操作数据然而收集真实的机器人演示数据成本高昂、难以规模化并且受到每次采集设置的任务分布的限制。以人为中心的视频提供丰富的操作知识但原始录像也包含无关的运动、遮挡、不稳定的交互以及环境噪声这些都会使手部重建和机器人动作迁移变得复杂。因此用生成的人类操作视频作为人类演示和机器人学习之间的中间表示。与不受约束的真实世界录像不同生成的视频可以通过文本和视觉条件进行控制从而产生更清晰、更注重任务的手-物交互。这提高3D手部重建、运动重定向和机器人控制的可靠性同时实现跨物体、场景和任务的可扩展变化。该合成流程采用两种互补的策略。文本到视频的转换提供对物体-动作组合的广泛覆盖而图像到视频的转换则根据视觉上下文对生成过程进行条件控制以保持场景结构和交互一致性。自动评估器检查视觉质量、指令对齐情况和物理一致性并删除视觉质量下降、语义不匹配、比例错误或运动不合理的样本。保留的人体视频随后被转换为可执行的机器人演示。该流程重建三维手部姿态和运动轨迹通过手部和手臂分割、遮挡感知图像修复和物体复原去除人体区域并通过手指重定向、掌部和指尖对齐以及手臂逆运动学将恢复的运动传递到多个机器人模型。在保持原始操作意图的同时强制执行机器人特定的约束。最后深度感知合成将机器人渲染与重建的场景相结合生成同步的RGB图像、深度观测值和动作轨迹。这种从可控的人体视频生成到多模型机器人数据的自动化路径为基础模型预训练提供一种可扩展、低成本的配对演示数据来源。任务对齐的人类多模态演示收集真实世界中的双手操作演示数据作为任务对齐的训练数据。这些演示由人类直接完成与下游任务分布相匹配并提供了相关的操作语义、运动策略和自然的接触行为而无需大规模机器人数据采集的成本和限制。该数据集连接了广泛的多模态预训练和机器人特定适应。任务对齐使模型专注于相关的物体交互和时间结构而人类演示则提供了仅靠机器人难以捕捉的灵巧且接触丰富的行为。由此产生的监督在适应机器人动作空间之前增强了对任务的理解、手-物体交互表征、时间预测和触觉敏感性。迈向潜触觉世界动作模型Being-H0.8 将 Being-H0.7 的潜世界-动作模型从视觉预测扩展到触觉感知交互学习。四个组件实现这一扩展一个能够从未来的视觉和触觉证据中学习的潜触觉世界动作公式一个结合持续世界动作上下文和频繁状态及触觉更新的快慢动作专家一个能够统一跨数据集和具身模型的异构触觉信号的通用触觉编码器以及 TopoHand它为人类的手、灵巧的机器人手和抓取器提供共享的动作表示。先验-后验模型Being-H0.8 保留 Being-H0.7 的先验-后验模型。可部署的先验信息将当前指令和视觉观察结果与学习的潜查询相结合而仅用于训练的后验信息则用未来的​​视觉和触觉证据填充相应的潜位置。由于这两个分支共享相同的token布局因此它们对应的潜状态可以直接对齐。未来信息驱动的后验信息监督先验信息促使其​​根据当前可用的上下文预测与动作相关的潜状态。Being-H0.8 并非在像素级别重建未来的观察结果而是在潜空间中捕获它们与任务相关的后果并使用预测的状态来控制动作的生成。在推理阶段后验信息和所有未来的观察结果都会被移除从而留下一个可部署的潜世界模型。慢-快动作专家标准动作专家通过从当前上下文预测完整的动作块并以近乎开环的方式执行它来降低推理成本。这对于接触丰富的操作来说不太合适因为随着新的本体感觉和触觉反馈的出现即将进行的动作经常需要改变。在每个动作块的开始慢速流计算并缓存视觉语言和潜世界上下文同时预测完整的视野范围。在每个较短的片段执行之前快速流会重用该上下文整合最新的本体感觉状态和触觉反馈并重新生成即将执行的片段。这两个流共享动作专家参数和目标。分块因果注意力模式将每个快速片段限制在其执行锚点可用的反馈范围内并且只执行下一个片段。这既保留了全视野规划又实现了更高频率的反应控制。通用触觉编码器触觉观测在不同的数据集和具身模型中差异很大从全局接触标签和稀疏的指尖传感器到密集的逐顶点接触、接近和压力测量。将这种异质性组织成一个基于典型手部拓扑结构的由粗到细的触觉金字塔每一层都以不同的空间粒度描述同一只手。在广泛的预训练过程中每个样本都会采样一​​个有效层针对具体情境的训练和部署使用与现有标注或传感器布局最匹配的级别。选定的触觉位置和测量值被嵌入到一个可变长度的token序列中。基于查询的感知器将该序列重采样为固定数量的触觉tokens这些tokens共享一个特征维度。当触觉感知不可用时学习的缺失触觉表示保留相同的界面使得 Being-H0.8 后验概率模型和慢/快动作专家能够独立于原始传感器密度或布局来感知触觉。TopoHand统一的运动学状态-动作空间人类和机器人的手在几何形状、关节配置和原生控制空间方面存在差异但共享共同的骨骼语义。TopoHand 将这种结构转化为一个统一的状态-动作表示其槽位在不同的身体形态中保持相同的解剖学含义。与 MANO 特有的策略输出不同这些共享的槽位在人类视频预训练和机器人自适应之间不会改变其含义。TopoHand 将形态学与关节运动分离。形状 VAE 将标准的静止手部骨架压缩成一个十维形态学编码而腕部运动和 20 个标准关节角度则描述了当前状态和未来动作。特定于人体或机器人的适配器将原生的人体或机器人运动转换到这个共享空间并将预测的动作映射回原生指令。对于每只手状态包括腕部的平移和旋转、形态学编码以及标准关节角度。动作包括腕部平移和旋转的更新以及绝对目标关节角度。双手样本将双手的表示连接起来。同一接口支持并联机械臂。形态学归一化的张开信号源自拇指指尖与其他手指指尖之间的最短距离。每侧添加一个张开坐标使人手、灵巧机器人手和机械臂拥有单个统一的策略接口。这四个组件共同定义一条一致的信息路径。未来的视觉和触觉观察将监督可部署的潜表示慢动作专家会重用该表征同时结合当前状态和触觉信息实时优化动作。通用触觉编码器可标准化异构的物理观测而 TopoHand 则可标准化不同具身模型的状态和动作。质量分析以自我为中心的人类数据具身数据集的标称规模通常夸大了其有效多样性。在模拟环境中这种情况尤为严重因为重复的环境、任务模板、初始状态和控制策略会产生视觉和行为上相似的轨迹。同样真实机器人数据集也受到有限的具身模型、工作空间和采集协议的限制。以自我为中心的人类数据涵盖了更广泛的活动和环境但原始素材仍然包含大量的语义和时间冗余其相关性和质量也参差不齐。数据整理流程会移除冗余的片段和场景使 UniHand 3.0 更接近通用多模态视频的多样性特征同时保留具身学习所需的以操作为中心的结构。当底层手部运动轨迹不可靠时仅靠多样性是不够的。因此其开发一种可扩展的流程用于从无约束的以自我为中心的视频中重建、稳定、标准化和验证手部运动。现有的重建系统通常存在跟踪漂移、几何形状不合理、运动不连续以及在遮挡或快速相机移动下出现静默失效等问题。该流程专为大规模真实场景数据而设计可显著减少严重的跟踪误差、手形畸变和不可用轨迹。其自动化质量控制阶段还能在预训练之前检测出超过 92% 的错误片段。机器人数据与以自我为中心的人类视频冗余是主要关注点不同机器人数据的质量还受到异构性的影响。现有的机器人数据集涵盖不同的机器人形态、摄像头系统、控制界面和标注流程因此标称规模并不能很好地代表预训练价值。即使是视觉上相似的数据集在任务覆盖范围、状态-动作可靠性和几何一致性方面也可能存在显著差异。因此其从四个互补的维度评估机器人数据状态-动作完整性、片段级几何一致性、任务多样性和视觉多样性。并没有将这些信号合并为一个单一的分数而是比较了不同来源的归一化质量特征。一些来源提供更广泛的任务或视觉覆盖范围而另一些来源则更清晰但覆盖范围更窄。数据整理和对齐流程可以协调这些差异将异构的机器人数据集转换为更多样化、几何一致性更高且可用于预训练的语料库。