天创机器人正式发布 T-WAVES——面向泛工业运维与应急安全救援场景的通用工业具身智能融合模型。其顶层技术架构 T-WM-VTLA-S,将视觉、语言、动作、世界模型、力触觉与外置安全控制统一到可训练、可部署、可验证的闭环中,面向插拔、柜门开关、按钮按压、旋钮旋动等高接触、高风险作业。
工业作业,需要的不只是“看见并抓取”
工业设备操作往往包含毫米级对准、长程任务切换、接触状态判断和安全约束。插枪时,视觉遮挡会让微小偏差不可见;开柜门再按按钮时,机器人必须理解先后规则;旋钮与阀门操作还要区分空转、卡阻、到位和异常阻力。T-WAVES 因此围绕空间精度、任务编排、接触能力、设备交互和安全可控五个维度设计。
传统机器人智能更多回答“能不能完成某个动作”,而工业机器人需要回答的是:能不能在复杂、危险、不可完全结构化的环境中,稳定、安全、可恢复地完成一项作业。系统不仅要看懂现场、理解任务和生成动作,还要持续控制风险。
T-WM-VTLA-S:目标、动作、触觉与安全闭环
WM(World Model):生成 subtask、goal image 和 future latent,为策略提供“下一步世界应该变成什么状态”的目标条件。
VTLA(Vision-Tactile-Language-Action):理解视觉与语言,并将六维力/力矩、接触状态等状态力触觉纳入动作生成。
S(External Safety):位于策略和机器人控制器之间,对工作空间、速度、碰撞距离、力/力矩阈值和任务规则进行独立检查,可执行动作裁剪、重规划、停止与人工接管。
整体链路是:视觉、语言、状态和触觉进入 VTLA 主干,World Model 生成未来目标信息,动作专家输出机器人动作,外置安全层完成约束和过滤,再将安全动作下发到真实机器人控制系统。简单来说,模型负责理解和生成,世界模型负责目标规划,触觉模块负责接触判断,安全层负责执行兜底。
图1 T-WM-VTLA-S 在线闭环架构
三位一体的可信数据引擎
T-WAVES 采用微调优先路线,将 Ego 第一视角数据、UMI 精细操作数据和机器人真机遥操作数据统一到 TCP-local delta action 空间:[dx, dy, dz, droll, dpitch, dyaw, gripper]。单臂与双臂、不同末端执行器通过 action mask 和 embodiment/action-space embedding 统一表达。
Ego 数据提供任务语义、目标状态和长时序逻辑;UMI 数据扩展低成本精细轨迹并记录指尖力触信息;真机数据提供真实动力学、控制延迟、接触反馈和执行边界。所有数据在训练前经过来源与标定检查、坐标统一、仿真回放、碰撞与关节限位检查、质量筛选后入库。
三类数据并非简单堆叠。高置信度、可重定向的 Ego 轨迹可用于学习粗粒度运动先验,普通 Ego 数据主要监督子任务、目标图像和未来视觉 latent;UMI 轨迹需通过 SLAM 置信度、外参标定、速度与旋转跳变、运动学可达性及回放验证;真机数据数量相对较少、采集成本更高,但与部署分布最接近,是触觉学习、接触控制和安全边界学习的主要来源。
图2 多源数据统一可信采集系统
三阶段微调:有限数据也能稳定落地
Stage 1——动作空间对齐:先训练状态、动作输入输出投影与本体/动作空间嵌入,再小学习率微调 Action Expert,使模型稳定输出抓夹中心/TCP 局部增量动作。
Stage 2——目标条件动作:冻结 Cosmos Goal-WM 主体,训练 Goal Encoder、Goal Adapter、Subtask Generator、目标条件注入分支及 Action Expert;混合 teacher goal、generated goal 与 dropped goal,学习由当前状态走向下一阶段目标。
Stage 3——触觉接触微调:引入 Tactile State Encoder、Tactile MoE、Contact Predictor 与 Next Wrench Head,使动作专家根据接触状态修正轨迹,在插接、按压和旋动中提升稳定性与可恢复性。
分阶段开放参数的目的,是在有限但可信的数据条件下,降低一次性全量微调造成的灾难性遗忘,也避免 Ego、UMI、真机和仿真数据因动作空间不同而相互冲突。Stage 1 解决动作空间对齐,Stage 2 解决目标条件引导,Stage 3 解决真实接触中的状态力触觉修正。
图3 从动作对齐到目标条件与触觉接触的三阶段微调
外置安全:让模型能力进入真实现场
T-WAVES 不把安全完全交给神经网络内部学习。其外置安全层延续早期联合清华团队发布的 VLSA 技术路线;VLSA 已被 IROS 2026 接收。安全层对 nominal action 进行风险识别、最小扰动修正与执行许可判断,无法修正时则拒绝执行或触发恢复、人工接管和急停。
安全层读取任务、视觉、深度、TCP 状态、触觉和工作空间约束,对动作块执行限幅、碰撞距离检查和控制屏障约束。如果动作仍处于可修正范围,系统输出最小扰动后的 safe action;如果无法修正到安全集合,则保持当前位置、降级恢复或停止执行。这样,安全不被隐藏在模型黑箱内部,而是形成可解释、可测试、可持续升级的工业安全边界。
图4 外置安全层作业
产学研协同,面向真实工业任务
T-WAVES 由天创机器人牵头研发:清华大学团队为安全分层提供支持,东南大学团队提供触觉融合方法支持,视源股份提供机器人七轴双臂,戴盟机器人提供力触觉末端抓夹,承泰科技提供雷达传感器。各方围绕数据采集、模型训练、机器人本体、触觉感知和安全执行共同构建产业闭环。
接下来,天创机器人将陆续发布插拔、柜门、按钮、旋钮等真实作业视频,并持续扩展到电力巡检、消防应急、危化处理、矿山作业和无人值守站点。T-WAVES 的目标不是展示一个孤立 Demo,而是让机器人在真实现场稳定、安全、可恢复地“真干活、干真活”。
应用验证:面向高接触的工业任务
任务一:配电房旋钮操作
机器人需要抓握旋钮、执行旋转、判断力矩变化,并在接近限位时停止,验证 VTLA 中 force 分支的必要性。
任务二:配电房按钮操作
机器人需要识别按钮位置,执行动作,在感受到按钮按压程度到位以后会停止按压。
任务三:开柜门
机器人需要完成长程任务分解,先找到门把手,抓住门把手,再拉开。
任务四:按消控盘按钮
面板识别,找到目标按钮按压,验证 World Model 对 subtask 和 goal image 的作用。
任务五:自主插枪任务
机器人需要识别目标接口,完成末端姿态对准,并在接触过程中根据力反馈修正插入路径。
任务六:USB插拔任务
机器人自主识别USB并夹取,随后插入USB口中,在接触过程中调整位姿插入。
任务七:信号读取接触任务
机器人末端工具自主识别对接口,不断调整位姿,柔性接插,读取信号。
一句话总结
T-WAVES 让工业机器人具备“看懂任务、规划目标、感知接触、生成动作、安全执行”的综合作业能力,推动机器人从单点演示走向真实工业现场。
|