2026-07-27
中国放弃卡塔尔与美国天然气,转而选择加拿大,这背后隐藏着怎样的能源战略考量?本文深度剖析中国能源布局的转变及其背后的复杂因素。 ... [详细]
|
在机器人控制领域,VLA、WAM、RL、TAMP、MPC等多样化策略正各自展现其独特优势。然而,如何精准界定这些策略的能力范围,并在恰当的时机为不同子任务匹配最适宜的策略,已成为机器人完成复杂且长时序任务的核心挑战。
当前,具身智能领域正经历着一场模型能力的激烈竞赛:VLA在模型规模扩展上不断突破,WAM致力于弥合未来预测与动作生成之间的鸿沟,RL通过精细的奖励设计来强化执行稳定性,而TAMP则凭借其严密的逻辑推理能力进行长序规划… 每种策略都在其擅长的领域内展现出独特优势,但真实世界的复杂性往往要求机器人同时具备高度的语义理解、闭环控制、几何精度以及长时序推理能力,这远远超出了单一控制策略所能覆盖的范围。因此,对于“通用具身模型”的追求,虽然令人向往,但道路依然漫长且充满挑战。 RoboHarness:摒弃最强模型幻想,聚焦最合适策略选择。 为何需要异构策略编排? 与其坐等未来某个通用模型能够解决所有问题,不如思考如何协同利用现有的控制策略,以应对当前挑战。毕竟,协同的力量往往大于个体之和。 回顾具身智能技术的发展历程,我们可以看到VLA在视觉语义理解与开放词汇指令方面的卓越表现,RL在特定分布内的稳定闭环行为,TAMP在逻辑与几何规划方面的专长,以及WAM通过预测未来来辅助决策的能力…这些策略的能力并非相互排斥,而是在某些方面高度互补。 既然单一策略难以满足复杂任务的所有需求,那么为何不让异构策略携手合作,在不同阶段发挥各自所长呢? 从模型竞争到异构策略编排的转变 RoboHarness主要致力于解决异构策略协同中的两大关键难题:一是如何选择最适合当前任务的策略;二是如何确保异构策略之间的平稳交接。它将VLA、RL、TAMP等控制策略封装为可调用的技能,由coding agent负责高层任务拆解及子任务路由。在相邻异构策略状态分布不兼容时,系统能够生成桥接轨迹,确保任务连续进行。值得注意的是,该系统无需底层策略共享结构、动作空间或训练数据,也无需进行联合训练,即可轻松接入新的底层控制策略,如WAM、VLN或MPC等。 图 1|RoboHarness总体架构概览。 RoboHarness提供三类结构化辅助技能:Understanding Skills通过调用一系列分析技能,从原始输入中提取更丰富的信息以辅助决策;Memory Skills则检索相关的历史执行经验,显式重建下一控制策略熟悉的状态分布,并据此引导机器人进入该分布,实现不同策略之间的稳定交接;Evolution Skills则利用在线反馈来更新策略元数据、参数与Harness逻辑,确保系统持续优化。 第一步:动态识别策略的能力边界 策略的能力边界并非一成不变,而是受到多种因素的影响。例如,VLA在原始相机位姿下能够稳定执行的任务,在输入图片质量下降后可能会失败。因此,系统需要能够判断在当前场景、观测质量和机器人状态下,哪个控制策略最有可能成功。RoboHarness利用Understanding Skills从原始输入中深入获取更丰富的信息(如语义相似度、位姿不确定性、图像曝光等多维指标),以刻画控制策略的能力边界,从而辅助高层执行策略的选择。 图 2|不同扰动下的策略调用比例及VLA独立成功率与调用比例之间的关系。 表 1|LIBERO与LIBERO-Plus成功率对比(%),RoboHarness集成了pi0.5和TAMP两种底层策略 在LIBERO-Plus的多类扰动测试中,RoboHarness能够根据底层策略的实际可靠性动态调整调用比例。当VLA表现稳定时,系统更倾向于调用它;而当机器人状态、语言或感知条件超出其能力边界时,则更多地将任务路由至TAMP。通过多策略协作,RoboHarness在LIBERO-Plus上取得了93.2%的平均成功率,显著高于其他现有方法。 第二步:解决异构策略之间的“交接断层”问题 在异构策略协同工作中,两个策略之间常常存在“交接断层”问题。由于各控制策略独立设计,前一策略结束的位置可能恰好是后一策略从未见过、无法稳定启动的状态。为了解决这一问题,Memory Bridge根据下一子任务和当前观测从多模态记忆中检索下一目标策略的成功轨迹,提取末端位姿和关节状态,并在线拟合“机器人状态—执行进程”的空间分布,显式重建下一控制策略熟悉的状态分布。系统随后综合分布内置信度与运动代价选择目标状态,生成桥接轨迹,再将控制权交给下一策略。 图 3|Memory Bridge构造通路示意图。 长时序任务凸显单一模型的能力局限 长时序任务是检验单一策略能力壁垒的有效试金石。在约为原始LIBERO四倍长度的LIBERO-LoHo上进行的零样本测试中,π0.5的完整成功率仅6.4%;即使通过世界模型(H-WM)、LLM(LLM-guided)或规划语言(Logic-guided)分层拆解任务后再交由VLA执行,完整成功率最高也仅为64.8%。这充分证明了单一模型始终难以突破现有的能力壁垒。而RoboHarness通过协同调用多种底层控制策略并确保稳定交接,将完整成功率提升至95.2%,展现了其卓越的性能。 表 2|LIBERO-LoHo零样本长时序评估结果。RoboHarness集成了三种底层策略:pi0.5、经RL训练的OpenVLA和TAMP。各项结果为任务进度/完整成功率(%)。 准确刻画能力边界与实现策略间稳定交接,二者相辅相成 缺一不可,共同构成异构策略编排的基石 消融实验表明,协同并非简单地将模型串联起来。如果缺少Understanding Skills,系统将因无法准确理解各底层策略的能力边界而出现任务分解和路由错误;如果移除Memory Bridge,即使选对了策略,也可能因交接状态不兼容而失败;而如果缺少Evolution Skills,系统则难以根据执行反馈修正能力判断并在线更新各策略的能力边界。因此,理解、适应与交接三者缺一不可,共同构成了异构策略编排的稳固基石。 图 4|消融实验结果:理解、进化与Memory Bridge分别解决错误分解、能力估计失准和策略交接失败问题。 具身智能的竞争焦点 正从模型层面转向系统层面 虽然“通用具身模型”仍是所有具身智能研究者的终极目标,但在追逐这一目标的漫长道路上,机器人必须正视每种策略的能力边界、输入依赖以及分布外脆弱性。异构策略编排提供了一条现实可行的路径:它不要求单一模型立即掌握所有能力,而是让系统理解不同策略在何时可靠、如何分工以及如何交接。这样,机器人就能在复杂多变的环境中更加灵活、高效地完成任务。 随着RoboHarness不断积累跨策略、长时序数据,这些数据将为未来统一具身模型的训练提供宝贵的反哺资源。 因此,RoboHarness并非通用模型的对立面,而是具身智能从模型能力走向系统能力的必经之路。 |
孙宇晨正式起诉特朗普家族加密项目WLF:指控非法冻结代币与销毁威胁
SK海力士员工薪酬全球领先,三星员工表示强烈不满
ChatGPT-6或携200万上下文能力登场 性能跃升40%引期待
董明珠造车叫什么牌子?她的电动汽车一辆多少钱?
中科院院士褚君浩深度剖析:“韬定律”能否引领半导体技术新篇章 2026-07-27
中国放弃卡塔尔与美国天然气,转而选择加拿大,这背后隐藏着怎样的能源战略考量?本文深度剖析中国能源布局的转变及其背后的复杂因素。 ... [详细]
2026-05-06
胡安·伊格莱西亚斯转会塞维利亚的秘密因私人医生社交媒体帖子而泄露,塞维利亚保级形势影响转会进程。 ... [详细]
2026-05-21
北京时间5月16日NBA季后赛,骑士主场94-115不敌活塞,系列赛拖入抢七。米切尔哈登合计13次失误,活塞替补群狂轰31分成胜负手。 ... [详细]
2026-06-22
近期,菲律宾在官方表态及舆论引导上,均展现出与中国对抗到底的强硬姿态。这一态势的根源,可追溯至中方近期对菲律宾防长特奥多罗实施的严厉制裁——冻结其资产并禁止其入境。此 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
什么是五帝钱呢?其实五帝钱就是在清朝时五个皇帝所发行的钱币,这五位皇帝分别是顺治、康
现在的圈子都比较流行小众,很多网络用词除非在特定的圈子里否则外人很多都不知道是什么
关于舌钉,一定是从欧美流传过来的朋克风,很多人喜欢在脸上、身上穿各种环,打各种钉,可能是