2026-06-10
日本知名艺人三上悠亚在台北街头大秀火辣身材,打卡中式早餐名店“五湖豆浆”,引网友热议。她用实际行动证明了对台湾的热爱和真诚。 ... [详细]
|
“2026世界人工智能大会(WAIC)”已成为当下人形机器人与人工智能领域最具影响力的产业盛会,吸引了全球目光。 随着人形机器人与人工智能的融合日益紧密,行业正加速迈向“实干期”。然而,当机器人试图在真实场景中实现自主作业时,却遭遇了两大难题:一方面,大模型难以准确理解物理交互的因果关系;另一方面,传统摄像头无法提供可靠的深度数据。正如业内专家所言,让机器人完成简单的拿水杯动作,都可能因缺乏深度感知而抓翻杯子,“仅靠平面视频训练,机器人无法获得前后距离感”。 面对这一困境,部分硬件厂商开始转变策略,不再局限于销售机器人硬件,而是向机器人厂商提供“数据训练接口”,深度介入数据采集与模型训练环节。与此同时,一些数据采集公司正积极与激光雷达企业合作,探索新型传感器,以提升机器人数据训练的“立体感”。 机器人高质量数据:突破瓶颈的关键 7月17日,“2026世界人工智能大会(WAIC)”在上海世博中心盛大开幕。与往年相比,今年的展会呈现出显著变化:AI技术不再局限于屏幕内的文字与图像生成,而是以大批国产人形机器人、具身智能硬件的形式集中亮相展厅。在各个展区,人形机器人活跃其中,为观众提供指引服务。 如果说前两年是人形机器人的“展示期”,那么2026年,整个行业已正式进入“实干期”。随着资本市场的热度逐渐消退,市场对机器人的评价标准发生了根本性转变:从关注“能否跳舞”转向“能否在真实场景中高效作业”。如今,仅具备舞蹈功能的人形机器人已难以获得投资者的青睐,脱离实际应用场景、闭门造车的企业将面临被淘汰的风险。“无论技术多么先进、设计多么精妙,最终都必须转化为可交易的产品,才能实现经济价值。”雅可比机器人创始人邱迪聪在接受徽声在线记者采访时表示。 当机器人从固定场景的预设表演迈向开放环境的自主作业时,行业的关注焦点已全面转向“物理AI的大规模商用落地”。然而,制约这一进程的核心瓶颈正逐渐显现。 邱迪聪指出,物理AI商用化的核心问题并非在于感知端,而在于计算端。“大模型对物理世界的理解能力仍存在明显不足。”他解释道,许多人类能够直观感知的物理现象和交互过程,目前物理AI缺乏足够的数据进行学习。 如果说“交互数据”的缺乏是计算端的软肋,那么在感知端,物理AI同样面临着严峻挑战。快思慢想研究院院长田丰深入剖析了这一底层逻辑:“制约物理AI走向开放环境的感知硬壁垒,是‘Z轴信息的实时置信度’。” 田丰进一步解释道,Z轴代表深度,即机器人需要在每一帧画面中准确判断眼前物体与自身的距离,并确保这些距离数据的可靠性。工业机器人之所以能够实现高度精准的操作,是因为它们工作在已知坐标系中,光照条件恒定、障碍物静止;而物理AI面对的是动态变化的三维世界,必须在每一帧内以毫秒级速度重建一个精确且可信的三维置信场,并将其输入决策模型。传统摄像头无法提供Z轴深度信息,而传统机械式激光雷达的帧率过低,在高速动态场景中,感知延迟的累积会导致机器人决策失效。 在业内人士看来,2026年机器人行业的关注重点已彻底聚焦于如何通过底层硬件的革新,获取高质量的物理交互数据,以突破物理AI的感知与计算瓶颈。 激光雷达厂商:探索“数据入口”新路径 要获取高质量的物理世界交互数据,感知硬件需从“线数”向“像素级”面阵芯片迭代升级。 7月17日,在WAIC现场,一家激光雷达厂商基于SPAD-SoC(单光子雪崩二极管系统级芯片)自研芯片发布了全新的感知平台。田丰表示:“线数指标是扫描时代的遗留产物,像素才是面阵时代的核心要素。”他指出,过去“线数”仅描述发射通道数量,而数字SPAD-SoC芯片将直方图生成、噪声过滤等功能集成在芯片内部,有效压缩了感知的尾部误差,为物理AI提供了可靠的工程基础。 邱迪聪从机器人感知的实用性角度肯定了这一趋势。他认为,激光雷达从线数向像素级、图像级感知转变,是行业发展的必然趋势。传统激光雷达依赖线束采集信息,数据本身存在残缺,需要通过推理进行还原;而常用的深度相机有效感知距离短、定位精度不足。“SPAD面阵芯片能够像普通图像一样输出1∶1对应的稠密、精准深度信息,为机器人提供更准确、更全面的深度数据。” 更深层次的驱动力来自于对供应链核心技术的掌控与成本突破。速腾聚创市场部总监谢阗地向徽声在线记者透露,如果选择数字化雷达,市面上基本只能购买国外芯片,但国外芯片不仅价格昂贵,且主力供应的仅为192线和520线产品。“我们计划推出2000线产品,并实现640×480分辨率的面阵感知,但市面上没有现成的芯片可供选择,因此只能自主研发芯片。”
通过自研SPAD-SoC芯片,国内厂商成功重构了激光雷达的成本结构。田丰分析称,摩尔定律在激光雷达领域的应用方式是3D堆叠。当芯片流片工艺从28nm向16nm/12nm推进时,像素密度可实现翻倍,而每颗芯片的制造成本因制程成熟可下降30%~40%。随着成本的大幅降低,高精度三维感知设备正广泛应用于割草机器人、四足机器人、人形机器人等各类产品中。 随着硬件形态和成本结构的改变,传统激光雷达厂商的产业定位也在发生变化。基于SPAD-SoC的新型融合传感器正成为“物理AI数据入口”,取代单纯的硬件销售,成为更具潜力的产业方向。 具身智能“大脑”:比智驾更复杂 “我们过去专注于为机器人打造‘眼睛’,现在不仅继续优化‘眼睛’,还开始协助构建机器人的‘大脑’。”谢阗地表示。 这一转变的背后,是自动驾驶与具身智能在真实感知需求上的根本差异。谢阗地对比称,车载场景相对结构化,汽车主要识别前方行人和车辆,只需计算并避让或刹车即可。但在机器人应用中,情况要复杂得多:“例如,在桌面上整理小球,或桌上有两杯水,需要拿取后面的那杯。机器人的‘大脑’需要进行复杂的判断,理解水杯的前后关系、大小关系。” 这也解释了为何纯视觉路线在当前的机器人精细操作中面临巨大瓶颈。谢阗地直言,如果仅依靠平面视频进行训练,机器人无法理解桌上小球的前后结构关系。“缺乏深度信息,机器人难以学习,例如今天用大球训练,明天遇到小球,机器人就不知道如何处理了。” 更关键的是,上层AI大模型的演进正在对底层感知硬件提出更高要求。田丰指出,当前具身智能的训练范式正朝着端到端模型直接消费传感器原始数据的方向演进。“图像级激光雷达输出的结构化2.5D/3D数据,在格式上与RGB图像高度对齐,可直接输入视觉—语言—动作(VLA)模型,无需额外的点云预处理。” 为此,感知厂商开始深度介入数据采集与模型训练环节。据业内人士介绍,现在大量数据采集公司选择与激光雷达企业合作购买传感器。“带着雷达进行数据采集,最终获得的数据既包含小球的位置信息,又包含画面信息,非常精准。先通过人类动作训练机器人如何抓取,机器人学习这套流程的效率更高,数据质量也更高。” 这也反映了机器人训练的多模态发展方向。多模态输入的广度与深度将直接决定物理AI的智力上限。行业已从文字、图像扩展到视频,未来还将融入声音、深度和触觉等信息,VLA模型正加速吸纳更丰富的感知维度。 然而,多模态融合并非简单堆砌传感器,而是需要在底层芯片实现“前融合”——让每个像素同时采样颜色与距离,信息密度翻倍且不增加时间代价。这种高度集成的设计也解决了“叠床架屋”的系统冲突问题,通过一颗芯片输出干净统一的多模态数据结构。 上述业内人士表示,未来,机器人触觉感知也是一个重要发展方向,不过,现实中触觉数据几乎需要从零开始构建。 |
阶跃星辰姜大昕:多模态交互引领AI革命,企业已构建全模态技术生态|2035上海产业创新研讨会 2026-06-10
日本知名艺人三上悠亚在台北街头大秀火辣身材,打卡中式早餐名店“五湖豆浆”,引网友热议。她用实际行动证明了对台湾的热爱和真诚。 ... [详细]
2026-06-22
世界杯C组末轮焦点战前,苏格兰队通过趣味训练调节状态,主教练透露已制定针对性战术,这场与巴西队的对决将成为决定出线命运的关键战役。 ... [详细]
2026-06-05
探索影视剧中那些“正得近乎邪”的经典人物,他们以非凡的勇气和坚定的信念,在正邪交织的江湖中书写着属于自己的传奇。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
夏达在1981年4月4日的时候出生于湖南省怀化市,毕业于长沙理工大学艺术设计系,是一位知名
作为是国内高空挑战第一人的吴永宁,很多人应该都不会陌生,很多人都看过他的户外极限挑战
和尚也就是大家口中的僧人、出家人,据说在兴起之初,和尚是一个尊称,意思为师的意思,和为三