2026-04-17
北京时间4月12日,CBA常规赛北京首钢迎战上海大鲨鱼,翟晓川即将迎来CBA生涯第626场,超越易建联升至历史第11位,他表示将倾尽全力为首钢奋斗。 ... [详细]
|
近日,明略科技在AI领域迈出重要一步,正式推出端侧GUI模型Mano-CUA-4B-2.0版本,并同步引入了创新的Thinking模式。据官方披露的测试数据显示,在MacBook Pro、Apple M5、16GB内存的硬件环境下,针对100道真机macOS GUI任务进行测试,Thinking模式下的整体任务成功率相较于1.0版本实现了约9%的显著提升,而在中高难度任务上,相较于快速模式,其成功率更是提升了10%至13%。 在当下AI行业普遍聚焦于模型速度与参数规模的背景下,明略科技公布的这组关于“稳定性”的数据,无疑触及了企业采购AI技术时更为核心的考量因素。 一、被忽视的关键瓶颈 回顾过去两年,企业对AI Agent的期待大多停留在演示阶段。一段流畅的演示视频,展示Agent自动打开软件、填写表单、提交数据的全过程,确实令人眼前一亮。然而,当企业尝试将Agent从演示环境推向实际生产环境时,却遭遇了不小的挑战。 这一挑战的根源在于,单个Agent操作的成功率看似不错,比如95%,但当这些操作串联成一个复杂的企业流程时,成功率会迅速下降。假设一个流程需要20步连续操作,整体成功率将降至约36%;若流程延长至40步,成功率则仅剩约13%。这意味着,即便单个Agent操作表现优异,但在长链路、全流程的自动化任务中,失败率会迅速累积,导致自动化带来的效率提升被“随时救火”的隐性成本所抵消。 这正是许多Agent项目“叫好不叫座”的原因所在。它们能够展示一次完美的操作,却难以保证千次、万次的稳定运行。对于企业而言,一次失败可能意味着财务记录的错误、客户信息的丢失或生产流程的中断。因此,不少Agent项目在试点阶段就停滞不前,难以进一步扩大规模。 显然,真正的瓶颈不在于Agent的速度有多快,而在于其稳定性是否足够可靠。 二、行业共同探索的课题 明略科技的探索并非孤例。放眼整个AI行业,2026年上半年出现了一个明显的趋势转变:Agent竞争的焦点正从“能否实现”转向“能否稳定、反复地实现”。 这一转变体现在多个方面。 首先,评测标准在发生变化。衡量Agent操作电脑能力的权威基准OSWorld,其整体成功率在一年内从12%跃升至66%。这表明行业已经跨越了“Agent能否操作电脑”的初级门槛,开始将竞争焦点转向“准确性和稳定性”。值得注意的是,即便达到66%的成功率,也意味着在普通桌面任务的基准测试中,最好的Agent仍有约三分之一的情况会失败,稳定性仍有待提升。 其次,技术方向在向“可靠性”靠拢。微软在其Agent Framework中引入了检查点机制,用于保存工作流状态并在故障后恢复;Anthropic在强化Computer Use能力的同时,也强调Agent需要在清晰的规则、权限和审计框架下运行。无论是云端还是端侧,行业头部玩家都在思考同一个问题:如何让Agent在长链路任务中减少错误。 此外,商业模式也在发生变化。Agent的付费逻辑正从“卖订阅”向“按结果付费”转变。但“按结果付费”的前提是Agent能够稳定交付结果。一个频繁出错的Agent,难以支撑起“按结果收钱”的商业模式。因此,稳定性不仅是一个技术指标,更是影响Agent商业模式创新的关键因素。 各家厂商在探索稳定性的路径上各有侧重:海外厂商强在云端通用能力与开发者生态;字节跳动的UI-TARS走的是开源桌面Agent路线,覆盖PC、浏览器和安卓三大平台;面壁智能则在端侧模型的小参数高性能方向上持续打磨。明略科技此次将重点放在“端侧长链路稳定性”上,可以看作是对行业共同命题的一个具体回应。 三、Thinking模式如何破解稳定性难题 Mano-CUA 2.0版本的关键升级——Thinking模式,正是针对长链路任务的稳定性问题而设计的。 端侧Agent在处理复杂任务时稳定性不足的一个核心原因是“思考”不够充分。受限于本地算力,模型往往来不及充分规划就匆忙动手,导致长链路任务中一步出错,后续步骤便容易偏离轨道。Thinking模式通过让模型在执行前先分解任务、推理判断、规划路径,实现了“先想后动”的智能决策过程。这对于需要多步骤操作、跨界面理解和动态判断的GUI任务尤为重要。 这种“先想后动”的策略带来了稳定性指标的实质性提升。前面提到的数据——整体成功率较1.0版本提升约9%、中高难度任务较快速模式提升约10%至13%——虽然单看百分点似乎不大,但在“多步连乘”的规模化语境下,其意义被显著放大。单步可靠性的每一点提升,都会使长链路任务的整体成功率得到更明显的改善。越是步骤多的任务,Thinking模式的价值越突出。而企业里最需要被自动化、也最难啃的,往往正是这类复杂任务。 因此,成功率提升的本质或许不是“跑得更漂亮了”,而是企业终于有理由考虑将Agent铺开到更广泛的生产环境中了。 四、“敢铺开”为何成为质变的关键 企业采购AI自动化技术的决策逻辑其实非常朴素:这套系统能否让我放心地交给它、不用一直盯着? 这正是行业当下的真实焦虑所在——从“能否使用Agent”转向“敢不敢将Agent放入生产环境、铺到全流程”。一个只能在试点环境中演示的Agent,其价值是有限的;只有当它的稳定性足够高、高到企业愿意将成百上千个工位的重复工作整体托付给它时,AI自动化才真正从“降本的点缀”转变为“生产力的底座”。 Mano-CUA 2.0版本的成功率提升,或许正是给了企业这份“敢铺开”的底气。它让企业可以将自动化从“挑几个简单任务试水”推进到“覆盖长链路、全流程”;从“派人盯着、随时接管”走向“放手让它批量跑”。这中间的差别可能不是效率的线性改善,而是自动化规模的量级跃迁。 端侧形态还为这份“稳定性”增添了一层经济性。在云端,让模型“想得更深”意味着更长的思考链、更高的Token消耗;而端侧算力是买断制的——硬件一旦购置,思考深度的延伸不会带来额外的边际成本。因此,企业可以放心地让Agent“每一步都多想一层”以换取稳定性,而无需为这份谨慎支付递增的账单。 五、稳定:规模化的真正入场券 明略科技此次的动作不仅限于一个模型的升级。其开源项目Mano-P已升级为面向端侧的统一模型序列,原有Mano-P模型更名为Mano-CUA,作为序列中的GUI操控模型。未来还将有更多不同参数量级、不同模态的端侧模型陆续开源。对于企业而言,这意味着它们拿到的或许不再是一个孤立的模型,而是一个持续迭代的端侧能力底座。 回到那组数据。当行业还在讨论谁的模型跑分更高、谁的响应更快时,明略科技选择将精力投入到一个更接近企业真实决策逻辑的地方:让Agent不只是跑得快,而是跑得稳;不只是能演示一次,而是能反复交付可靠的结果。 对于企业自动化而言,效率或许只是入场资格,而稳定才是规模化的真正入场券。这大概也是明略Mano-CUA 2.0版本试图给出的答案。 |
台积电发布AI芯片“三层架构”革命:COUPE光互连技术引领能效跃迁
Meta疯狂举动:采集员工鼠标和键盘输入数据 只为训练AI!
峰飞航空科技携手高新长空,开启战略合作与批量采购新篇章
朱杨柱、张志远、黎家盈三位航天员荣耀出征,共筑航天梦
蔚来遭AI“洗稿”团伙抹黑:4000+账号被控 警方重拳出击 2026-04-17
北京时间4月12日,CBA常规赛北京首钢迎战上海大鲨鱼,翟晓川即将迎来CBA生涯第626场,超越易建联升至历史第11位,他表示将倾尽全力为首钢奋斗。 ... [详细]
2026-06-17
爱超冠军拉恩将在欧冠首轮资格赛中迎战圣马力诺劲旅特雷菲奥里,两队实力不俗,赛程细节待确认。同时,爱超其他球队也在积极备战欧战资格赛。 ... [详细]
2026-05-29
深度解析武磊入选国足的特殊意义,从身体机能衰退、战术价值变化到职业转型规划,揭示中国足球标志性人物面临的现实困境与未来选择。 ... [详细]
2026-05-24
英格兰主帅图赫尔公布世界杯26人名单,福登帕尔默落选引发争议,阿斯顿维拉时隔30年夺冠举行盛大巡游,EFL公布南安普顿间谍门处罚详情。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
原油也就是我们通常所说的石油,一般是指那种直接从油井里开采出来的还没有进行过加工和
很多有关佛教的影视剧上都会出现一个名词,舍利子。我们都知道舍利子是五彩色的晶体,集齐
夏达在1981年4月4日的时候出生于湖南省怀化市,毕业于长沙理工大学艺术设计系,是一位知名