2026-09-28
明略科技提出Scaling Out策略,探索将前沿AI能力从云端迁移至端侧设备,解决模型精简、硬件适配与推理框架优化难题,开启端侧AI新篇章。 ... [详细]
|
在AI技术迅猛发展的浪潮中,前几年的核心趋势是不断追求模型的规模扩张与性能提升。然而,当模型逐步融入智能代理(Agent)和复杂业务流程时,一个新挑战浮出水面:模型性能越强,所需的Token消耗量也急剧攀升,推理成本成为AI技术大规模应用必须跨越的一道门槛。 这一现状促使AI产业的关注焦点从“模型还能扩张到何种规模”,逐步转向“这些强大能力应如何高效部署”。尽管云端仍是AI应用的主战场,但端侧AI正展现出前所未有的潜力:设想一下,如果最前沿的模型不再局限于数据中心,而是能够无缝融入普通用户的日常办公设备,将会开启怎样的新篇章? 实现这一愿景,远非简单的模型压缩所能达成。它要求对模型架构进行深度优化、硬件进行精准适配,以及推理框架进行根本性变革。 明略科技副总裁、多模态首席科学家赵晨旭在内部战略研讨会上,深入剖析了端侧模型创新的系统化路径。基于Scaling Out策略,他提出了一个核心问题:如何将最前沿的AI能力,从云端的数据中心,真正迁移至每个人的办公设备上。这或许标志着端侧AI正从“支持小模型运行”迈向“支撑大模型部署”的新阶段。 图片来源:明略科技 以下为精选内容摘录: 随着AI能力的不断增强,其背后的Token消耗与算力成本也水涨船高。换个视角思考,若有一天,如Fable 5般的旗舰模型毫无保留地开源,将会引发怎样的变革? 这一设想并非遥不可及。当前,已有诸多开源模型逐渐逼近这一水平,如Kimi K3。明略科技近期基于自主研发的大规模Web Agent综合评测基准WebRetriever进行测试,结果显示K3在最复杂的协议三测试中脱颖而出,荣登榜首。 这意味着,“是否存在接近顶尖闭源模型能力的开源模型”这一问题已有了初步答案。随之而来的新问题是:即便模型开源,我们能否有效利用它? 以K3为例,其完整MoE参数规模高达2.8万亿,激活参数也达千亿级别。对于普通企业乃至个人用户而言,即便模型开源,也并不意味着能够轻松驾驭。因此,未来AI行业或将迎来一个有趣的转折点:从一味追求模型规模扩张,转向思考如何将已足够强大的模型进行精简、拆解,并最终部署至个人电脑。 这正是我们探讨端侧模型创新的初衷所在。 从“追求模型规模”到“注重模型应用” 图片来源:明略科技 回顾大模型的发展历程,不难发现其始终围绕三大核心要素展开:模型架构、硬件配置与推理框架。 在模型层面,遵循Scaling Law原则,不断推动模型规模扩张。参数数量、数据规模、训练算力均持续增长,模型能力也随之水涨船高。为何模型需要如此庞大?原因在于其需满足全球范围内、各行各业用户的多样化需求。一个通用模型需同时服务于金融客户、研发人员,并处理代码编写、信息搜索、办公自动化、科学计算等多种任务。为覆盖如此广泛的数据分布与任务需求,模型自然需要引入更多专家模块。 因此,一个模型拥有数千亿参数、数百乃至上千个专家模块,并非无的放矢。 然而,对于特定个人或企业而言,是否真的需要如此多的专家模块? 答案或许是否定的。金融从业者可能更关注金融领域的能力;研发人员则可能更需要代码编写、信息搜索或AI for Science等相关能力。对于具体用户而言,真正需要的可能只是大模型中的十几个或几十个专家模块。 若从个体或企业的实际工作场景出发,我们真正需要的可能只是模型的一部分能力。那么问题就转化为:能否从庞大的通用模型中,提取出真正属于我的那部分能力? 若模型因此得以精简,第二个问题随之而来:它能否在普通办公PC上流畅运行?若PC的算力、显存与内存无法完全匹配,我们是否还能通过新的硬件配置与推理框架,使其顺利运行? 因此,当前面临的问题已与几年前截然不同。过去的问题是:如何进一步扩大模型规模?现在的问题则是:如何将已足够强大的模型,真正交付至用户手中?若能同时解决模型、硬件与推理框架三大问题,Token ROI的逻辑也将发生深刻变化。 如何通过Scaling Out策略实现模型精简,同时保留专家能力? 提及模型精简,人们首先想到的可能是蒸馏技术。蒸馏确实是一种成熟的方法,但我们此次探讨的是另一种新思路——Scaling Out。 Scaling Down,即传统蒸馏技术,旨在保持模型通用性的前提下实现模型精简。它牺牲的是单个专家模块的能力,但尽可能保留原有的数据分布与专家分布。 而Scaling Out的思路则有所不同。它愿意牺牲一部分数据分布与专家分布,但期望保留的专家模块能力尽可能不受影响。 图片来源:明略科技 可将原大模型想象为一个巨大的圆。Scaling Down是将其整体缩小,而Scaling Out则是从这个大圆中提取出与用户真正相关的几个小圆。 这一过程的关键不在于简单的模型压缩,而在于首先回答一个问题:对于特定用户、企业或业务场景,哪些专家模块真正有用? 因此,Scaling Out的第一步并非训练,而是观察用户。我们需根据用户身份、日常工作及实际任务,构建相应的数据集。然后将这些任务输入至足够大的模型中运行,通过模型原有的路由机制观察:完成这些任务时,究竟激活了哪些专家模块。例如,代码编写任务可能经常激活某些代码编写专家模块,信息搜索任务则可能激活其他专家模块。 经过大量任务的运行与分析,我们可统计不同专家模块的使用率、特异性,以及哪些任务必须由多个专家模块组合完成。最终得到的将是一个针对特定用户、企业任务的最小专家模块集合。 原模型可能拥有万亿参数、千万个专家模块,但经过筛选后,可能仅需其中一部分。随后,针对这一新的专家模块集合重新设计路由机制、进行训练与微调,最终得到一个更适合特定场景部署的模型。 因此,Scaling Out真正要解决的不是单纯的“模型压缩”问题,而是:一个通用大模型中,有多少能力是我不需要的?能否仅带走我需要的能力,同时尽可能保留这些能力的原有性能? 这也是我们认为Private AI可能兴起的一个重要技术基础。未来,一方面可能继续有人追求越来越强、越来越通用的AGI模型;另一方面,也可能出现越来越多面向企业与个人的Private AI。它们无需掌握全世界的知识,只需拥有自己真正需要的专家模块能力。模型精简后,如何让普通办公电脑流畅运行? 模型精简仅是第一步,接下来更现实的问题是硬件配置。 当前消费级PC处于一个有趣的状态:部分机器算力充足但显存不足;部分机器内存丰富但缺乏运行大模型的算力。因此,我们常看到普通电脑运行4B、8B模型已不稀奇,但若告知一台普通办公PC也能运行120B级别的模型,并能在断网情况下完成复杂的代码编写任务,则颇具吸引力。 我们已在实际设备上验证了这一可能性。我们在一台普通电脑上部署了SOTA大模型,并将明略自研的人和Agent智能工作平台Octo与OpenAI的Codex接入该环境,实现了断网状态下的本地任务完成。 这背后反映了一个重要变化:端侧AI的门槛正从“是否配备GPU”逐渐转变为“能否有效组织现有设备的计算与存储资源”。 一台本地办公电脑能否流畅运行大尺寸模型,取决于模型、推理框架与硬件三者能否协同配合。围绕这一方向,明略科技正持续探索,并将于后续发布最新进展。 端侧AI的价值,最终需回归“为何值得在本地运行” 若模型、硬件与推理框架三大问题均得到解决,端侧AI的价值将不仅限于“技术上可行”,它将直接改变AI的经济账。 过去,我们使用AI,本质上是在租用他人的GPU资源。我们向云端发送请求,云端完成推理后按Token收费。但若越来越多模型能直接在个人电脑上运行,AI则可能从“持续租用算力”转变为“一次性拥有计算能力”。 同时,端侧AI还意味着安全与循环经济两大现实价值。 一是安全与断网能力。对于数据安全有特殊要求的企业而言,模型不能联网,也不适合将数据发送至外部云端模型。端侧AI天然提供了一种新选择:模型、数据与任务均可留在本地。 二是内存利旧。如今,许多人手中的设备仍拥有可观的存储资源。过去,这些资源难以直接参与大模型推理,但通过新的模型架构与推理框架,它们开始有机会成为AI基础设施的一部分。将最前沿的AI能力,从云端带到每个人身边 过去,AI行业一直致力于Scaling Up:模型越来越大、参数越来越多、算力越来越强。这一路线仍将继续。但与此同时,我们认为可能出现另一条路线——Scaling Out。 不再要求每个人都拥有完整的通用大模型,而是从最强的基础模型中提取真正属于自己的专家模块能力;随后解决两个问题:如何使其在普通硬件上运行,以及如何以足够低的成本运行。 因此,从模型到硬件再到推理框架,实际上是在解决同一个问题:如何将最前沿的AI能力,从云端的数据中心,真正带到用户的办公设备上。 过去,我们讨论端侧AI时,更多是在谈论“小模型”。但未来的端侧AI,未必等同于小模型。它更可能意味着:模型可以很强,但只运行你真正需要的那部分能力;模型可以很大,但无需全部放入显存;设备可以很普通,但能够组织CPU、GPU、内存、SSD乃至外部算力资源。 最终目标不是让每个人拥有一台超级计算机,而是让我们今天正在使用的办公设备,逐渐具备运行最前沿AI能力的可能性。 关于明略科技 明略科技(2718.HK),自2006年成立以来,已成为中国领先的具备自研模型能力的Agentic Service企业。2025年,作为"全球Agentic AI第一股"成功登陆港交所。公司曾两度荣获吴文俊人工智能科学技术奖,多次入选Gartner、IDC相关报告,拥有2400余项技术专利及500余项软件著作权。近年来,多个AI模型在全球权威榜单中取得领先成绩。依托20年的技术积累,明略科技已服务135家财富世界500强企业、约2100家品牌客户及超24万家企业用户,覆盖零售、消费品、汽车、3C等多个行业。 |
ZCode积极应对代码库数据争议:问题已全面修复,代码库将开源并接受第三方审查
ZCode积极应对代码库数据争议:问题已全面修复,代码库将开源并接受第三方审查 2026-09-28
明略科技提出Scaling Out策略,探索将前沿AI能力从云端迁移至端侧设备,解决模型精简、硬件适配与推理框架优化难题,开启端侧AI新篇章。 ... [详细]
2026-09-28
德国足协确认克洛普出任国家队主帅后将终止红牛集团所有职务,仅保留专业咨询权限。新帅将承担战术革新、青训体系重建等七大核心任务,工作强度或创德足坛历史纪录。 ... [详细]
2026-09-28
意大利国家队正积极寻找新任主帅,瓜迪奥拉成热门候选。若成功签约,将面临薪资压力,但也是重塑信心、重振雄风的关键抉择。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
关于舌钉,一定是从欧美流传过来的朋克风,很多人喜欢在脸上、身上穿各种环,打各种钉,可能是
折耳根是一种在南方很常见的植物,北方人可能很少人知道折耳根是什么。下面就让我们先来
说到卢森堡这个国家,大家都知道这是一个比较小的国家,但是卢森堡的经济是相当的发达的,可