2026-09-24
解析GPT-6 Astra引发的AGI定义之争,揭示科技巨头在技术标准、战略布局和商业叙事层面的激烈博弈,探讨通用人工智能的真实发展路径。 ... [详细]
|
本文源自徽声在线旗下公众号:深流研究所,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布全新模型GPT-6 Astra后,公开宣称:"我们正式迈入AGI时代。"这一论断引发行业震动。 仅三天后,英伟达CEO黄仁勋在社交平台进一步强化这一观点:"从ChatGPT到o1,再到GPT-6 Astra,仅用四年时间,AGI已然成为现实。" 这场突如其来的AGI宣言,是否意味着人类智能的终极形态已经降临? 现实远比宣言复杂得多。 就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼仍公开表示,AGI是"定义极其模糊的概念",甚至一度想称之为"营销术语"。这种前后矛盾的态度,折射出行业对AGI认知的深层分歧。 负责关键评测的ARC Prize团队特别强调:"GPT-6 Astra确实展现了通用化能力的重大突破,但我们从未声称它就是AGI。"这种谨慎态度与商业领袖的激进宣言形成鲜明对比。 当科技巨头高呼"AGI已至"时,评测机构却在划清界限,这种割裂现象背后,隐藏着AI行业发展的深层逻辑。 ■评测榜单的数字游戏:99.9%等于AGI吗?GPT-6 Astra在ARC-AGI-3评测中取得的99.9%惊人成绩,成为AGI论者的核心论据。但这个数字背后藏着关键细节: 与传统评测不同,ARC-AGI-3采用"黑箱测试"模式——不提供明确规则,要求模型在陌生环境中自主判断目标、理解反馈并寻找解决方案。这种设计专门针对AI的"零样本学习能力",即面对全新问题时的现场适应能力。 然而,99.9%的得分存在重要前提:在ARC Prize提供的标准测试框架中,GPT-6 Astra实际得分仅为62.7%;当接入OpenAI定制的专用适配框架后,成绩才飙升至99.9%。这个专用框架允许模型保留跨请求的隐藏推理状态,并能利用上下文压缩延续探索经验。 这种技术操作虽非作弊,却揭示了关键问题:62.7%反映的是单一模型的基础能力,而99.9%测量的是包含记忆系统、工具链和运行框架的完整智能体系。两者本质不同,不能简单等同。 更值得警惕的是,当我们将99.9%的测试得分直接换算为"99.9%的AGI"时,已经陷入了概念偷换的陷阱。AI评测与AGI认定之间,存在着难以跨越的逻辑鸿沟。 在其他权威评测中,GPT-6 Astra的表现暴露出明显短板:
这些数据揭示残酷现实:当任务规则清晰、答案可验证时,AI已能逼近甚至超越人类;但面对流程冗长、目标模糊的真实场景,其失败率仍高得惊人。这种"考场天才,现实菜鸟"的悖论,正是当前AI发展的真实写照。 历史总是惊人相似:深蓝击败国际象棋冠军、Watson赢下《危险边缘》、AlphaGo走出"神之一手"时,人类都曾产生"通用智能近在咫尺"的错觉。但规则明确、反馈即时、有自动裁判的封闭环境,与复杂多变的现实世界存在本质差异。 ■AGI定义之争:科技巨头的战略博弈AGI至今缺乏统一标准,不同机构的定义折射出各自的战略考量: OpenAI采用最具经济导向的定义:在2018年公司章程中,将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。这个定义包含三个核心要素:
值得注意的是,意识、情感等人类特质被明确排除在必要条件之外。这种务实定义与OpenAI的产品路线高度契合:通过推理模型提升复杂任务处理能力,借助智能体强化工具调用和计算机操作,最终让AI承担完整工作流程,转化为可规模化部署的生产力。 Anthropic则采取更为谨慎的态度。CEO达里奥·阿莫迪认为"AGI"承载过多模糊含义,转而使用"强大的AI"这一表述。在2024年10月发表的《Machines of Loving Grace》中,他描绘了具体系统标准:
这幅图景包含能力、自主性和复制规模三个变量,共同决定AI的现实影响。基于此判断,Anthropic将能力扩展与风险治理绑定,形成"保持前沿竞争力+同步升级安全保障"的战略双轮驱动。 Google DeepMind则聚焦于AGI的测量标准。其2023年发布的《Levels of AGI》提出"性能-通用性"双轴模型,将通用智能划分为五个等级:
同时将自主性作为独立维度处理,要求研究者同时考察能力强度和覆盖范围。2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆解为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度,并设立20万美元奖金征集测试方案。 这种将AGI转化为可比较认知能力图谱的思路,体现了DeepMind的研究取向:通过建立统一尺度,识别能力缺口,指导评测研发和产品迭代。定义之争背后,是科技巨头对未来技术主导权的激烈争夺。 AGI定义不仅是学术概念,更是战略罗盘。采用何种标准,决定着哪些能力被视为关键进展;哪些进展被优先发展,又反过来塑造公司的产品路线、资源配置和安全策略。这种定义与发展的双向互动,正在悄然重构AI行业的竞争格局。 ■AGI叙事之争:技术革命还是商业包装?人类总是倾向于将技术革命简化为标志性瞬间:莱特兄弟的首次飞行、第一颗原子弹爆炸、阿波罗11号登月。这种历史叙事需要明确日期和震撼画面,但AGI的发展可能打破这种传统认知模式。 当前AGI之争中,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"代表两种不同表达:前者是可检验的技术结论,需要明确定义、满足条件和独立验证;后者则是充满弹性的时代判断,既制造历史时刻又保留解释空间。 对模型公司和AI产业链而言,AGI首先是强大的产品叙事工具。模型能力的真实进步往往是零散而不均匀的,准确描述需要一长串评测数据和限定条件。而"AGI时代来了"的宣言,能将技术升级压缩为历史节点,将算力投入、技术路线和商业前景编织成统一故事。 这种叙事对争夺用户、客户、人才和资本的公司具有战略价值。黄仁勋的表态需放在这个框架下理解:2025年9月,英伟达与OpenAI宣布战略合作,计划部署至少10吉瓦的英伟达系统(相当于数百万颗GPU),英伟达则准备投资最高1000亿美元。 虽然这只是意向书而非最终协议,且后续传出调整可能,但在最初设想中,英伟达被定位为OpenAI扩建AI基础设施的首选合作伙伴。双方公告明确表示,这些设施将服务于OpenAI"迈向部署超级智能"的路径。 黄仁勋在宣布"AGI已经到来"时,特别强调训练Astra使用的英伟达计算系统和即将上线的GPU,隐含着完整因果链:大规模算力投入带来智能跃迁,因此需要更大规模算力投入。作为AI算力扩张的主要受益者,英伟达有强烈动机强调这是时代转折。 事实上,这并非黄仁勋首次宣布AGI到来。2024年他曾预测,若将AGI定义为通过几乎所有人类考试,这一目标可能在五年内实现;2026年3月,他又在Lex Fridman播客中直言:"我认为我们已经实现了AGI。" AGI已从技术终点演变为叙事资源,影响着资本流向、市场预期、政策制定和产业布局。那么,AGI究竟如何才算真正到来?是模型发布、评测纪录,还是公司宣言? 或许正如OpenAI创始成员Andrej Karpathy所言,AGI不会带来陡然转折,而是平滑融入现有增长曲线,事后甚至难以确定拐点所在。这场关于AGI的争论,本质上是人类对智能本质认知的持续探索,其意义远超技术本身。 本内容经作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]。 本文源自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp |
2026-09-24
解析GPT-6 Astra引发的AGI定义之争,揭示科技巨头在技术标准、战略布局和商业叙事层面的激烈博弈,探讨通用人工智能的真实发展路径。 ... [详细]
2026-09-24
北京时间7月12日9:00,世界杯1/4决赛,阿根廷与瑞士在堪萨斯城体育场展开角逐,葡萄牙籍主裁皮涅罗执法本场比赛。上半场,梅西角球助攻麦卡利斯特头球破门。下半场,恩多耶小角度破门 ... [详细]
2026-09-24
韩国人气歌手鸟叔PSY因长期未经医师面诊获取处方药并委托他人代领,涉嫌违反《医疗法》被首尔西部地方法院判处罚金500万韩元。 ... [详细]
2026-09-24
李梦在综艺中回应耍大牌争议,承认性格有缺陷但未故意难搞,表示将用实际行动和作品证明自己,近期在《兰香如故》中饰演赵星棠引关注。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
关于舌钉,一定是从欧美流传过来的朋克风,很多人喜欢在脸上、身上穿各种环,打各种钉,可能是
折耳根是一种在南方很常见的植物,北方人可能很少人知道折耳根是什么。下面就让我们先来
说到卢森堡这个国家,大家都知道这是一个比较小的国家,但是卢森堡的经济是相当的发达的,可