2026-03-28
探讨白羊座男与双鱼座女的星座配对,分析他们的性格差异、相处之道及爱情前景,为星座爱好者提供有价值的参考。 ... [详细]
|
本文来自徽声在线旗下公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在正式发布新一代模型GPT-6 Astra后,语出惊人地宣称:“欢迎来到AGI时代。” 仅仅三天后,英伟达CEO黄仁勋在社交媒体平台上的表态更加直白:“从ChatGPT到o1,再到如今的GPT-6 Astra,仅仅用了四年时间。AGI已然降临。” 众人翘首以盼的AGI,难道就这样毫无预兆地实现了? 显然,事情远没有这么简单明了。 在GPT-6 Astra发布前不久,OpenAI首席执行官山姆·奥尔特曼还曾表示,AGI是一个“定义极为模糊的词汇”,甚至一度差点将其称作“无关紧要的营销术语”。 负责GPT-6 Astra关键评测工作的ARC Prize团队也特别提醒:GPT-6 Astra确实在通用化能力方面取得了重要进展,但“我们并不宣称它就是AGI”。 一边是“欢迎来到AGI时代”的热烈宣告,一边是“我们没有说这是AGI”的谨慎澄清。 当下,人人都在谈论AGI,然而却没有人能够清晰明确地说出:AI究竟要达到何种程度,才算真正跨越了AGI这道门槛。 ■榜单上的高评分,真的等同于AGI吗?先来看看GPT-6 Astra令人惊叹的成绩,它在ARC-AGI-3评测中取得了99.9%的高分。 ARC-AGI评测与普通评测有着显著差异。它不会直接告知模型规则,而是将模型置于陌生环境中,让模型自行判断目标、理解反馈,进而找到解决办法。 这项评测旨在衡量的,正是当前AI备受质疑的一种能力:面对从未见过的问题,能否在现场快速学会应对。 99.9%的得分固然惊人,但这个数字背后有一个常常被忽略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra的得分仅为62.7%;而接入OpenAI提供的专用适配框架后,得分才大幅提升至99.9%。 后者允许模型保留跨请求的隐藏推理状态,并能够利用上下文压缩延续此前的探索经验。 我们无法简单地将OpenAI的这种操作归结为“作弊”。毕竟,现实中的AI本来就不会以裸机状态运行。记忆、工具以及运行框架都可能成为智能系统的重要组成部分。 问题在于,62.7%的得分更接近于对单个模型能力的测量;而99.9%的得分测量的则是一套经过专门优化的完整系统。 这两项成绩都是真实存在的,但却不能混为一谈。更不能将99.9%的测试得分,轻易地换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测中的表现,也并未呈现出一个无懈可击的通才形象。 在高难数学测试FrontierMath Tier 4上,它取得了97.6%的成绩;在计算机操作测试OSWorld 2.0上,得分为72.6%;然而到了更接近真实办公流程的AutomationBench测试中,成绩却降至41.4%;在复杂专业任务测试Agents’Last Exam上,也只有59.3%。 这些数据真正表明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类水平;但一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁出现失败的情况。 AI在封闭考试中表现出色,这并非新鲜事。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,那么通用智能大概也不远了。 然而,规则明确、反馈即时、有自动裁判的世界,与现实生活有着本质的区别,并非一回事。 ■人人都在谈论的AGI,真的是同一个概念吗?AGI至今仍然缺乏统一的共识定义。 OpenAI采用了最具经济导向的定义方式。其在2018年发布的公司章程中,将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含了三个关键条件——覆盖广泛的工作领域、表现超过人类水平、能够高度自主运行。 现实工作中的产出构成了衡量AGI的核心尺度。而意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型致力于提升复杂任务的处理能力,智能体强化工具调用和计算机操作能力,Codex等产品进一步深入软件开发流程。 各项能力最终都汇聚向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式则更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多的模糊含义,因此更常使用“强大的AI”这一表述。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪详细描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含了能力、自主性和复制规模三个变量。这三个变量共同决定了AI的现实影响,同时也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理紧密绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度进行处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布了认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程采用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立了20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路将AGI从单一标签转化为可比较的认知能力图谱,也充分体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发工作。 关于AGI的定义,不仅仅是一个概念层面的问题。 采用何种标准,就会将何种能力视为关键进展;将何种能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 定义看似只是在描述未来,实际上也在悄然塑造着未来。 ■为何说“AGI是否到来”,已成为一场叙事之争?人们总是习惯将技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。这些历史时刻都需要明确的日期,也偏爱标志性的画面。 回到当下关于AGI到来的争论,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是一个可以被质疑和检验的技术结论:既然它声称是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到了独立验证。 后者则更像是一种时代判断。布罗克曼所说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻的感觉,又保留了足够大的解释空间。 对于模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事工具。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串的评测、条件和限定语。 而“AGI时代来了”这样的表述,却可以把一切复杂的信息压缩成一句话。 它将一次模型发布从单纯的产品升级转变为历史节点,也将算力投入、技术路线和商业前景组织进同一个引人入胜的故事中。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整的消息。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到了训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有充分的理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 由此可见,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 那么,AGI怎样才算真的来了呢?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也许,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪里。 本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]。 本文来自徽声在线,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp |
我国科研团队新型薄膜光伏研究获重大突破
“AI相对论”:中国智驾下半场深度剖析4️⃣ 关注@徽声在线汽车 查看【完整版】#智能驾驶 #AI相对论
布加迪五折叠电视惊艳亮相,售价270万展开需45秒,闲置秒变边柜 2026-08-28
骑士队以老将底薪签约西甲MVP海佐尼亚,这位克罗地亚前锋在欧洲赛场斩获多项荣誉后重返NBA。勇士引援失利暴露战略短板,东部格局或因这笔签约产生新变化。 ... [详细]
2026-07-08
云南玉昆外援奥斯卡在接受专访时表示,若时光能倒流仍会选择来中国踢球,并希望在中国一直踢到退役。他分享了自己在中国足球生涯的成长与感悟,以及对中国文化和生活的喜爱。 ... [详细]
2026-05-31
八年前因绝望拍卖球迷身份的埃文·佩尔穆特,面对老东家尼克斯重返总决赛的盛况,坚持认为球队成功纯属运气。这场关于忠诚与现实的博弈,正随着总决赛进程引发持续关注。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
喜当爹虽然和恭喜当爹就差一个字,但是意义可是差了十万八千里,当然这个词也是因为一个特
我们的生活之中。无论是面对面还是线上交流,我们不仅会使用文字语言,还会配比适当的肢体
于震寰结婚的消息这几天都挂在网上引发热议,更多的人不解,这是谁,干什么的,结婚是啥大事吗