2026-06-08
纽约市长佐赫兰·马姆达尼预测摩洛哥将首夺世界杯,美国队进八强,葡萄牙巴西爆冷出局,详解其基于情感与理性的独特预测逻辑。 ... [详细]
|
本文源自徽声在线旗下公众号:深流研究所,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,公开宣称:"AGI时代已然开启。" 仅隔三日,英伟达CEO黄仁勋在社交平台发文强调:"从ChatGPT到o1,再到GPT-6 Astra,仅用四年时间,AGI已成现实。" 这场突如其来的AGI宣言,是否意味着人类智能的终极形态已然降临? 现实远比宣言复杂得多。 就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼仍坦言:"AGI是个定义模糊的概念,甚至可视为营销术语。" 负责关键评测的ARC Prize团队也明确声明:"虽然GPT-6 Astra展现重要通用能力突破,但并未达到AGI标准。" 这种自相矛盾的表述背后,折射出行业对AGI定义的深层分歧。 当科技巨头们竞相宣称AGI时代来临,却无人能清晰界定:AI究竟需要跨越哪些门槛,才算真正实现通用人工智能? ■评测榜单的高分,真能等同AGI吗?GPT-6 Astra最引人注目的成就,是在ARC-AGI-3评测中取得99.9%的惊人成绩。 这项特殊评测与传统测试截然不同:不提供明确规则,而是将模型置于陌生环境,要求其自主判断目标、理解反馈并寻找解决方案。 该测试旨在衡量AI最受质疑的核心能力——面对未知问题的现场学习能力。 99.9%的得分看似完美,却隐藏着关键前提: 在ARC Prize提供的标准测试框架下,GPT-6 Astra仅得62.7分;当接入OpenAI专属适配框架后,得分才飙升至99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续探索经验,这相当于为AI配备了"记忆外挂"。 这种操作虽不能简单定义为作弊,却揭示重要现实:现实中的AI系统本就包含记忆、工具和运行框架等组件。 问题在于:62.7分反映的是单一模型能力,而99.9分测量的是优化后的系统整体表现。 两项数据均真实有效,但绝不能将99.9%的测试得分直接等同于"99.9%的AGI实现度"。 更值得关注的是,GPT-6 Astra在其他测试中的表现参差不齐: 在高难度数学测试FrontierMath Tier 4中取得97.6%的高分,计算机操作测试OSWorld 2.0获得72.6%;但在模拟真实办公流程的AutomationBench测试中,成绩骤降至41.4%,复杂专业任务测试Agents’Last Exam也仅有59.3%。 这些数据揭示的真相是:当任务规则明确、答案可验证时,Astra已接近或超越人类水平;但面对流程冗长、目标模糊的现实场景,其表现仍差强人意。 AI在封闭测试中的优异表现并非新鲜事。 深蓝击败国际象棋冠军、Watson赢下《危险边缘》、AlphaGo走出"神之一手"时,都曾引发类似猜想:既然机器能征服如此复杂的任务,通用智能或许近在咫尺。 但规则明确、反馈即时、有自动裁判的测试环境,与充满不确定性的现实世界有着本质区别。 ■各执一词的AGI定义,究竟谁说了算?当前AGI领域最突出的矛盾,在于缺乏统一认知框架。 OpenAI采用经济导向的定义:2018年公司章程将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。 这一定义包含三个核心要素:广泛的工作覆盖范围、超越人类的表现水平、高度自主的运行能力。 值得注意的是,意识、情感和人类式思维并未被纳入必要条件。 这种标准与OpenAI近年来的产品路线高度契合: 推理模型提升复杂任务处理能力,智能体强化工具调用和计算机操作,Codex等产品深入软件开发流程,所有能力最终指向同一个目标——让AI承担更完整的工作,将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的态度更为审慎。CEO达里奥·阿莫迪认为该术语承载过多模糊含义,因此更倾向使用"强大AI"的表述。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描绘了具体系统图景: 这类系统需在多数重要领域达到或超越顶尖专家水平,能够独立完成持续数小时至数周的任务,并可复制成数百万实例以远超人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量,三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这种判断,Anthropic将能力扩展与风险治理紧密结合,其战略重点可概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind则聚焦于AGI的测量标准。 2023年发布的《Levels of AGI》论文,以"性能"和"通用性"为双轴,将通用智能划分为"新兴""胜任""专家""大师"和"超人类"五个等级,并将自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步推出认知分类框架,将通用智能拆解为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程采用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置作为参照。 DeepMind还与Kaggle合作设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这种思路将AGI从单一标签转化为可比较的认知能力图谱,体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 AGI的定义之争远非学术讨论,它深刻影响着行业发展方向: 采用何种标准,就会将何种能力视为关键进展;将何种能力视为关键进展,就会决定企业的产品路线、资源配置和安全重点。 定义不仅在描述未来,更在塑造未来。 ■AGI之争:一场精心策划的叙事博弈?人类总倾向于将技术革命想象为某个明确的历史瞬间。 莱特兄弟的飞机离地升空、第一颗原子弹爆炸、阿波罗11号登月,这些标志性事件都因具体时间点而被载入史册。 历史需要日期,也偏爱戏剧性画面。 回到当前的AGI争论,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"这两种表述,本质上是不同性质的宣言: 前者是可被质疑和检验的技术结论——若声称某系统是AGI,需说明采用的定义、满足的条件,以及在哪些独立测试中得到验证; 后者则是更具象征意味的时代判断,正如布罗克曼所言"欢迎来到AGI时代",这种表述既创造了历史时刻,又保留了足够的解释弹性。 对模型公司和AI产业链而言,"AGI"首先是强大的产品叙事工具。 模型能力的真实进步往往是零散而不均衡的,准确描述这些变化需要一长串评测数据、条件限定和解释说明。 而"AGI时代来临"的宣言,却能将复杂的技术演进压缩成一句简洁有力的口号。 它不仅将一次模型发布从产品升级提升为历史节点,更将算力投入、技术路线和商业前景编织成同一个引人入胜的故事。 对于争夺用户、企业客户、人才和资本的科技公司而言,这种叙事的价值或许不亚于一次真正的技术突破。 黄仁勋的表态必须放在这个叙事框架中理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向:OpenAI计划部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施落地,向OpenAI投资最高1000亿美元。 虽然这只是一份意向书而非最终协议,后续也传出方案可能调整的消息,但在最初合作设想中,英伟达被定位为OpenAI扩建AI基础设施的首选计算与网络合作伙伴。双方公告明确表示,这些设施将服务于OpenAI"迈向部署超级智能"的路径。 近期黄仁勋宣布"AGI已经到来"时,特别强调训练Astra所使用的英伟达计算系统,以及即将上线的下一代GPU。 这段话隐含着清晰的因果链:大规模算力投入带来智能跃迁,因此需要持续扩大算力投资。 作为全球AI算力扩张的主要受益者,英伟达有充分动机强调这是时代转折点。 事实上,这并非黄仁勋首次宣布AGI到来: 2024年他曾表示,若将AGI定义为能通过几乎所有人类设计的考试,这一目标可能在五年内实现; 到2026年3月,他又在Lex Fridman的播客中宣称:"我认为我们已经实现了AGI。" 由此可见,AGI不仅是技术演进的终点,更是影响资本流向、市场预期、政策制定和产业布局的重要叙事资源。 那么AGI究竟何时才算真正到来?是某次模型发布、某项评测纪录,还是某家公司的宣言? 或许正如OpenAI创始成员Andrej Karpathy所言:AGI不会带来一条陡然拐起的曲线,它会平滑地融入技术增长轨迹,事后人们甚至找不到明确的转折点。 本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]。 本文来自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp |
苹果折叠屏iPhone专用手写笔测试中,或颠覆乔布斯传统观念
比特币突破74000美元 加密货币市场全线走强 2026-06-08
纽约市长佐赫兰·马姆达尼预测摩洛哥将首夺世界杯,美国队进八强,葡萄牙巴西爆冷出局,详解其基于情感与理性的独特预测逻辑。 ... [详细]
2026-08-13
8月4日深圳男篮官宣顾全2026 - 2027赛季任主帅。34岁的他成新赛季最年轻主帅,球员生涯成功但连续两赛季0出场,转型主帅面临诸多挑战。 ... [详细]
2026-08-25
徽声在线独家报道,那不勒斯正评估引进马竞门将穆索,同时塞尔维亚国门米林科维奇-萨维奇未来存变数,俱乐部将根据转会报价和伤病情况做出最终决策。 ... [详细]
2026-08-08
马德里竞技与国际米兰展开对热刺队长罗梅罗的争夺,球员续约仅9个月即可能离队。热刺同步推进防线重组,范德文续约至2029年,夏窗需引进两名中卫补充阵容。 ... [详细]
2026-06-11
HBO犯罪剧《Task》第二季迎来豪华阵容升级,埃德加·拉米雷兹、马克·鲁法洛与马赫沙拉·阿里强强联手,剧情走向扑朔迷离,值得期待。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
关于舌钉,一定是从欧美流传过来的朋克风,很多人喜欢在脸上、身上穿各种环,打各种钉,可能是
作为是国内高空挑战第一人的吴永宁,很多人应该都不会陌生,很多人都看过他的户外极限挑战
位于北京中轴线上的故宫是我国的文化瑰宝,也是世界五大宫之首。几百年前,这座皇宫还是只