2026-06-16
马洛·古斯托2023年加盟切尔西后迅速成长,从英超首秀到世俱杯夺冠,盘点这位法国新星在蓝军的五大里程碑时刻。 ... [详细]
|
就在刚刚,人工智能领域迎来重大突破,Anthropic 正式发布新一代 AI 模型 Claude Fable 5.1 和 Claude Mythos 5.1。 据 Anthropic 官方介绍,Claude Fable 5.1 是当下公开可用的最强大模型之一,其设计初衷是应对复杂推理、长周期任务以及 Agent 工作流等高难度场景。而 Claude Mythos 5.1 则代表着 Anthropic 在探索 AI 更高能力边界方面的新成果。 值得注意的是,尽管这两个模型共享相同的基础模型能力,但针对不同的使用场景,它们采用了差异化的安全措施。 其中,Fable 5.1 面向普通用户、开发者和企业全面开放,旨在满足各类日常和商业需求;而 Mythos 5.1 则主要面向经过严格审核的高风险领域合作伙伴,其访问控制更为严格,以确保在敏感场景下的安全使用。 换句话说,Fable 5.1 将更多地融入现实世界的工作中,而 Mythos 5.1 则被保留在更为严格管控的环境里。这或许也是 Anthropic 对未来 AI 产品形态的一次重要探索:即便是最强大的模型,也不一定会以完全相同的形式提供给所有人。 Anthropic 官方表示,这两个模型的发布代表了 Claude 系列能力的重要进展,同时也展示了他们在提升模型能力的同时,如何继续推进安全部署的坚定决心。 作为被冠以「地表最强」之称的 Fable 5.1,其性能表现依旧令人瞩目。官方数据显示,Fable 5.1 在多项基准测试中的表现均优于上一代旗舰模型 Fable 5。 更令人惊喜的是,Fable 5.1 在性能提升的同时,价格却更为亲民。Anthropic 宣布,Fable 5.1 将保持基础价格不变,而缓存读取成本相比 Fable 5 降低了高达 75%。在实际使用中,这意味着模型的整体成本对于典型工作负载将降低约 25%;而对于高度 Agent 化的工作负载,成本最高可降低 45%。 看来,即便是最强大的模型,也开始注重性价比了。 接下来,让我们更详细地了解一下。 低档位追平上一代,Fable 5.1 主打「高性价比」 与单纯追求刷新榜单不同,Anthropic 此次更想强调的是:Fable 5.1 能够以更低的推理成本,完成过去需要 Fable 5 高档位才能完成的任务。 根据官方测试,Fable 5.1 在低、中等推理强度下,已经能够取得接近甚至超过 Fable 5 的表现。例如,Claude Code 默认使用高推理强度,而 Claude Cowork 和 Claude.ai 则默认使用中等强度。用户可以根据任务的复杂程度,在速度、成本与效果之间进行灵活调整。 具体来看,Fable 5.1 在科学研究型 Agent 基准 Terminal-Bench-Science 0.1 中取得了 52.6% 的优异成绩,相比 Fable 5 的 24.7% 提升超过一倍;在 Terminal-Bench 4.0 中,Fable 5.1 达到了 55.8%,而开放更多能力的 Mythos 5.1 则进一步达到了 60.9%。 在知识工作、计算机操作和业务流程测试中,新模型同样取得了显著提升。AutomationBench 成绩从 Fable 5 的 17.1% 提高到 31.4%,CursorBench 3.2.0 则从 70.5% 提高到 73.4%。 在多项基准测试中,Fable 5.1 的成绩均全面超越 Fable 5,尤其在科学研究型 Agent 与商业工作流能力方面提升最为明显。 在 Terminal-Bench 4.0 测试中,Fable 5.1 与 Mythos 5.1 在不同推理强度下均全面超越上一代 Mythos 5。 在 Terminal-Bench-Science 0.1 测试中,Fable 5.1 最高得分达到 52.6%,是 Fable 5 的两倍多。 Anthropic 认为,Fable 5.1 的一项重要变化是,它更愿意追踪问题的根本原因,也更适合执行持续数小时甚至数十小时的复杂任务。 投资机构 Millennium 在测试中发现,一段内部代码大约每百万次运行会崩溃一次。这个问题困扰了工程团队四五年之久,其他模型也未能找出原因。而 Fable 5.1 则通过反汇编外部供应商的程序库、比对核心转储文件,最终将问题定位到第三方程序库中的一个 Bug。 Ramp 还让 Fable 5.1 连续运行了 38 小时。模型在发现原有机器学习结果受到标签错误影响后,自行修正问题,并发启动六组实验,最终整理出新的结果与后续建议。 从写代码到做科研,Fable 5.1 展现全面能力 在此次发布中,Anthropic 用相当大的篇幅介绍了 Fable 5.1 与 Mythos 5.1 在科学研究领域的出色表现。 在蛋白质设计实验中,研究人员让 Mythos 5.1 调用开源蛋白质设计与折叠工具,再将生成的设计交给两个外部机构进行实验验证。 结果显示,在三个目标蛋白上,Mythos 5.1 设计的结合剂亲和力达到了 Adaptyv Bio 相关蛋白质设计竞赛最佳方案的 10 倍。面对 12 个目标蛋白时,模型设计的有效结合剂命中率接近 50%,而 Anthropic 给出的行业常见水平仅为 10% 至 15%。 此外,Fable 5.1 还利用 30 多年前 NASA 麦哲伦号探测器采集的雷达图像,为金星约三分之一的表面生成了一张新的高分辨率高程图。 NASA 麦哲伦号探测器拍摄的金星雷达图像,画面中央为一座直径约 15 公里的小型盾状火山。 原有地图只能呈现 10 至 20 公里尺度的细节,而新地图将分辨能力提高至 2 至 3 公里,高度测量准确度最多提升 25%。Anthropic 计划以知识共享许可公开这张地图,供 NASA VERITAS 和欧洲航天局 EnVision 等后续任务参考。 在计算生物学领域,Mythos 5.1 通过编写定制 GPU 内核、缓存中间结果,将 7 个开源蛋白质与基因组深度学习模型的运行速度最高提高 2.5 倍,同时保持输出结果一致。在部分全基因组分析任务中,预计可以降低 30% 至 60% 的 GPU 成本。 Mythos 5.1 优化 7 个开源蛋白质与基因组模型后,推理速度提高 1.4 至 2.5 倍。 Anthropic 想通过这些案例证明,模型正在从整理资料、编写代码等基础任务,进一步走向提出方案、运行工具并交付可供实验验证的科研结果。 缓存价格大幅下降,Agent 任务成本最高降低 45% 除了性能提升外,价格是 Fable 5.1 另一个引人注目的变化。 Fable 5.1 的输入和输出价格保持不变,仍为每百万 Token 10 美元和 50 美元,但缓存读取价格从原来的水平下调 75%,降至每百万 Token 0.25 美元。 缓存读取指的是模型重复使用已经处理过的上下文。在普通问答中,缓存读取的占比可能有限;但在需要反复读取代码库、历史对话和工具结果的 Agent 任务中,缓存往往构成主要成本。 按照 Anthropic 对 2026 年 8 月实际使用数据的测算,Fable 5.1 运行典型任务的整体费用比 Fable 5 低约 25%;对于上下文较长、工具调用频繁的复杂 Agent 任务,成本降幅最高可达到约 45%。 缓存读取价格下调后,Fable 5.1 典型任务成本降低约 25%,高 Agent 化任务成本最高降低约 45%。 目前,Fable 5.1 已经登陆 Claude.ai、Claude Code 和 Claude API,同时通过 AWS、Google Cloud 与 Microsoft Azure 提供。开发者可以通过 claude-fable-5-1 调用新模型。 防蒸馏机制再升级,安全性能全面提升 Fable 5.1 和 Mythos 5.1 实际上使用了同一个底层模型,二者的主要区别在于安全限制。 Fable 5.1 面向普通用户和企业全面开放;而 Mythos 5.1 则拥有更宽松的网络安全和生命科学限制,目前只提供给经过审核的个人与机构。 在网络安全领域,Fable 5.1 已经能够帮助用户发现软件漏洞,但仍不能直接生成漏洞利用程序。渗透测试、漏洞利用生成和基于二进制文件的漏洞扫描等双重用途任务,依然可能被转交给限制更严格的模型处理。 经过调整后,新版网络安全防护机制的误拦截次数较 Fable 5 减少约 60%。生物安全机制对基础生物学和医疗问题的误拦截率也降低了 85%,涉及生命科学研发的高级能力则主要通过 Mythos 5.1 的审核计划开放。 Anthropic 还推出了 Enterprise Frontier Safeguards。企业可以将数据保存在自己控制的云基础设施中,由企业负责默认的人工审查,从而在保留安全监测能力的同时,实现接近「零数据保留」的隐私效果。这套机制计划从今年秋季开始分阶段上线。 针对大规模模型蒸馏,Fable 5.1 也加入了新的限制措施。当天以后创建的 API 账户,将无法在保留 Claude 历史思考记录的同时,手动修改多轮对话中的先前上下文。Anthropic 表示,这项改动主要用于阻断一种已经公开的能力提取方法。 此外,为满足欧盟《人工智能法案》的要求,Fable 5.1 的文本输出将包含不可见水印。Anthropic 同时开始小范围测试检测 API,首批面向监管机构、媒体、事实核查组织和研究机构开放。 最后,正如网友所言,早起的鸟儿早用到 5.1,让我们共同期待 AI 技术的更多突破! 参考链接: https://x.com/claudeai/status/2094848572143407483 https://www.anthropic.com/claude-fable-and-mythos-5-1 https://techcrunch.com/2026/09/01/anthropics-new-fable-release-is-cheaper-less-restrictive/ |
英伟达35亿美元战略投资联发科 共建AI计算新生态
震撼冲线!48分19秒,人形机器人‘闪电’勇夺2026半马桂冠
深圳网约车市场趋于饱和,官方发布重要风险提示 2026-07-18
冉莹颖在《姐姐当家》中自曝十年三次离婚未果,引发网友热议。同时,她在视频平台涨粉迅速,已签约MCN机构,商业版图持续扩张。 ... [详细]
2026-04-13
柏林联合任命玛丽-路易斯-埃塔为德甲首位女教练,这一历史性决定引发支持与质疑的激烈碰撞。从球迷论战到政客表态,从媒体热议到社会反思,德国足球正经历前所未有的性别平权考验。 ... [详细]
2026-07-17
俄罗斯在面临冲突与制裁的困境下,开始深刻反思发展模式,高层表态强调自主发展的重要性,并间接认可中国自主产业建设的道路具有远见卓识。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
以前的时候,感觉男生都很喜欢穿帆布鞋的,现在好像男生们更愿意去穿板鞋还有运动鞋以及休
艺人的成功离不开自己的努力,更离不开经纪人的经营,一个好的经纪人会让娱乐圈的环境更加
提到泰国就会知道想到人妖,那是打败了泰国庙宇成为泰国连接的第一联想词组,这泰国人妖真