新闻笔记 · IDAEO AI News

Claude Opus 5.5性能升级、成本降40% OpenAI火速推出GPT-6 Sol、Luna
#AI模型竞争

Claude Opus 5.5性能升级、成本降40% OpenAI火速推出GPT-6 Sol、Luna

发布者:

TL;DR · 这代表什么

AI模型竞争转向成本与效率,高端模型价格不再遥不可及

相关实体 News Cnyes

新闻正文

完整中文翻译制作中,以下为原文。

Anthropic周二(22日)突然发布Claude Opus 5.5, 成为新一代Claude 5.5系列首款模型。Anthropic表示, Opus 5.5在多数工作任务上的表现已达到Claude Fable 5.1水准, 但典型工作负载的运算成本较上一代Opus 5降低40%, 输出速度则提高超过30%。新模型发布后不久, OpenAI也推出GPT-6 Sol及GPT-6 Luna, 让人工智能模型竞争迅速从性能较量延伸至价格与推理效率竞赛。

Anthropic指出, Claude Opus 5.5主要针对智能体编程、电脑操作及知识工作进行强化, 并称新模型在相关测试中取得领先表现。Anthropic此次发布也被视为公司在OpenAI推出GPT-6 Astra后的直接回应。此前Anthropic首席执行官Dario Amodei才公开呼吁AI产业放慢前沿模型发展速度, 因此此次推出新旗舰模型也受到市场关注。

在编程能力方面, Opus 5.5在Terminal-Bench 4.0取得66.4%成绩, 高于Fable 5.1的55.8%及Opus 5的52.3%。该测试主要评估AI在真实终端环境中处理复杂、多步骤编程工作的能力。

在FrontierCode v1.1测试中, Opus 5.5取得54.4%, 略高于GPT-6 Astra的53.3%。另外, 在CursorBench 4.0中, Opus 5.5取得57.8%, 主要测试AI处理来自真实Cursor开发环境、涉及多个文件及模糊需求的编程任务。

知识工作方面, Anthropic公布的GDPval-AA v2.1测试显示, Opus 5.5取得1846 Elo, Opus 5则为1708。该测试涵盖44种职业的实际工作任务, 用于评估AI处理专业知识工作及产出成果的能力。

Anthropic同时表示, Opus 5.5在一项涉及约2,000个仿真情境的自动化行为审查中取得公司迄今最佳成绩。公司表示, 新模型尝试突破既定限制的次数较Opus 5及Claude Mythos 5.1降低约85%, 并加强对提示注入等风险的防护。

不过, Anthropic也强调, 新模型并非没有风险。公司表示, 随着模型能力提高, 如何在长时间任务及高风险领域维持安全控制仍然是一项持续性的研究问题。涉及高风险网络安全及生物科学工作的部分功能, Anthropic仍采取额外限制, 部分任务会转交其他模型处理, 特定研究人员则须经验证才能使用。

除了性能之外, Anthropic这次也特别强调Opus 5.5的沟通方式有所改变。公司表示, 新模型会把重要信息放在回答前段, 减少不必要的术语、冗长说明及重复内容, 让长时间的人机协作更容易阅读与检查。

Box(American public cloud content company, BOX-US)AI产品主管Yashodha Bhavnani在Anthropic公布的测试中表示, Opus 5.5在相关测试中的token使用量约为上一代三分之一, 回应冗长程度降低约40%。GitHub产品主管Mario Rodriguez则表示, 在Visual Studio Code环境中, 新模型完成更多终端任务所需步骤少于Opus 5。

Anthropic还公布一项实际测试, 一名测试者利用Opus 5.5在不到一天内完成约68万行代码的迁移工作。Anthropic表示, 这类工作若由传统工程团队完成, 原本可能需要数周时间。不过, 这类案例属于个别测试结果, 并不代表所有大型代码迁移任务都能达到相同效率。

在成本方面, Opus 5.5的API价格为每100万个输入token 4美元, 输出token 20美元, 比Opus 5的价格各降低20%。其中, 缓存读取价格由每100万token 0.50美元降至0.20美元, 降幅达60%。

Anthropic表示, 按照典型工作负载计算, Opus 5.5整体运算成本较Opus 5低40%, 同时输出速度提高超过30%。若使用Fast模式, 输入token价格为每100万个8美元, 输出token为40美元, 可换取更快的回应速度。

不过, 单纯比较每token价格并不能完全反映AI模型完成一项工作的实际成本。不同模型在解决相同任务时可能使用不同数量的token, 推理深度及工具调用次数也会影响最终成本。因此, Opus 5.5与其他模型之间的价格比较, 仍须搭配实际工作负载及token使用量观察。

就在Anthropic公布Opus 5.5后不久, OpenAI推出GPT-6 Sol及GPT-6 Luna, 形成前后脚的竞争态势。OpenAI表示, 两款模型均采用GPT-6 Astra相关技术成果, 但分别针对不同成本及性能需求进行优化。

其中,GPT-6 Sol主要定位在需要较高推理能力的日常工作、编程及智能体任务,GPT-6 Luna则定位于大量、高频率且对成本敏感的工作, 包括摘要、数据截取及其他例行任务。

OpenAI公布的价格显示,GPT-6 Sol每100万个输入token为2美元, 输出token为10美元; GPT-6 Luna则为输入0.10美元、输出0.50美元。相较GPT-5.6同名模型, 两款新模型的API价格大幅降低。

OpenAI也表示,GPT-6 Sol及Luna采用更有效率的缓存机制, 缓存输入token读取可享有90%的价格折扣。两款模型目前已通过API提供, 并陆续在ChatGPT Work及Codex向Plus、Pro、Business、Enterprise及Edu用户推出,GPT-6 Luna也向Free及Go用户开放桌面版使用。

指针 Claude Opus 5.5 GPT-6 Astra GPT-6 Sol GPT-6 Luna

定位 Anthropic 高端模型 OpenAI 高端模型 OpenAI 中阶/高性价比 OpenAI 低成本模型

Terminal-Bench 4.0 66.4% 57.9% 约44%* —

FrontierCode v1.1 54.4% 53.3% — —

CursorBench 4.0 57.8% — — —

AutomationBench 40.0% 41.4% — —

GDPval-AA v2.1 1846 1542 — —

API输入价格 / 100万 tokens $4 $10 $2 $0.10

API输出价格 / 100万 tokens $20 $50 $10 $0.50

相对 Opus 5 运行成本 低40% — — —

发布时间 2026/9/22 2026/9 2026/9/22 2026/9/22

这场新一轮模型竞争的内核已不再只是单纯追求最高基准测试分数。随着企业将AI导入编程、客服、数据分析、研究及办公流程, 模型完成单一任务所需的成本、速度、可靠性及工具使用能力, 正逐渐成为企业选择模型的重要因素。

Anthropic此次将Opus 5.5定位为高端模型, 但通过降低token价格及提高推理效率, 试图缩小高性能模型与成本之间的落差。OpenAI则通过GPT-6 Sol及Luna扩大产品线, 将GPT-6 Astra的部分能力下放至价格更低的模型。

两家公司目前也都在加速AI模型的产品化。Anthropic表示, Claude Sonnet 5.5及Claude Haiku 5.5将在未来几周推出, 意味着Claude 5.5系列将从旗舰模型进一步延伸至中阶及轻量级产品。

Anthropic的Opus 5.5目前已可通过Claude Developer Platform使用, 并通过Amazon Web Services(Amazon, AMZN-US)、Google Cloud及Microsoft Azure(Microsoft, MSFT-US)等主要云端平台提供。这使企业客户可以直接将新模型集成进既有的云端及AI工作流程。

另一方面, OpenAI近期也持续扩大GPT-6产品线。今年9月初推出GPT-6 Astra后, OpenAI又于9月17日推出Astra for Law, 将模型能力进一步延伸至法律研究及律师事务所等专业市场。

因此, Opus 5.5与GPT-6 Sol、Luna的相继推出, 显示前沿AI模型市场正进入新的竞争阶段。模型业者一方面持续提升编程、知识工作及智能体能力, 另一方面则通过降低token价格、提高推理效率及推出不同级别产品, 争取企业客户及大规模商业部署。

对AI开发者而言, 下一阶段的竞争焦点可能将从「谁的模型最强」逐渐转向「谁能以更低成本、更快速度完成更多实际工作」。Anthropic与OpenAI在同一天密集推出新模型, 也让这场竞争从性能、价格一路延伸至安全性、企业应用及AI智能体的实际工作能力。

数字与意义

40%

Claude Opus 5.5典型工作负载运算成本较上一代Opus 5降低40%

今日小测

Claude Opus 5.5在Terminal-Bench 4.0取得多少成绩?