新聞筆記 · IDAEO AI News

Claude Opus 5.5性能升級、成本降40% OpenAI火速推出GPT-6 Sol、Luna
#AI模型競爭

Claude Opus 5.5性能升級、成本降40% OpenAI火速推出GPT-6 Sol、Luna

發布者:

TL;DR · 這代表什麼

AI模型競爭轉向成本與效率,高階模型價格不再遙不可及

相關實體 News Cnyes

新聞正文

Anthropic周二(22日)突然發布Claude Opus 5.5, 成為新一代Claude 5.5系列首款模型。Anthropic表示, Opus 5.5在多數工作任務上的表現已達到Claude Fable 5.1水準, 但典型工作負載的運算成本較上一代Opus 5降低40%, 輸出速度則提高超過30%。新模型發布後不久, OpenAI也推出GPT-6 Sol及GPT-6 Luna, 讓人工智慧模型競爭迅速從性能較量延伸至價格與推理效率競賽。

Anthropic指出, Claude Opus 5.5主要針對智能體程式設計、電腦操作及知識工作進行強化, 並稱新模型在相關測試中取得領先表現。Anthropic此次發布也被視為公司在OpenAI推出GPT-6 Astra後的直接回應。此前Anthropic執行長Dario Amodei才公開呼籲AI產業放慢前沿模型發展速度, 因此此次推出新旗艦模型也受到市場關注。

在程式設計能力方面, Opus 5.5在Terminal-Bench 4.0取得66.4%成績, 高於Fable 5.1的55.8%及Opus 5的52.3%。該測試主要評估AI在真實終端環境中處理複雜、多步驟程式設計工作的能力。

在FrontierCode v1.1測試中, Opus 5.5取得54.4%, 略高於GPT-6 Astra的53.3%。另外, 在CursorBench 4.0中, Opus 5.5取得57.8%, 主要測試AI處理來自真實Cursor開發環境、涉及多個檔案及模糊需求的程式設計任務。

知識工作方面, Anthropic公布的GDPval-AA v2.1測試顯示, Opus 5.5取得1846 Elo, Opus 5則為1708。該測試涵蓋44種職業的實際工作任務, 用於評估AI處理專業知識工作及產出成果的能力。

Anthropic同時表示, Opus 5.5在一項涉及約2,000個模擬情境的自動化行為審查中取得公司迄今最佳成績。公司表示, 新模型嘗試突破既定限制的次數較Opus 5及Claude Mythos 5.1降低約85%, 並加強對提示注入等風險的防護。

不過, Anthropic也強調, 新模型並非沒有風險。公司表示, 隨著模型能力提高, 如何在長時間任務及高風險領域維持安全控制仍然是一項持續性的研究問題。涉及高風險網路安全及生物科學工作的部分功能, Anthropic仍採取額外限制, 部分任務會轉交其他模型處理, 特定研究人員則須經驗證才能使用。

除了性能之外, Anthropic這次也特別強調Opus 5.5的溝通方式有所改變。公司表示, 新模型會把重要資訊放在回答前段, 減少不必要的術語、冗長說明及重複內容, 讓長時間的人機協作更容易閱讀與檢查。

Box(American public cloud content company, BOX-US)AI產品主管Yashodha Bhavnani在Anthropic公布的測試中表示, Opus 5.5在相關測試中的token使用量約為上一代三分之一, 回應冗長程度降低約40%。GitHub產品主管Mario Rodriguez則表示, 在Visual Studio Code環境中, 新模型完成更多終端任務所需步驟少於Opus 5。

Anthropic還公布一項實際測試, 一名測試者利用Opus 5.5在不到一天內完成約68萬行程式碼的遷移工作。Anthropic表示, 這類工作若由傳統工程團隊完成, 原本可能需要數周時間。不過, 這類案例屬於個別測試結果, 並不代表所有大型程式碼遷移任務都能達到相同效率。

在成本方面, Opus 5.5的API價格為每100萬個輸入token 4美元, 輸出token 20美元, 比Opus 5的價格各降低20%。其中, 快取讀取價格由每100萬token 0.50美元降至0.20美元, 降幅達60%。

Anthropic表示, 按照典型工作負載計算, Opus 5.5整體運算成本較Opus 5低40%, 同時輸出速度提高超過30%。若使用Fast模式, 輸入token價格為每100萬個8美元, 輸出token為40美元, 可換取更快的回應速度。

不過, 單純比較每token價格並不能完全反映AI模型完成一項工作的實際成本。不同模型在解決相同任務時可能使用不同數量的token, 推理深度及工具調用次數也會影響最終成本。因此, Opus 5.5與其他模型之間的價格比較, 仍須搭配實際工作負載及token使用量觀察。

就在Anthropic公布Opus 5.5後不久, OpenAI推出GPT-6 Sol及GPT-6 Luna, 形成前後腳的競爭態勢。OpenAI表示, 兩款模型均採用GPT-6 Astra相關技術成果, 但分別針對不同成本及性能需求進行優化。

其中,GPT-6 Sol主要定位在需要較高推理能力的日常工作、程式設計及智能體任務,GPT-6 Luna則定位於大量、高頻率且對成本敏感的工作, 包括摘要、資料擷取及其他例行任務。

OpenAI公布的價格顯示,GPT-6 Sol每100萬個輸入token為2美元, 輸出token為10美元; GPT-6 Luna則為輸入0.10美元、輸出0.50美元。相較GPT-5.6同名模型, 兩款新模型的API價格大幅降低。

OpenAI也表示,GPT-6 Sol及Luna採用更有效率的快取機制, 快取輸入token讀取可享有90%的價格折扣。兩款模型目前已透過API提供, 並陸續在ChatGPT Work及Codex向Plus、Pro、Business、Enterprise及Edu用戶推出,GPT-6 Luna也向Free及Go用戶開放桌面版使用。

指標 Claude Opus 5.5 GPT-6 Astra GPT-6 Sol GPT-6 Luna

定位 Anthropic 高階模型 OpenAI 高階模型 OpenAI 中階/高性價比 OpenAI 低成本模型

Terminal-Bench 4.0 66.4% 57.9% 約44%* —

FrontierCode v1.1 54.4% 53.3% — —

CursorBench 4.0 57.8% — — —

AutomationBench 40.0% 41.4% — —

GDPval-AA v2.1 1846 1542 — —

API輸入價格 / 100萬 tokens $4 $10 $2 $0.10

API輸出價格 / 100萬 tokens $20 $50 $10 $0.50

相對 Opus 5 運行成本 低40% — — —

發布時間 2026/9/22 2026/9 2026/9/22 2026/9/22

這場新一輪模型競爭的核心已不再只是單純追求最高基準測試分數。隨著企業將AI導入程式設計、客服、資料分析、研究及辦公流程, 模型完成單一任務所需的成本、速度、可靠性及工具使用能力, 正逐漸成為企業選擇模型的重要因素。

Anthropic此次將Opus 5.5定位為高階模型, 但透過降低token價格及提高推理效率, 試圖縮小高性能模型與成本之間的落差。OpenAI則透過GPT-6 Sol及Luna擴大產品線, 將GPT-6 Astra的部分能力下放至價格更低的模型。

兩家公司目前也都在加速AI模型的產品化。Anthropic表示, Claude Sonnet 5.5及Claude Haiku 5.5將在未來幾周推出, 意味著Claude 5.5系列將從旗艦模型進一步延伸至中階及輕量級產品。

Anthropic的Opus 5.5目前已可透過Claude Developer Platform使用, 並透過Amazon Web Services(Amazon, AMZN-US)、Google Cloud及Microsoft Azure(Microsoft, MSFT-US)等主要雲端平台提供。這使企業客戶可以直接將新模型整合進既有的雲端及AI工作流程。

另一方面, OpenAI近期也持續擴大GPT-6產品線。今年9月初推出GPT-6 Astra後, OpenAI又於9月17日推出Astra for Law, 將模型能力進一步延伸至法律研究及律師事務所等專業市場。

因此, Opus 5.5與GPT-6 Sol、Luna的相繼推出, 顯示前沿AI模型市場正進入新的競爭階段。模型業者一方面持續提升程式設計、知識工作及智能體能力, 另一方面則透過降低token價格、提高推理效率及推出不同級別產品, 爭取企業客戶及大規模商業部署。

對AI開發者而言, 下一階段的競爭焦點可能將從「誰的模型最強」逐漸轉向「誰能以更低成本、更快速度完成更多實際工作」。Anthropic與OpenAI在同一天密集推出新模型, 也讓這場競爭從性能、價格一路延伸至安全性、企業應用及AI智能體的實際工作能力。

數字與意義

40%

Claude Opus 5.5典型工作負載運算成本較上一代Opus 5降低40%

今日小測

Claude Opus 5.5在Terminal-Bench 4.0取得多少成績?