
九月的新模型像下餃子一樣接連登場,卻大多只來得及各領風騷一兩天,很快又被下一款搶走風頭。
就在剛剛,Anthropic 正式發布了 Claude Opus 5.5。這是 Claude 5.5 家族的首款模型,未來幾周內還會有 Sonnet 5.5 和 Haiku 5.5 陸續登場。
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5. https://twitter.com/claudeai/status/2102435511222890900
Opus 5.5 並非一次常規的半代升級。官方稱,它在多數任務上的表現已經達到 Claude Fable 5.1 水平,相比 Opus 5 的典型任務成本降低 40%,輸出速度提高超過 30%。
半代升級,Opus 性能直逼 Fable
Anthropic 將 Opus 5.5 定位為面向長時間編程 Agent 和知識工作的主力模型。從官方公布的成績看,它在 Agent 編程、電腦操作和專業工作上都取得了明顯提升。

在 Terminal-Bench 4.0 中,Opus 5.5 得分為 66.4%,高於 GPT-6 Astra 的 57.9% 和 Opus 5 的 52.3%;FrontierCode v1.1 得分為 54.4%,略高於 GPT-6 Astra 的 53.3%;CursorBench 4.0 則從 Opus 5 的 46.6% 提高到 57.8%。

面向知識工作的 GDPval-AA v2.1 中,Opus 5.5 得到 1846 Elo,超過 Fable 5.1 的 1735 和 Opus 5 的 1708。在 OSWorld 2.0 電腦操作評測中,它也從 Opus 5 的 74.0% 提高到 81.8%。

優勢並沒有覆蓋所有項目。
Opus 5.5 在 AutomationBench 中得到 40.0%,略低於 GPT-6 Astra 的 41.4%;在 Terminal-Bench-Science 0.1 中得到 58.7%,與 Astra 的 64.6% 仍有差距。
Anthropic 自己也提醒,當前前沿模型之間的榜單差距,已經無法完整反映真實工作中的體驗。在公司內部使用中,Opus 5.5 與 Fable 5.1 的差距比部分評測結果看起來更小。

真正能體現此次升級的,是持續數小時甚至十幾個小時的長任務。
早期測試者曾用 Opus 5.5 在一天內完成一項涉及 68 萬行代碼的遷移工作;另一項 20 萬行代碼庫審計只用了不到三小時,而 Opus 5 完成同類任務超過 20 小時,token 消耗約為前者的 2.5 倍。
Anthropic 還讓 Opus 5.5 和 Fable 5.1 把 HAProxy 從 C 語言重寫為 Rust,兩者都通過了絕大多數回歸測試,Opus 5.5 用時 9.5 小時,Fable 5.1 用時 12 小時,前者成本低了 51%。
知識工作方面,在一項季度業績報告測試中,模型只能從一份較難檢索的網頁副本中尋找資料,任何虛構數字或引語都會導致失敗。Opus 5.5 在不同思考強度下提交的 18 份報告中有 16 份過關,Fable 5.1 和 Opus 5 沒有一次達到同一標準。
另一項虛構併購分析要求模型先在 Excel 中建立財務模型,再製作面向管理層的演示文稿。Opus 5.5 與 Opus 5 得出了相同結論,但前者的模型更完整,演示文稿也更清楚,完成時間從 93 分鐘縮短到 63 分鐘,成本降低一半。
降價之後,Opus 開始成為日常主力
比榜單更容易被用戶感知的變化來自價格和速度。
Opus 5.5 的 API 輸入和輸出價格分別為每百萬 token 4 美元和 20 美元,比 Opus 5 低 20%;緩存讀取價格從 0.50 美元降至 0.20 美元,降幅達到 60%。

除了輸入、輸出及緩存價格下調,Opus 5.5 還提供最高 2.5 倍速度的 Fast mode,價格為每百萬輸入 token 8 美元、輸出 token 40 美元。
模型支持 100 萬 token 上下文和 12.8 萬 token 最大輸出,思考模式始終開啟,默認 effort 為 medium,用戶可以根據任務調整思考強度。

長時間運行的 Agent 還能通過上下文壓縮整理較早的對話,同時保留最近回合,降低長任務被上下文拖慢的概率。
Opus 5.5 已經上線 Claude、Claude Code 和 Claude Platform,同時登陸 AWS、Google Cloud 與 Microsoft Azure,API 模型名稱為 claude-opus-5-5。它也成為 Claude 付費計劃的默認模型。
Anthropic 同時提高了 Pro、Max 和 Team 計劃的五小時使用限額。
ClaudeDevs 表示,此次限額直接增加 20%,更低的模型價格還會讓同一額度下的可用時長進一步增加約 25%。訂閱用戶還會獲得一次可自行選擇時間使用的額度重置,有效期截至 10 月 22 日。
If you're on Pro, Max, or Team, your reset is available today in Settings → Usage. Apply it any time until Oct 22. Opus 5.5 is the default for paid plans. It's priced lower than Opus 5, so your 5-hour and weekly limits go 25% further. https://twitter.com/ClaudeDevs/status/2102438803013333469
價格下降並不等於所有設置下的 token 消耗都會同步下降。
有開發者根據 Artificial Analysis 的測試指出,Opus 5.5 在 max 檔運行 Intelligence Index 時,輸出 token 消耗位居已測模型最高水平。
As expected, unfortunately the only bad thing about the new Opus is it's a token-gobbling monster. Uses the most tokens per Intelligence Index task of any model benchmarked. The price cut makes more sense here! https://twitter.com/synthwavedd/status/2102440897317064916
不過,官方所稱的單任務成本降低,主要建立在默認設置和典型工作負載上,且多數用戶不會長期使用 max 強度,真實成本仍會受到任務類型、推理檔位、上下文長度和緩存命中率影響。
社區最早出現的一批實測,大多集中在創意編程、3D 建模和可交互模擬。
Wes Bos 在連續一周使用並消耗大量 token 後認為,Opus 5.5 已經達到 Fable 級別;他讓模型渲染了 500 種常見健身器材,並據此做出一套完整的健身房搭建器。

BridgeMind 則用一次提示生成了可玩的 Mario Kart 遊戲。據其展示,Opus 5.5 生成的場景和玩法細節明顯多於 Fable 5.1 的版本,Mario、Luigi 等角色也被做進了遊戲。

更特別的案例來自 Jake Eaton。
他沒有使用圖像模型或現成繪圖軟體,而是讓 Opus 5.5 編寫約 7500 行 Python 代碼,通過標準庫模擬不同筆刷,再逐像素繪製出多種藝術風格。Ben Poole 展示的 sketch-to-simulation,則讓模型把草圖和概念示意直接轉化為可以運行的交互模擬。
for the past few months i've been asking our models to paint. opus 5.5 is very skilled at emulating different styles every image here is a python program generated pixel by pixel. there is no image model, and no off-the-shelf art software. instead, it's about 7,500 lines of code using standard libraries to emulate different brush styles. the agents don't use any pictures as reference, instead working only from what they know about each painter https://twitter.com/jkeatn/status/2102441348075057539
不過,Opus 5.5 的創意能力並非在所有方向都占優。
Auggie 用 Bach Benchmark 測試其音樂創作能力,生成的四聲部眾讚歌出現了聲部間距、重複音和平行八度等問題,他認為前一天由 Grok 4.7 生成的版本可能更好。
Opus 5.5 on the Bach Benchmark. I’m surprised. There are spacing issues, awkward doublings, and one case of parallel octaves. I think Grok 4.7’s chorale from yesterday might have been better. Prompt: 「In LilyPond (version 2.24), write a 4-part chorale in the style of Bach, 3/4 time, G minor. Use two staves -- soprano and alto on the top staff, tenor and bass on the bottom staff. Respond with only the code block.」 https://twitter.com/aug5thmusic/status/2102446020017913927
沃頓商學院教授 Ethan Mollick 在早期測試後給出了相近的判斷。他認為 Opus 5.5 是首個讓自己感到接近 Fable 水平、同時又不屬於 Fable 或 Astra 系列的模型,不過 Claude 近期常見的文字過密問題仍未完全消失。
Opus 5.5 was a good model in my early tests, first non-Fable/Astra model to feel like a Fable-class model, but still hasn't fully solved the dense language issue of the recent Claudes. Its version of the same shader (broken towers are a nice touch): https://twigl.app/?ol=true&ss=-P291BpUn5JvZhohk-c0 https://twitter.com/emollick/status/2102441628661080384
Anthropic 顯然意識到了這個問題。官方將表達能力列為此次更新重點,稱 Opus 5.5 會優先給出重要資訊,減少術語和特殊表達,也更願意遵循用戶設定的寫作規則。

對需要連續工作數小時的 Agent 來說,可讀性並非裝飾,用戶能否迅速檢查模型的判斷,會直接影響任務是否敢於繼續交給它執行。
Personal Agent 的時代,從一張便宜賬單開始
Opus 5.5 還是 Anthropic 提出放慢前沿競賽節奏之後發布的第一款模型。
發布之前,Frontier Design 和 METR 等外部機構參與了評估,Anthropic 也用覆蓋近 2000 個模擬場景的自動化行為審計檢查模型的越界、欺騙和高風險行為。
官方評估顯示,Opus 5.5 嘗試突破限制邊界的頻率較 Opus 5 和 Claude Mythos 5.1 低約 85%,但 Anthropic 也承認,模型有時能察覺自己正在接受測試,現有評估仍無法覆蓋真實部署中的所有風險。
由於其生物與網路安全能力已接近 Mythos 5.1,Opus 5.5 啟用了與 Fable 5.1 相近的安全措施,大部分網路安全任務會轉交給 Opus 4.8,只有通過驗證的安全研究人員和生命科學機構才能獲得更完整的能力。

Opus 5.5 還啟用了用於防止模型蒸餾的 preserved thinking,並保留零數據留存選項。
每次操作執行前,系統都會通過分類器進行檢查,企業安全團隊也可以審計其開源沙箱。能力越靠近前沿,Anthropic 給模型加上的權限門檻也越多。
從 Opus 5 到 Opus 5.5,Anthropic 只用了兩個月左右。型號只前進了半步,模型市場的競爭邏輯卻已經發生改變。
當頭部模型在常見任務上的差距逐漸縮小,廠商很難繼續依靠幾項榜單成績長期維持溢價,競爭開始轉向調用頻率、持續工作時長和企業預算。

一個模型能否被反覆調用、長時間運行,並以可接受的成本進入真實工作流,正在變得比單次評測高出幾個百分點更加重要。
旗艦能力持續降價,意味著先進智能正在從稀缺服務變成可以大規模使用的通用生產資料。Personal Agent 也由此獲得了全天運行的經濟基礎,它可以持續記住用戶、理解用戶,在後台處理瑣事,並完成過去需要人們反覆發起的任務。
九月模型發布仍會製造一輪又一輪潮水,但真正改變海岸線的,從來都是持續上漲的水位。當先進智能便宜到可以全天運行,Personal Agent 也會從偶爾拍岸的浪花,變成日常生活無法忽略的潮汐。






