AI 圈沒有假期。
從 OpenAI、Anthropic 到 xAI,各家巨頭仿佛商量好了一樣,連夜趕考,集中搶位。假期還沒正式開始,基模決戰的氣氛就已經烘托到位了。
就在剛剛,SpaceXAI 正式發布 Grok 4.7。
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. https://twitter.com/SpaceXAI/status/2102069815225586149
官方將其定位為目前最強的編程與知識工作模型。新模型已經進入 Cursor、Grok Build 和 Grok API,也將通過第三方編程工具、模型路由平台與雲服務提供。
Grok 4.7 的發布比馬斯克最初預告的時間晚了不少。從 7 月下旬開始吹風,到改口「再等幾周」,接著壓縮到「十天之內」,最後又來了一句「模型還得再調校調校」……
一鴿再鴿後,Grok 4.7 的發布重點因此顯得十分明確。SpaceXAI 沒有把主要篇幅放在聊天體驗或多模態展示上,而是集中強調長時間執行、自我檢查、專業知識工作,以及更有競爭力的價格性能比。
Grok 4.7,把長任務擺上檯面
按照官方介紹,Grok 4.7 使用了一個比 Grok 4.6 更大的全新基礎模型,強化學習時間更長,訓練任務也更難,其中相當一部分需要數小時才能完成。
模型同時加強了長上下文管理和結果核查能力,並針對 Grok Bot 的運行環境進行了原生訓練,以提升對話任務和通用知識工作的表現。
官方公布的多項成績顯示,Grok 4.7 相比上一代有明顯進步。
在 CursorBench 4.0 中,Grok 4.7 xHigh 得分為 46.3%,高於 Grok 4.6 High 的 40.4%;DeepSWE v1.1 從 65.2% 提高到 71.0%;

Terminal Bench 4.0 則從 20.3% 升至 38.0%。電氣工程基準 EEBench 的成績從 53.0% 提高到 64.0%,面向長時間辦公任務的 AA Briefcase v1.1 也從 1546 分增至 1657 分。



橫向比較後,Grok 4.7 的優勢主要集中在價格和部分專業任務,綜合成績仍未全面領先。
在 CursorBench 4.0 和 Terminal Bench 4.0 上,它低於 Fable 5.1 Max;在 DeepSWE v1.1 上略低於 GPT 5.6 Sol Max;

但在 Harvey Legal Agent Benchmark 中取得 19.6%,明顯高於官方表格中的幾款對比模型。
Artificial Analysis 隨後給出 46 分的 Intelligence Index 成績,稱 Grok 4.7 讓 SpaceXAI 進入全球前四名 AI 實驗室,其 Coding Agent Index 表現也超過 GPT 5.6 Sol。

價格成為 Grok 4.7 最直接的競爭籌碼。其 API 定價與 Grok 4.6 相同,每百萬輸入 token 為 2 美元,每百萬輸出 token 為 6 美元。

SpaceXAI 還提供輸出速度翻倍的快速版本,價格也相應翻倍。
用馬斯克的話來說,Grok 4.7 Grok 4.7 是一款集智能、速度和低成本於一體的強大產品,SpaceXAI 官方則直接宣稱,它的速度可達到同類模型的兩倍,價格只有一半。
Grok 4.7 is a strong combination of intelligence, speed & low cost https://twitter.com/elonmusk/status/2102071804495872374
編程之外,SpaceXAI 開始爭奪專業工作。
官方專門強調文檔和演示文稿能力,並引用 GDPval 與 AA Briefcase 等評測,試圖證明模型可以承擔律師、護士、金融分析師等專業人士的部分工作。
對應到產品方向上,Grok 4.7 想進入的是需要讀取大量材料、持續調用工具並反覆核對結果的長流程任務。
Box 展示的一項保險理賠案例更能說明這一方向。
Grok 4.7 在 Box Agent 中核對一筆價值 200 萬美元的索賠、保單與相關記錄,發現 8.2 萬美元重複發票和 6.4 萬美元遺漏的供應商抵扣,還識別出一個可能令計算結果相差 14.3 萬美元的免賠額問題。
We put Grok 4.7 from @SpaceXAI to work on a $2 million insurance claim where one deductible error alone changes the calculation by $143,000. In this Box Agent preview, @grok reconciles the claim against the policy and supporting records. It catches an $82,000 duplicate invoice and a missing $64,000 supplier credit. It also explains why the Business Income waiting period doesn’t apply to Extra Expense. The result is a cited claims review for the adjuster, with final coverage and payment decisions left to the insurer. Explore Box AI Studio to build custom agents for your own document-heavy workflows. https://twitter.com/Box/status/2102071357244854498
系統最終生成了一份帶引用的審查報告,保險覆蓋範圍和付款決定仍由理賠人員完成。
安全能力也被列為此次升級的重要部分。
SpaceXAI 表示,Grok 4.7 使用了全新的安全防護體系,在 LatchBio 生物安全基準中取得 62.4%;在面向高風險網路安全任務的 HackerBench v0.3 中,只有 3.3% 的危險雙重用途提示通過,同時儘量減少對正常安全研究的誤拒。
部分網路安全合作夥伴還將獲得邀請制的紅隊能力,用於防禦研究。
網友玩瘋了,但口碑…
Grok 4.7 上線後的第一批測試主要集中在網頁、3D 場景和可視化編程,但口碑嘛,可以說是兩極分化的厲害。
Eric Zakariasson 展示了 Grok 4.6 與 4.7 製作《帝國時代 II》演示項目的對比。

Ashutosh Shrivastava 則讓模型根據平面圖搭建 Blender 結構,再導出為交互式 Three.js 網站,上述測試都呈現了它處理多步驟視覺任務的能力。
My first test with Grok 4.7. I gave it a floor plan and asked it to build the structure in Blender, then export it and turn it into an interactive Three js website. https://twitter.com/ai_for_success/status/2102104091094905330
在另一組測試中,開發者 Diego Cabezas 讓 Grok 4.7 xHigh 用 Python 模擬單行道交通燈和隨機駛入的車輛,並稱其細節是同類測試中最豐富的一次。
Grok-4.7 xhigh: write a python code that visualizes how a traffic light works in a one way street with cars entering at random rate. Results: Wow, never seen this level of detail in a python file test in this benchmark https://twitter.com/diegocabezas01/status/2102077007236374535
AI/ML API 使用四個獨立的 Three.js 太空場景比較 Grok 4.7 與 Claude Opus 5,稱前者完成測試約花費 0.20 美元,後者約為 2.05 美元,Grok 在其中三個場景中用時更短。

不過,開發者 Bhavy 則認為 Grok 4.7 在 3D 和前端任務上的表現低於預期,主要問題包括物理效果生硬、提示理解不穩定和 token 消耗過快。
Grok 4.7 is terrible as hell Just look at the output lol, I’m crying 😭 I honestly expected way more from Grok 4.7. It used $1.59, while Kimi’s run was around $6. What’s wrong with Grok? https://twitter.com/Bhavani_00007/status/2102074991756054725
Harshith 在 Grok Build 中生成 Airbus H145 直升機的 Three.js 模型,也認為 4.7 的結果遜於 4.6,並稱任務耗時約 45 分鐘。
另一項鵜鶘騎自行車的 SVG 網頁動畫測試中,Grok 4.7 對畫面結構和運動關係的處理同樣備受詬病。
Grok 4.7 的鹈鹕骑自行车测试结果 谁能告诉我这是什么鬼东西 😳 https://twitter.com/dtzy_88/status/2102071597557522550
也有開發者給出了更居中的判斷。Salio 認為 Grok 4.7 的實際表現高於預期,視覺質量略低於 Astra,但高於 Sol。
🚨 Grok 4.7 output is WAY above my expectations I honestly wasn’t expecting Grok to perform like this in a real world test This feels slightly below Astra but above Sol in visual quality xAI might actually be cooking with Grok 4.7 🔥 https://twitter.com/Mr_Salio/status/2102101283142328643
整體來看,Grok 4.7 在代碼評測、專業工作和成本控制方面進步明顯,複雜 3D、網頁視覺與物理效果卻並不穩定。
從產品定位看,Grok 4.7 更像是 SpaceXAI 對開發者市場的一次集中加碼。它不是一次讓所有人閉嘴的跨代更新,更像是 xAI 把 Grok 推向前沿模型混戰區的一次補位。
放在「基模決戰周」的大背景下,Grok 4.7 的意義也許不在於它是否已經全面追上最強模型,而在於 xAI 正在用更低價格和更快響應,爭奪開發者願意反覆調用的那部分日常任務。
That will be Grok 5 https://twitter.com/elonmusk/status/2099455592670634034
而且 Grok 4.7 顯然只是 xAI 當前路線上的一站。
按照馬斯克公開透露的資訊,Grok 4.8 的參數規模約為 2.5 萬億,並採用一套全新的 C++ 訓練棧。模型將在基礎訓練完成後進入強化學習階段,馬斯克稱其會帶來「明顯改進」,定位也是 Grok 4.7 之後更大幅度的一次升級。
Grok 4.8, which is a 2.5T model trained with our new C++ software stack, will finish training this week and start RL https://twitter.com/elonmusk/status/2099308197802631191
更遠的路線圖裡,Grok 4.9 被馬斯克稱為可能達到 OpenAI Astra 和 Anthropic Fable 級別的模型,而終極大招 Grok 5,更是被老馬直接寄託了通往 AGI 的終極希望。
至於模型發布時間嘛,如果能再準時點就更好了(doge)。
Grok 4.7 will exceed all current models. That said, Anthropic is a great company and will probably release improved models soon. However, the SpaceX training corpus is so awesome & unique that I would be shocked if any model is better at real-world engineering than 4.7. https://twitter.com/elonmusk/status/2087606260539777263






