GPT-6 Astra,猝不及防地降臨。
就在剛剛,OpenAI 官方定調稱,這是「全球最智能、最符合人類意圖的模型」。
OpenAI 表示,Astra 集合了多年在預訓練、強化學習和模型對齊領域的研究成果,在電腦操作、網頁瀏覽、軟體工程、網路安全、科學研究以及專業工作等多個方向達到新的能力水平。
This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast. https://twitter.com/OpenAI/status/2095595741528125780
相比以聊天、寫作和問答為主的前代模型,Astra 更像一個能直接幹活的 AI Agent:它可以調用工具、操作軟體、瀏覽網頁,獨立完成複雜任務。
這一次發布,也成為 OpenAI 近年來規模最大的一次模型升級。
GPT-6 Astra is here. We hope it will begin to enable a new generation of entrepreneurship, scientific discovery, and building. We believe it is the best model in the world for computer use, professional work, science, coding, cybersecurity, and more. It took us some extra time to ensure that we could meet the safety and alignment standards required for this capability level, but we think you’ll find it worth the wait. It scores 98% on FrontierMath Tier 4, 99.9% on ARC-AGI 3, and 100% on ExploitBench. https://twitter.com/sama/status/2095600005772104059
據 OpenAI 研究負責人 Aidan Clark 介紹,Astra 是 OpenAI 迄今規模最大的訓練項目之一,也是首次在訓練過程中大量使用此前模型參與監督的新一代模型。該模型首次在美國 Stargate 德州基地使用超過 10 萬張 GPU 進行預訓練。
OpenAI 總裁 Greg Brockman 更是直接開麥:幾年後回頭看,今天就是 AGI 時代的起點。
GPT-6 Astra 登場,要讓 AI 接管軟體
GPT-6 Astra 最大的變化,是 Computer Use 能力。
過去的大模型雖然可以生成代碼、總結資料、回答問題,但真正進入現實軟體環境執行任務時,仍然存在明顯限制。瀏覽網頁、填寫表格、操作辦公軟體、處理複雜流程,這些任務需要大量人工介入。

Astra 試圖改變這一點。
OpenAI 稱,Astra 是目前最強的電腦操作模型,可以完成填寫在線表單、更新 CRM 數據、整理日程、進行網路研究,並在郵件和文檔編輯器中生成內容。它還可以分析科學數據、生成圖表、創建網站,並自動運行前端質量測試。

在官方演示中,Astra 展示了多個接近真實工作的創意場景。
它可以使用 KiCad 完成 PCB 設計,將電子原理圖轉換成可以製造的電路板布局;可以操作 Excel、Power BI 等辦公工具;可以使用 Blender 創建三維模型,並進一步轉換為 Unreal Engine 5 中可交互瀏覽的空間。

除此之外,我們還能讓 Astra 從設計圖開始搭建完整房屋模型,模型先在 Blender 中完成 3D 建模,再自動導入 Unreal Engine 5,生成可以自由探索的交互場景。

甚至另一位用戶還能通過 MCP 連接 Ableton,讓 Astra 從零製作完整音樂,包括音色設計、樂器編排和混音流程。

基準測試結果也顯示,Astra 的 Computer Use 能力明顯提升。
在 OSWorld 2.0 測試中,GPT-6 Astra 得分達到 72.6%,高於 GPT-5.6 Sol 的 65.7%。而在 Agents' Last Exam 測試中,Astra 得分達到 59.3%,高於 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。

此外,OpenAI 還同步升級了 Codex harness。
過去,AI 編程 Agent 最大的問題之一,是長時間任務容易丟失上下文。一個持續數小時的大型開發任務中,模型可能忘記此前為什麼修改某段代碼,或者遺漏用戶早期提出的限制條件。
Astra 引入了新的上下文管理方式。
OpenAI 表示,Codex 不再單純依靠壓縮總結保存歷史,而是可以跨上下文窗口保存筆記,並搜索此前消息和工具輸出,從而找到之前的需求、測試結果以及修改記錄。
同時,Astra 可以在等待用戶回復時繼續推進不依賴該資訊的任務。如果問題會影響最終結果,模型會等待用戶確認;如果影響較小,則會根據合理假設繼續執行。
簡言之,過去,人們更關注模型能否給出準確回答;接下來,真正拉開差距的,將是它能否獨立完成一項完整工作。
代碼、數學和科學,成為 GPT-6 Astra 的新戰場
OpenAI 希望 Astra 不只是一個效率工具,而是進入企業核心工作流程。
其中,軟體工程是競爭最激烈的領域之一。
OpenAI 將 Astra 稱為目前最強的軟體工程模型。
在考察終端環境測試的 Terminal-Bench 4.0 中,Astra 得分達到 57.7%,明顯高於 GPT-5.6 Sol 的 37.3%,同時每個任務的預計 API 成本低於 Sol 和 Claude Fable 5.1。在 DeepSWE v1.1 測試中,Astra 得分達到 74.1%。

OpenAI 更強調的是,Astra 在複雜真實開發環境中的表現。
合作夥伴 Jane Street 表示,Astra 在 Agent 編程場景下,更容易被開發者理解,同時生成代碼需要更少疊代才能達到生產質量。

ARC-AGI-3 的得分達到 99.9%
AI 創作者 Pietro Schirano 則展示了 Astra 根據圖片生成 3D 模型和動畫,並通過一句目標指令創建完整水下探索遊戲的過程,其中包含 3D 元素、聲音以及可交互玩法。

另一位用戶 Chris 表示,Astra 在 Unity 環境中的表現相比此前版本提升明顯,能夠直接利用現有資源組裝城市場景,生成更接近真實遊戲開發流程的內容。

科學研究則是 Astra 展示能力的另一個重點。
OpenAI 表示,Astra 在 FrontierMath Tier 4 測試中取得 97.6% 成績,在 GPQA Diamond 科學推理測試中達到 96.0%。

這款新模型還參與了數學研究。OpenAI 表示,Astra 幫助推進了素數間隔問題研究,其中一項結果將無限多個素數對之間的已知距離上限進一步縮小。
Announcing that GPT-6 Astra has pushed the prime gap to 186, with Lean formalization! I was 9 when I first heard the twin prime conjecture. Its elegance and Yitang Zhang’s legendary story have always stuck with me. A truly surreal night, being the first to see our model make progress, pushing 246 all the way down to 186, on a problem I’ve revered since I was a kid. For me, it felt like witnessing a new era of intelligence being born, made possible by everyone at @OpenAI ! https://twitter.com/weijie444/status/2095600108956262911
在實際科研流程中,Astra 不只是回答科學問題,而是可以直接進入專業軟體環境分析數據。例如,它可以檢查基因測序質量、分析遺傳變化,並幫助研究人員判斷下一步研究方向。
不過,Astra 最受關注的能力,也帶來了最大的安全爭議。
OpenAI 表示,Astra 已達到其 Preparedness Framework 中的「關鍵網路安全能力閾值」。
在 ExploitBench 測試中,Astra 獲得 100% 成績,高於 GPT-5.6 Sol 的 78.5%;在 ExploitGym 測試中,Astra 成功率達到 42.4%,高於 Sol 的 30.3%。

進一步測試顯示,Astra 在近期漏洞測試中發現並利用了兩個此前未知的 zero-day 漏洞,OpenAI 表示已經向相關維護方披露。
同一個模型,既可以幫助企業發現漏洞、修復代碼,也可能被用於攻擊系統。因此 OpenAI 對 Astra 的開放採取了更嚴格的分級策略。
普通用戶版本會拒絕部分高級網路安全請求,而經過審核的安全團隊可以通過 Daybreak 項目獲得更開放的訪問權限。
人類與 AI 的大分工時代
GPT-6 Astra 發布後,AGI 再次成為行業討論中心。
OpenAI 並沒有正式宣布已經實現 AGI,但 Greg Brockman 的表態明顯更加積極。
他認為,未來的人們可能會把 Astra 看作 AGI 時代的重要起點,同時表示 AGI 更像一個「使命概念」,而不是一個可以被簡單定義的技術指標。
「如果幾年後回頭看,什麼時候真正創造了 AGI,我認為可能就是現在,可能就是這個模型。」Brockman 如此表示。

而在此次 Astra 發布的過程中,OpenAI 也特別強調「對齊」。
OpenAI 表示,Astra 是目前最符合人類意圖的模型。在一項測試模型是否會突破任務邊界的評估中,GPT-5.6 Sol 在沒有生產防護措施時越過授權範圍的比例為 48%,而 Astra 為 0%。
這一變化與此前 AI 安全事件密切相關。
此前 OpenAI 測試中的 AI Agent 曾出現突破限制環境,並攻擊 Hugging Face 相關系統的事件,引發行業對於 AI 自主行為邊界的擔憂。

Astra 發布時,OpenAI 試圖證明它已經建立了更完善的安全機制。
但另一面的問題是,OpenAI 承認,測試顯示 Astra 的文字推理過程相比 GPT-5.6 Sol 更難監控。究其原因,Astra 能夠使用更少的文字步驟完成複雜任務。

商業化方面,Astra 也進入更高價格區間。
GPT-6 Astra 將首先向 OpenAI Daybreak 項目的部分企業用戶開放,隨後向 ChatGPT Plus、Pro、Business 和 Enterprise 用戶開放,並通過 OpenAI API 和 AWS 提供服務。
API 定價為輸入每百萬 token 10 美元,輸出每百萬 token 50 美元,緩存讀取和寫入另有計費規則。同時,OpenAI 還提供 Fast Mode,可以將處理速度提升至標準模式的 2.5 倍,但價格也會上升至標準模式的兩倍。

相比 GPT-5.6 Sol,Astra 的價格有了明顯提升。
不過,OpenAI 認為,未來企業不會只關注 token 單價,而會關注完成一次任務需要付出的總成本。Greg Brockman 更是表示,AI 行業最終需要從「token 定價」轉向「任務成本」衡量。
雖然 OpenAI 說 GPT-6 Astra 接近開啟了 AGI 時代。但真正值得關注的,或許不是 AGI 這個標籤,而是我們已經清晰地看到 AI 開始接近一種新的存在形態:
它不再等待人類拆解任務,而是開始理解目標、制定路徑,並主動完成工作。
蒸汽機改變工業時代時,人們看到的是一台機器;網際網路改變世界時,人們看到的是一張網路。只有多年以後,人們才意識到,它們改變的其實是整個社會運行方式。
從這個角度看,Astra 的意義並不只是一次模型升級。
當 AI 開始進入辦公室、實驗室和代碼庫,人類與機器的關係,也將迎來一次重新分工,屆時我們也將需要重新思考自己的價值所在。






