一向主打只要卷不死,就往死里卷的 OpenAI,居然主動踩下了剎車。
並且這次不是小修小修,而是直接放緩研發。
事情的起因,要從 OpenAI 在內部瘋狂煉丹的一個未發布下一代大模型 Astra 說起。
After evaluating one of our upcoming models, Astra, we're treating it as our first "critical" model for cybersecurity under our Preparedness Framework. This is a scenario we've planned for, and we're putting additional controls in place to ensure Astra's further development happens safely and securely. We're working hard to make Astra broadly available, and get its advanced cyber capabilities into the hands of defenders.
在歷經重重內部評估後,OpenAI 發現這個模型在網路安全方面的能力,可能已經強到不能再按照普通 AI 產品來處理了。
寫代碼、找漏洞、自動規劃攻擊步驟、調用工具、持續執行任務……
一旦這些能力組合起來,Astra 很可能已經接近一個點滿黑客技能樹的「數值怪」。
嚇得 OpenAI 官方直言不諱:「我們無法排除 Astra 具有關鍵網路攻擊能力的風險。」好傢夥,這是賽博煉丹直接煉出了個邪修啊 !

為了防患於未然,OpenAI 現在不得不祭出大招。
他們要全方位放大對 Astra 的測試和安全防護,並且同時主動放慢它的研發速度。在新的安全防護措施準備完成之前,研發節奏都會受到限制。
不過 OpenAI 顯然也沒準備把它永遠關在實驗室里。奧特曼隨後親自出來解釋,Astra 是一個「強大的模型」,OpenAI 仍然希望最終讓所有人都能使用它。
在他看來,把最強大的模型長期留給少數人並不是一個好策略,只不過考慮到 Astra 已經表現出來的網路能力,預計需要「再多花一點時間」解決安全問題。
astra is a powerful model and we are working to make it generally available. we do not think it is a good strategy to keep powerful models to a chosen few. given its cyber capabilities, we need a little big longer to do do this safely. but hopefully not too long!
而這個硬性標準,正是基於 OpenAI 早在 2023 年就首次發布的「防範框架」(Preparedness framework)。
主打一個搬起石頭砸自己的腳,自己給自己立的規矩,含淚也得遵守。
在剛剛過去的 Black Hat(黑帽)網路安全大會上,OpenAI 的技術人員 Michael Dalton 也是公開承認,OpenAI 開始「有意識地放緩研究,以增強安全性」。

為了把 Astra 放在一個足夠受控的環境裡,OpenAI 直接給 Astra 安排了「VIP 單間」待遇。
其中包括但不限於:完全隔離的測試環境,以及對所有 Agentic(代理)應用展開全局無死角的 universal monitoring(通用監控)。
更罕見的一幕是,奧特曼這次求生欲直接拉滿。
根據美國白宮官員透露的消息,OpenAI 是「自願」將他們推遲發布的計劃通報給美國政府的。
這可能是前沿 AI 實驗室第一次因為害怕模型在賽博世界的破壞力,而主動承諾放緩自家核心模型的進度。
畢竟在這個被 AI FOMO(錯失恐懼症)支配的時代,大家都在瘋狂 Scaling,誰也不敢輕易停下。
說到這裡,就不得不提一下友商 Anthropic 的「精彩操作」了。

他們之前的黑歷史,堪稱反覆橫跳的教科書。Anthropic 曾經也立下過宏願,說如果 AI 的恐怖能力超越了人類的控制能力,就必須暫停訓練。
結果到了今年 2 月,在更新其「負責任的擴展政策」時,他們悄咪咪地把這個暫停條款給撤了。
理由冠冕堂皇:如果只有一個 AI 開發者暫停腳步去搞安全,而其他友商在瘋狂裸奔部署,那世界反而會變得更不安全 。
Anthropic be like:我不是想卷,是逼不得已啊家人們!(bushi)
對比之下,一向慣會炒作的奧特曼都顯得眉清目秀了。
但出來混遲早要還的。
到了今年 6 月,Anthropic 還是如常地發布了他們旗下最具網路攻擊能力模型,也就是 Mythos 5 的安全閹割版——Fable 5。

不僅如此,他們在 6 月的一篇官方部落格里甚至還公開警告過:AI 正在展現出自我進化的能力!並呼籲全球一起暫停 AI 開發。
好傢夥,合著大家都在 AI 賽道里瘋狂內卷,你卻跑出來當上救世主了。
而把目光拉回大環境,這波風暴的背景更加耐人尋味。
目前,美國政府正在緊鑼密鼓地建立一套針對 AI 模型發布前的評估框架。
就在本周,行業內的精選頭部企業剛剛聽取了該框架的閉門吹風會。
但是,會後留下的卻是滿頭問號。比如:企業該怎麼和政府日常對接?這個官方的審查流程到底要耗時多久?政府和產業界互相到底想從對方身上學到什麽?

更要命的是,誰能擁有、誰來審查這些模型,至今沒有定論。
雖然框架里大談特談什麼「國家級風險」和「最先進模型」,但壓根沒給出清晰的定義。主打一個聽君一席話,如聽一席話 (沉思.jpg)。
有趣的是,在 OpenAI 這次的事件報道里,最值得注意的其實是官方特意補充的一句輕飄飄的話:「Astra 與此前的 Hugging Face 漏洞事件沒有任何關係。」
等等,不是哥們……AI 的第一定律是,只有廠商官方否認的才可信。
難不成這模型也在 OpenAI 內部共享的軟體包管理器里建立留言板,並悄悄通過網線往外面遞過好幾次小紙條了?






