宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Anthropic RL負責人:AI在2028年可能拿菲爾茲獎,2030年前有望諾獎。普利茲獎?大概還不行

2026年10月07日 首頁 » 熱門科技

 

Sholto Douglas和Nick Marwell是Anthropic強化學習團隊的兩位核心技術負責人。他們在Joe Lonsdale的播客American Optimist里做了一次將近一小時的對話,錄製於2026年8月。Sholto在雪梨長大,學的是機器人專業,先在DeepMind工作兩年,2025年2月加入Anthropic負責RL scaling。Nick是舊金山本地人,耶魯統計學出身,在Thrive Capital做駐場期間轉向AI安全,2023年10月加入Anthropic,先帶RL Science,現在領導Long Horizons團隊。

 

Anthropic RL負責人:AI在2028年可能拿菲爾茲獎,2030年前有望諾獎。普利茲獎?大概還不行

 

兩人認真推演了一件多數人覺得荒謬的事:當AI和機器人替代了一切勞動之後,所有生產成本都將還原為能源成本,中產階級在山上蓋一棟豪宅會和今天買家電一樣平常。在那個世界到來之前,他們認為下一個十年屬於通才,工具已經備齊,稀缺的是知道該解決什麼問題的人。問AI什麼時候能拿菲爾茲獎,回答是2028年就相當可能;普利茲獎嘛,大概還不行。對了,如果要加讀者群,可以看公號菜單。

Sholto Douglas的內容我之前發過,是一個兼具哲學和技術思考的研究員。

1. 

18個月前手敲代碼,現在讓模型獨立干兩天

Sholto用自己在Anthropic的日常工作來描述AI進步的速度。18個月前他剛到公司,所有代碼都是自己手敲的。幾個月後變成每隔幾分鐘給模型下一個指令,寫下一個函數,但必須不停檢查,因為模型會犯錯、會跑偏。

到現在,他可以讓模型獨立完成一兩天的工作量,推進進度的方式就像帶一個初級團隊成員。錄播客的時候,他的AI隊友正在後台跑RL實驗。"他們確實在幹活,好幾個在同時干。"

這個變化的速度比一般人的直覺快。18個月,從一個需要你全程盯著的工具變成了一個能自己幹活的初級同事。Sholto對AGI的判斷就建立在這種日常體驗上:幾年之內就會出現能力與所有人類相當或更強的模型。 具體來說,就是一個模型能做所有人類在電腦上能做的事。等到機器人技術足夠先進,再加上物理世界的所有事。

他2020年還在雪梨的時候就被論文和blog說服,認為scaling路線能在2020年代實現AGI。加入Anthropic之後,這個判斷更確信了。

Nick做了一個區分:到目前為止,模型開發的重心是讓AI完成人類已經能做的任務,只是更快、更便宜,比如寫一個人類開發團隊也能寫的軟體。但最近數學領域開始出現不一樣的東西。在一個叫Frontier Math的評測里,由不同領域教授出題,模型成績在過去一年從0%飆到超過50%。這些題目是人類長期未能解決的問題。

有人會說,這些數學證明只是"一個聰明的數學家意識到電腦可以暴力搜索人類搜不完的空間"。Nick不否認,但他認為人類歷史上大多數智力成就本來就是這樣的,把前人不同的想法組合在一起,形成新東西。區別在於,過去這些組合不會自動發生。現在模型可以把不同人類想法重新組合,產生以前沒人做過的連接。寫一個新的web app不算人類新的智力成就,但這種組合是。

2. 為什麼數學和編程先突破

模型訓練有兩種方式。一種是在海量網際網路文本上做預訓練。另一種是強化學習,也就是Sholto和Nick都在做的事:讓模型做一道題,檢查答案對不對,用對錯信號來訓練。

數學和編程之所以先突破,是因為它們最容易判定對錯。 數學有證明,代碼能跑就能跑,不能跑就不能跑。在這兩個領域,RL有天然的檢驗機制。浪漫關係、詩歌、其他需要人類判斷的領域就難得多。但Sholto認為把其他問題放進這個框架並沒有那麼難,只是還沒做。

Nick又補了一個社會學的解釋。造AI的人自己就來自數學和電腦科學背景,他們當然先做自己懂的領域。而且訓練好模型需要花大量時間閱讀模型的輸出,判斷它哪裡強、哪裡弱。做你自己是專家的領域明顯更容易。選數學和編程當第一個突破口,一半是技術原因,一半是"你問一群數學家先做什麼當然先做數學"。

被問到會不會把模型擬人化,Nick說自己不會,但他認為"實體"比"工具"是一個更有用的思考框架。工具是你全程在操控的東西。模型現在是你釋放出去、讓它代替你行動的東西。用"實體"的框架去想它會做什麼、會出什麼問題,比用"工具"的框架更準確。

3. 每一個邊際單位的智能,價值是前一個的指數倍

Nick提出了一個連他自己幾年前都不信的經濟框架。

AI在編程領域的第一個有用能力是tab自動補全。下一個邊際單位是終端里的agentic coding,比如Claude Code。這個能力比tab補全有價值一千倍、一萬倍。 tab補全已經沒法單獨撐起一家公司了,但agentic coding創造了巨大的商業價值。

然後下一級是什麼?也許是一個全職的AI軟體工程師,比任何人類工程師都強。再下一級?也許能治癒癌症。

按照生活中其他事物的經驗,指數增長總會撞到天花板。但AI的特殊之處在於,你必須極度樂觀才能相信這條曲線會一直延續。而到目前為止,它確實在兌現。Nick說這對他自己幾年前也是一個很大的認知更新,因為他曾經以為指數不會持續這麼久。

這個框架回答了一個常見的質疑:如果前沿智能總會變便宜,這不是一個註定被商品化的生意嗎?Nick的回答是:等到任何一種完全商品化的情景真正出現時,整個經濟已經被AI根本性地改造了,所有智力和體力勞動都由AI完成,總量遠遠大於今天。如果Anthropic是推動這個過程的公司之一,那顯然值很多錢。

換句話說,到前沿被商品化的那一天,我們在討論的已經不是一家公司值多少錢的問題了。

4. 蒸餾、IP和藥物專利的類比

Sholto引用了Artificial Analysis等評測平台的數據:同等水平的智能,成本每年大約降低10倍。 這個降價完全來自技術本身的自然演進,不需要蒸餾。

蒸餾是另一回事。蒸餾就是複製。它不能讓你越過當前的能力邊界,只能低成本地複製別人已經做到的東西。問題在於,推到下一個前沿需要巨額資本投入。以後會出現百億、千億甚至萬億美元級別的訓練。如果別人總能用很小的成本在一兩周內複製你的成果,他們反而在商業上比你有優勢,因為他們沒有研發負擔。長此以往,沒有人有動力做前沿投入。

不過蒸餾攔不住也是事實。用戶想要檢查輸出、想在本地運行、想看思維鏈,每多開放一點訪問,蒸餾就更容易一分。這是一個產品開放性和IP保護之間的結構性張力。

Nick把這個和藥物開發做了類比,但他認為AI比藥物健康得多。藥物專利保護期長達二三十年,導致價格居高不下。AI前沿的保鮮期只有幾個月。 6個月前的前沿水平很快就會變得極其便宜。保護前沿模型的IP,既能激勵下一輪巨額訓練投入,又不會像藥物專利那樣讓終端用戶長期承擔高價。保護的好處全拿到了,壞處基本沒有。

Nick說他在幾年前思考AI進步速度的時候,曾經認為數據擴展會是一個極其耗時耗錢的瓶頸,把一切拖慢。結果實際發生的事是,Anthropic和OpenAI的收入增長速度遠超預期,一下子就有了足夠的錢來暴力突破這些瓶頸。他當時覺得要花更長時間才能走到今天這個位置,但錢來得太快了。

5. "AI將是生命科學領域有史以來最重要的技術"

在所有AI即將產生影響的領域中,Nick最看好未來6到24個月的生物學。他覺得生物學會經歷和軟體工程類似的AI普及過程,但社會正面效果會更加深遠。治癒疾病、延長壽命、理解表觀遺傳學如何影響衰老,這些方向都在加速。

但他接下來擔心的事情跟多數人不一樣:他的焦慮已經不是AI夠不夠聰明,而是美國有沒有足夠的實驗室來承接AI的產出。

他對AI的生物學能力已經有信心了,但對美國的實驗室數量和質量沒有信心。在實驗室質量這個維度上,美國已經明顯落後於中國。把美國的供應鏈和實驗室體系恢復到世界一流水準,他認為是當前最重要的社會基礎設施工程之一。

這個判斷的含義很清楚:限制生物學進步的瓶頸即將從"AI還不夠好"變成"試管和實驗台不夠多"。 在2030年代機器人技術足夠先進之前,這個基礎設施瓶頸會一直存在。三年前大家應該多建算力基礎設施,現在可能應該有人開始大建實驗室了。

6. 進攻占優還是防守占優

Anthropic內部有一個分類框架:一個技術領域到底是進攻占優還是防守占優。這個判斷決定了它有多危險、需要什麼樣的干預。

Sholto認為網路安全目前是進攻主導,但兩年內會翻轉。邏輯很直接:有了足夠強的AI,你可以提前入侵自己的系統,找到所有漏洞並修補。最終我們會進入一個更安全的網路世界,因為每個人都已經用AI測試過自己的防線。

生物領域的情況嚴峻得多。要讓生物安全從進攻主導變成防守主導,需要數千億美元的基礎設施投入。 在2030年代機器人技術大幅進步之前,建設這些設施的成本都不算合理。所以當下是一個特別危險的窗口期:進攻占優,防守還沒準備好。

雙重用途是這兩個領域的根本難題。Nick用網路安全舉了最直觀的例子:你讓Claude說"這是一個代碼庫,請找出所有漏洞",它無法區分你是這個代碼庫的主人在加固防禦,還是攻擊者在找入口。生物領域也是如此,99.9%的靶向操作是在殺癌細胞,但總有極小的可能是在做危險的事。

Anthropic的態度是:在能夠確保壞人無法利用這些能力之前,不應該向世界釋放這些技術。

Joe Lonsdale提到了一個已經在發生的案例:有恐怖組織在用開源模型學習製造爆炸裝置。他們自己不夠聰明,但模型剛好夠聰明到能幫上忙。Sholto對此的回應是,更多人擁有智能也意味著更多人能理解威脅並阻止它。總體上他對這個方向持樂觀態度,但他把樂觀建立在一個前提上:網路安全在兩年內會翻轉為防守主導,生物安全要更久。

7. Fable事件:Anthropic怎麼回應"監管俘獲"

Joe Lonsdale直接提出了他的圈子裡對Anthropic的批評:有不少聰明的科技領袖認為Anthropic CEO Dario Amodei在通過製造恐慌來推動對自己有利的監管,犧牲開源生態來鞏固閉源公司的地位。

Nick的回應分兩層。

第一層是事實層面。推動開源權重的主力是Nvidia、Amazon、Microsoft和中國的大型實驗室,都是有能力應對監管的巨頭。"監管會不成比例地傷害開源開發者"這個敘事站不住,因為開源權重的推動者從來就不是資源匱乏的小社區。

第二層是行為層面。他用了一個具體事件來說明:Anthropic當時擁有遠遠領先的最強模型,沒有任何競爭對手接近。公司完全可以利用這個多月的領先窗口徹底甩開對手。但它選擇先和政府協調,確保政府對發布方式感到放心。 這是播客里提到的Fable事件。搜索確認,2026年6月Anthropic發布了Mythos級模型Fable 5,但三天後就因美國政府的出口管制指令被迫全球暫停服務,直到月底才恢復。

"這是一個對公司經濟利益明顯不利的決定,但符合我們對模型應該如何部署的價值觀。"

Nick還提到了DeepMind CEO Demis Hassabis推動的一項提案:讓閉源模型提供商之間協調,設定安全門檻,模型必須達標才能發布。"這就是我們在討論給自己減速。到目前為止,我們對自己的減速遠超任何外部力量對我們的減速。"

關於開源,Sholto說得直截了當:"我們真心認為開源是好事。"他自己就是在開源模型上學會做ML的。但他也認為社會應該對什麼能力級別可以公開釋放設定門檻,比如一個模型能做網路攻擊,你能接受什麼程度的能力被公開?這個門檻對開源和閉源模型應該是一樣的。 除此之外,人們應該可以做他們想做的事。

被問到是否有可能為了安全而放慢美國的速度時,Sholto的回答是:"不會是放慢美國而讓中國先行的方案。"如果要減速,必須是所有參與方完全協調、互相信任的減速。

8. 下一個十年屬於通才

Nick的弟弟正在上大學,正面臨"AI時代該怎麼規劃職業"的問題。Nick給的判斷是:如果AI技術需要10到20年才能完全滲透進經濟,那這段時間裡會湧現大量參與技術擴散的機會。

過去幾十年裡,優秀的職業路徑是擁有一套非常有價值、非常市場化的專業技能。接下來的邏輯不同了。每個人背後都有一個千人公司級別的AI能力,真正稀缺的變成了識別問題的能力。 什麼問題值得解決?我的社區需要什麼?工具已經齊了,關鍵是選對方向。

Nick用猶太教里"修復世界"的概念來做框架:你用六天修復世界,第七天假裝修完了,休息。只要你不相信烏托邦已經到來,就永遠有需要修復的東西。這是一個關於"後稀缺世界人還能做什麼"的非世俗回答。他和Sholto都同意:在我們和烏托邦之間,還有大量的工作要做。

多數人以為AI會首先衝擊外包行業,但菲律賓做業務流程外包的BPO行業就業還在上升,軟體工程就業也在增長。搜索確認,菲律賓BPO行業2025年就業增長4%達到168萬人,2026年預計繼續增長至約197萬人。HSBC在2026年9月的報告中確認"菲律賓服務業就業沒有出現末日景象,甚至加速了"。

Nick的解釋是:現在處於一個"人+AI"比單獨的人更有價值的階段,所以僱主想要更多人來配合AI使用。他把這和象棋做了類比。30年來象棋領域最強的選手一直是人加機器的組合,現在機器已經碾壓一切。他們認為AI領域的這個過渡期會比象棋短得多。

所以Anthropic對失業問題的擔憂是真實的。"我們不應該自我說服,覺得一切都會自動好起來。" Nick提到,Anthropic的一位同事已經資助了一個非營利組織,專門研究勞動力衝擊的實際數據,以及應該推動什麼樣的政策讓所有人都能安全度過這個過渡期。

9. 一切還原為能源的成本

Sholto給出了一條從當下到後稀缺的推演路徑。過去四五年,投入AI的算力每年翻兩到三倍。超級雲廠商今年合計花了接近一萬億美元的資本開支在AI相關基礎設施上。如果這個趨勢線延續下去,加上機器人產業的擴展,到2030年代初,理論上就接近"把人類的GDP翻一倍"的量級。

他自己也承認這個概念"有點荒謬",但算力擴張的趨勢線到目前為止一直在兌現。五年前不會有人相信一年花一萬億美元在AI上,一年前也不太有人信。

落到日常生活,他描述的願景是這樣的:當AI能夠替代所有智力勞動,搭配機器人後再加上體力勞動,一切的生產成本都還原為能源成本。 建房子是能源成本,製造商品是能源成本。中產階級可以在山上建一座巨大的房子,這就像今天我們習以為常的東西在幾百年前的國王看來不可想像一樣。治癒所有疾病,甚至治癒衰老。

但他緊接著提出了一個分配問題:如何確保這個世界的回報不只流向那些在舊世界恰好擁有資本的人?如果回報全部集中在資本持有者手中,後稀缺就只是另一種形式的極度不平等。

Sholto對文化層面的預測和多數矽穀人的直覺相反。他認為傳統、儀式和社區紐帶的重要性會回升。當工作不再是生活的核心,當純粹的資本主義不再主導一切,"人們生活中重要的東西會變成傳統、儀式、為他人提供價值、本地社區的紐帶。"Nick補充說,純粹的求知本身也會變得更重要,只是不再出於經濟目的,而是出於理解世界、參與社區和自我充實的需要。

Joe Lonsdale問了一個尖銳的問題:你們在舊金山做這些事,但舊金山的文化傳統可能並不是美國主流。基督教、一夫一妻制、工作的尊嚴,這些對很多人來說是生活的根基。他們會不會覺得你們在用技術重塑世界的同時碾碎了他們的傳統?Sholto沒有迴避,反而往前走了一步:他預測這些傳統制度會在舊金山復興,恰恰因為工作的主導地位在下降。

10. AI不會自動修好教育

Nick對"AI解決教育"的敘事持懷疑態度。他的父親過去15到20年一直在做教育方面的公益事業,這讓他對教育問題有一個比AI圈子裡大多數人更具體的理解。

他觀察到的核心事實是:教育的效果高度依賴早期積累。預測一個學生數學成績最強的單一指標,是他三年級結束時能否達到閱讀水平。 因為三年級是從"學習閱讀"轉向"通過閱讀學習"的分水嶺。一旦落後,孩子會覺得自己不擅長這件事,失去動力,差距持續放大。

而目前AI在一件事上表現得極差:抓住小孩的注意力。電腦對年幼兒童來說更像是一種極具干擾性的力量。AI可以幫助優化"在正確的時間教正確的東西",但以為只要AI足夠聰明,教育的所有問題就會自動解決,這是錯的。

他這個判斷針對的是所有人的教育,不是那些有兩個高教育程度父母、家境前1%的孩子。如果你只關心後者,AI可能確實夠用了。但如果你關心的是所有人,那早期注意力和動機問題是AI目前解決不了的。

11. 2028:菲爾茲獎、機器人和太空數據中心

Joe問他們:如果快進到2028年8月,回頭看這期播客,什麼事情會讓他們覺得"比預期快得多"?

Sholto最關注太空數據中心的進展。一旦實現,算力擴張速度會再上一個台階。他預計到2028年會有Teraab級別的萬億規模算力設施上線,但具體爬坡速度還不確定。

家用人形機器人是他感興趣的另一個判斷點。基線預期是數萬台早期部署,做洗衣和基本清潔。但也可能快得多。他提到了世界模型的進步速度超出預期,一旦機器人到位,進步會進一步複合加速。

最後是學術獎項。AI在2028年拿到菲爾茲獎,Sholto認為"相當可能,極有可能"。諾貝爾獎在2030年前,"感覺非常可能"。普利茲獎,他覺得2028年大概還不行。

這三個判斷的排序本身就很有意思。數學和科學最先,文學最後。 這和他們前面解釋的邏輯完全一致:RL在有明確對錯答案的領域最容易做,文學創作恰恰是最難判定對錯的。

這期對話的資訊密度集中在兩個層面。技術層面,Anthropic的RL團隊對AGI時間線的判斷是"幾年之內",支撐這個判斷的不是概念推演,而是他們每天工作方式的實際變化。經濟層面,Nick提出的"智能指數回報"框架解釋了為什麼這個行業不會像傳統技術那樣被快速商品化。tab補全和agentic coding之間差了千萬倍的價值,而從agentic coding到AI科學家又是下一個量級。

關於風險,他們用攻防框架拆出了具體的時間判斷:網路安全兩年內翻轉為防守主導,生物安全需要更長時間和數千億美元投入。Anthropic選擇在Fable模型上先與政府協調而放棄領先窗口,是用實際行動回應"監管俘獲"的指控。

核心問答

Q1: Anthropic內部怎麼理解AGI的時間線?

Sholto和Nick都認為,能力與所有人類相當或更強的模型會在未來幾年內出現。支撐這個判斷的不只是評測分數,更是他們自己工作方式的實際變化。Sholto 18個月前還在手敲每一行代碼,現在可以讓模型獨立工作一兩天,像帶一個初級團隊成員。

Q2: 為什麼他們認為AI不會快速被商品化?

Nick提出了"智能的指數經濟回報"框架:每增加一個邊際單位的智能,其價值是前一個的指數倍。tab補全和agentic coding之間差了千萬倍的價值。同時,同等水平的智能成本每年下降約10倍。前沿有巨大溢價,落後的部分自然變便宜,兩者同時成立。等到前沿被商品化的那一天,整個經濟已經被AI改造了。

Q3: Anthropic怎麼回應"監管俘獲"的指控?

兩個層面。一是事實:推動開源權重的主力是Nvidia、Amazon、Microsoft和中國的大型實驗室,它們完全有能力應對監管。二是行為:Anthropic在擁有遠超競爭對手的最強模型時,選擇先與政府協調再發布,犧牲了可能持續數月的領先優勢。"到目前為止,我們對自己的減速遠超任何外部力量對我們的減速。"

 

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新