當AWS在今年三月才剛喊出「百萬顆GPU」的部署目標時,市場已經覺得那是個天文數字。沒想到僅僅五個月後,這個數字直接翻倍。兩百萬顆輝達晶片,那是什麼概念?如果把它們排成一列,大概可以從台北鋪到高雄來回好幾趟。但這不是硬體展覽,這是亞馬遜在AI戰場上投下的震撼彈。
8月26日這天,AWS與NVIDIA正式宣布深化策略合作,未來兩年內要在全球資料中心額外塞進200萬顆輝達GPU。說「額外」是因為三月那批百萬顆的訂單還沒消化完,現在又疊上去。官方說法是「市場需求遠超預期」,但說真的,這句話我們在過去十八個月已經聽過不下十次了。每次聽到,背後都是市值幾千億的公司正在瘋狂搶灘。
表象:一場看似「我全都要」的軍備競賽
從新聞稿來看,這筆交易涵蓋的產品線相當完整:Blackwell Ultra、Rubin、Rubin Ultra,幾乎是輝達接下來兩到三年的主力全餐。而且不只有GPU,連Vera CPU、先進網路技術、機器人框架都包進去。AWS甚至還特別為美國政府打造專屬AI工廠,在高安全性環境中部署10萬顆GPU,專門處理聯邦與國安級別的任務。
看起來像是亞馬遜徹底倒向輝達陣營,對吧?但有趣的是,亞馬遜自己也沒閒著。他們的自研晶片Trainium和Inferentia一直在默默推進,某種程度上,AWS現在的行為就像一個餐廳老闆,一邊自己種菜、一邊又跟最大供應商簽了天價採購合約。矛盾嗎?一點也不。這叫避險,也叫彈性。
「市場對AI基礎設施的需求持續升溫且遠超預期,先前的部署目標已無法滿足現狀。」——AWS與NVIDIA聯合聲明
這段官方說法其實透露了兩個訊息。第一,AI算力的消耗速度比所有人想的都還要快,尤其是代理式AI(Agentic AI)和所謂的實體AI(Physical AI)開始進入商用場域之後,GPU不再是「跑完訓練就收工」的短跑工具,而是必須24小時待命的基礎設施。第二,AWS在這個時間點加碼,某種程度上也是在對華爾街喊話:我們沒有要退出GPU軍備競賽,別把訂單全部讓給微軟或Google。
真相:兩百萬顆晶片背後的算力政治學
如果把這筆訂單放到更大的格局來看,它其實是一場算力政治學的具體展現。AWS在全球基礎設施中部署輝達晶片,不只是為了服務新創公司跑模型,更重要的是搶占「AI工廠」這個新名詞的定義權。
所謂AI工廠,黃仁勳已經在很多場合描繪過那個畫面:不再是傳統的資料中心,而是一個專門生產「智慧」的製造基地。AWS這次的部署,等於是在全球各地同時開工興建幾十座這樣的工廠。而且他們還特別強調要支援科學研究、企業自動化、代理式AI——這些都是長期合約的標的,不是一次性的專案。
但這裡有個沒人明說但大家都心知肚明的現實:GPU的部署速度永遠趕不上模型參數的膨脹速度。GPT-4用了多少顆晶片訓練?市場傳言是兩萬到三萬顆。GPT-5呢?沒人知道,但肯定不是線性成長。當OpenAI、Anthropic、Google DeepMind同時在搶同一批產能時,AWS這200萬顆的承諾,某種程度上也是在幫自己的客戶「卡位」——如果你是我的企業客戶,至少你確定未來兩年有晶片可以用。
「代理式AI沒有唯一解,輝達、AMD、英特爾與亞馬遜各出奇招。」——業界分析師普遍共識
這句話點出了整個產業的縮影。沒有人敢把所有雞蛋放在同一個籃子裡,但又沒有人敢不買輝達的籃子。這就是目前AI硬體市場最弔詭的現狀。
各方角力:AWS、微軟、Google的三國殺
微軟買了多少輝達晶片?沒有官方數字,但從他們對OpenAI的投資規模來看,絕對不會少於AWS。Google呢?他們有TPU自研路線,但同樣也在採購輝達產品。三巨頭在AI算力上的資本支出,已經從「軍備競賽」進化到「國防預算」的等級。
AWS這次特別強調要為美國政府打造專屬AI工廠,這一步棋下得很巧。10萬顆GPU部署在高安全環境中,等於是把商用算力直接輸出給聯邦政府。這不是單純的生意,這是戰略物資的供應合約。一旦這個模式跑通,未來其他國家的政府部門也可能比照辦理——當然,台灣的企業和政府單位要使用這些服務時,資料落地和資安稽核就是另一個層次的問題了。
話說回來,AWS和輝達的合作也不是完全沒有風險。輝達的晶片供應能力一直是市場關注的焦點,兩年200萬顆的數字很大方,但能不能如期交貨?Blackwell系列的量產時程是否會遞延?這些都是藏在新聞稿底下的未爆彈。
從產業面來看,AWS這次加碼的真正意義不在於「買了多少顆晶片」,而在於它把輝達的次世代產品線全部綁進自己的服務地圖裡。Blackwell Ultra、Rubin、Rubin Ultra——這些名字對一般消費者來說很陌生,但對企業IT決策者來說,代表的是未來兩年「能不能用AWS跑得動下一代模型」的關鍵答案。亞馬遜等於是在對所有企業客戶說:你們不用擔心算力不夠,我已經幫你們囤好貨了。這個訊號比任何價格戰都還要致命。
深層影響:當算力變成水電之後
這筆交易的深層意義,其實藏在一個不起眼的關鍵詞裡:「AI工廠」(AI Factory)。傳統的資料中心賣的是機櫃空間、頻寬、電力。但AI工廠賣的是「產出智慧的能力」——也就是說,客戶不再需要自己搞懂GPU型號、網路架構、散熱設計,只需要告訴AWS「我要跑什麼模型、要多少產出」,剩下的事情全部由基礎設施搞定。
這聽起來很美好,但對台灣的軟體開發者和新創團隊來說,背後有個殘酷的現實:算力正在變成水電一樣的基礎設施,而水電公司不會在乎你拿水去煮麵還是釀酒。當算力變成商品化服務,真正的價值會轉移到兩端:最底層的晶片設計,和最上層的應用場景。中間那層的「優化工程師」角色,會愈來愈被自動化工具取代。
另一個沒人敢大聲說的事是:兩百萬顆GPU的電力消耗有多驚人?一顆H100的峰值功耗約700瓦,200萬顆同時運作就是1.4百萬千瓦——差不多是一座中型核電廠的發電量。AWS當然會用再生能源和更先進的散熱技術來處理,但這也意味著AI算力的擴張,終究會撞上能源和環境的現實天花板。
未解之問
寫到這裡,我腦中一直繞著一個問題轉:如果明年輝達的下一代晶片又延遲了,AWS要拿什麼來補這200萬顆的缺口?或者換個角度想,如果AMD的MI系列突然大爆發,AWS會不會後悔把雞蛋放在同一個籃子裡?
更值得追問的是,這些天量的GPU部署完成之後,真正能創造價值的應用場景在哪裡?代理式AI聽起來很厲害,但多數企業連「什麼是代理式AI」都還講不清楚。科學研究需要大量算力,但科學研究的經費來源和採購周期,跟AWS的商業模式不一定對得上。
還有一個更根本的問題:AI算力的過度集中,會不會讓全球的AI創新反而變得更不均衡?當只有少數幾家超大型雲端業者有能力部署百萬顆等級的GPU叢集,那些沒有富爸爸的新創公司,未來要怎麼跟巨頭競爭?
這些問題沒有標準答案,但值得每一個正在使用AI服務的人多想一下。
AI算力的軍備競賽還沒看到終點,但我們已經可以確定一件事:未來兩年,AWS的資料中心會變成地球上最昂貴的工廠。至於這座工廠產出的東西,是推動人類進步的火花,還是另一場泡沫的前奏,時間會給出答案。而作為使用者或投資人,你至少該問自己一句:我的策略,跟得上這兩百萬顆晶片的速度嗎?
本文改寫整理自公開新聞來源,原始報導由科技新報發布。
常見問題 FAQ
AWS這次部署200萬顆輝達晶片,對一般企業用戶有什麼具體影響?
直接影響是算力資源將更充足且可能降價。AWS大規模採購可攤提成本,加上EC2執行個體供應更穩定,企業訓練模型的等待時間會縮短,長期來看單位算力成本有機會下降。
Blackwell Ultra和Rubin晶片跟現在的H100有什麼不同?
Blackwell Ultra是Hopper架構的下一代,推論性能號稱是H100的數倍,Rubin則是更後續的架構,預計2026年後問世。簡單說,這兩款都是為了因應更大規模模型和更複雜的代理式AI工作負載而設計的專用晶片。
AWS同時發展自研晶片又大量採購輝達GPU,策略上矛盾嗎?
不矛盾,這是典型的雙軌策略。自研晶片主打成本效益和特定工作負載優化,輝達GPU則確保生態系相容性和最高效能。AWS用兩種武器去打不同市場區隔,反而讓客戶有更多選擇彈性。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。