EP339. Grok 4.7 失敗了嗎、模型大戰趨勢觀察、Muse 爆紅後影響 | M觀點

M觀點 · 2026-09-24

重點

章節

AI模型大戰新格局:從Grok 4.7失望到Muse封殺案,解析科技巨頭的護城河之爭

本週AI產業迎來新一輪模型大戰,SpaceX的Grok 4.7表現不如預期,OpenAI推出GPT-6 Soul/Luna主打低價策略,而Anthropic的Opus 5.5則以壓倒性分數成為現役最強模型。與此同時,Meta的AI助理Muse因在亞馬遜購物遭封殺,凸顯出在AI時代,實體世界的物流與會員體系反而成為最難被撼動的護城河。

川習會觀察:地緣政治風險無須過度擔憂,台灣議題非交易籌碼

本週最大的國際新聞莫過於川習會的正式展開,市場對於美中關係走向高度關注。然而,從雙方的籌碼與需求角度分析,這次會談不太可能出現重大突破或實質成果。雙方預期僅會各自表達善意,但難以達成具體協議。

市場上部分人士擔憂川普可能將台灣作為談判籌碼,但這種憂慮缺乏現實基礎。關鍵在於,習近平無法提供川普真正想要的交換條件。川普的核心訴求涉及貿易、科技競爭等重大利益,而中國現階段能提供的讓步相對有限,不足以換取美國在台灣議題上的重大立場轉變。

整體而言,這次川習會對金融市場的影響應屬中性,投資人無須因短期的地緣政治消息而過度調整投資組合。真正值得關注的仍是企業基本面與AI產業的長期發展趨勢。

Grok 4.7深度解析:AAII分數僅微幅進步,市場失望但特定領域展現亮點

SpaceX備受期待的Grok 4.7終於在本週推出,但市場反應普遍失望。從AAII(Artificial Analysis Intelligence Index)的評分來看,Grok 4.7僅從前代的44分進步到46分,微幅提升2分,不僅落後於GPT-5.6 Soul的47分,更不及Meta MusePark 1.3的48分。

更令人擔憂的是成本效益比。Grok 4.7的每任務成本(cost per task)是Grok 4.6的兩倍,甚至比GPT-6 Extra還昂貴,CP值明顯下滑。這與過去Grok系列以高CP值著稱的定位形成強烈對比,讓外界質疑馬斯克這次的產品策略是否失準。

然而,若深入檢視特定領域的表現,Grok 4.7並非一無是處。在Terminal Bench 4.0的測試中,Grok 4.7的得分從前代的20.3%躍升至37.6%,幾乎翻倍。這顯示在Agentic Coding(代理型程式開發)領域,Grok 4.7確實有顯著進步,但僅限於在Grok Build與Cursor這兩個開發環境中才能充分發揮。

後訓練時間不足的猜測:Grok 4.7的企業市場定位與防守策略

Grok 4.7的表現之所以出現「總分平庸、特定領域突出」的矛盾現象,推測與後訓練(post training)時間不足有關。從1.5T參數擴大到2.1T參數的模型本身並未顯著變聰明,而SpaceX可能因時間壓力,只能選擇性地針對企業最需要的兩個領域——Agentic Coding與Agentic Knowledge Work(代理型知識工作)——進行強化訓練。

這種策略反映出SpaceX的務實考量:與其追求全面性的分數提升,不如鞏固既有生態系內的開發者與企業用戶。對於已在Grok Build或Cursor環境中工作的用戶而言,Grok 4.7確實帶來明顯的效能提升;但對於外部用戶,吸引力則相對有限。這更像是一種防守性的產品更新,而非進攻性的市場擴張。

值得注意的是,Grok 4.7對GrokBot的原生支援可能成為意外亮點。由於GrokBot在美國企業市場已相當受歡迎,而Grok 4.7在長任務處理上的強化,搭配對GrokBot架構的原生理解,可能讓AI Agent的執行效率大幅提升,甚至因任務完成率提高而降低整體成本。

本週AI模型大戰總覽:GPT-6 Soul/Luna低價搶市,Opus 5.5奪下最強寶座

本週AI模型市場出現三強爭霸的局面。OpenAI推出的GPT-6 Soul與Luna,實力與前代GPT-5.6 Soul幾乎相同,AAII分數僅微幅提升1分,但成本卻降至一半以下。其中GPT-6 Luna的成本甚至僅有DeepSeek V4.1 Flash的四分之一,展現極強的商業競爭力,顯然是針對大規模部署的企業市場而來。

相較之下,Anthropic的Opus 5.5則以壓倒性的AAII 58分成為現役最強模型,大幅領先Fable 5.1與GPT-6 Extra的53分。在Terminal Bench、Cursor Bench、GPT-Val等多項測試中,Opus 5.5都明顯勝出。然而,社群用戶的實際體驗卻顯示,在更複雜、非標準化的任務上,Fable 5.1的核心智能可能仍優於Opus 5.5,反映出Benchmark分數與真實世界表現之間的落差。

從這三家的產品策略可以看出,AI模型競爭正從單純的智力較量,轉向差異化定位。SpaceX強化產品生態系,OpenAI主打成本優勢,Anthropic則持續衝刺最前沿的模型能力。值得注意的是,Anthropic此次積極推出Opus 5.5,可能與其即將進行的IPO有關,需要在企業市場扳回一城以支撐估值。

Anthropic與OpenAI同意互相測試模型:AI風險管理的進步與監管捕獲隱憂

本週另一項重要發展是Anthropic與OpenAI同意彼此測試對方的AI模型,以進行風險評估。這項由馬斯克提出的概念,讓兩家前沿AI實驗室可以互相對對方的模型進行壓力測試,找出內部測試可能遺漏的安全漏洞。由於每家公司的測試方法與重點不同,這種交叉驗證確實能提升模型的整體安全性。

然而,這項合作也引發了「監管捕獲」(regulation capture)的擔憂。如果未來AI模型的上市必須通過少數幾家前沿公司的測試認可,可能形成寡佔壁壘,不利於中小型AI業者的發展。理想的解決方案是建立混合測試架構,由政府認可多家測試機構(包括AI公司、獨立研究機構、學術單位),模型開發者可從中選擇數家進行測試,避免單一機構的壟斷。

這種架構類似會計師簽證制度,既確保了風險管理的基本門檻,也維持了市場競爭的公平性。對於投資人而言,AI安全議題的進展將直接影響相關公司的監管風險與營運成本,值得持續關注。

Meta Muse遭亞馬遜封殺:AI Agent購物引發的平台主權之爭

Meta的AI助理Muse近期在美國爆紅,但隨即遭到亞馬遜封殺,禁止其在平台上進行購物。亞馬遜提出四點理由:第一,Meta從未告知或取得同意;第二,Muse在瀏覽網頁時隱藏其Agent身份,未在HTTP header中標示;第三,用戶的帳號密碼等隱私資料可能外洩;第四,Muse未尊重第三方店家設定禁止AI Agent購買的權利。

事實上,亞馬遜此前也曾封鎖Perplexity的AI Agent,顯示其對外部AI Agent在平台上活動的強硬立場。Meta則回應表示,Muse的運作是透過虛擬機與瀏覽器的安全架構,公司本身無法看到用戶資料,且下單前會進行最後確認。

這場爭議的核心並非單純的技術或安全問題,而是平台主權與商業利益的角力。亞馬遜深知AI Agent購物將改變消費者的購物習慣,可能削弱其廣告收入與消費者對平台的依賴度。

主持人觀點:Muse應遵守平台規則,但個資爭議亞馬遜應讓步

從平台治理的角度來看,Meta的Muse確實應遵守亞馬遜的規則。首先,若平台規定AI Agent必須在HTTP header中標示身份,就應該如實標示,而非隱藏。其次,若平台允許第三方店家自行決定是否接受AI Agent購物,Muse也應尊重這些設定。這些都是基本的平台規範,沒有理由不遵守。

然而,在用戶個資的爭議上,亞馬遜的立場則有待商榷。Meta所採用的虛擬機隔離架構,在資安領域已是成熟的作法,公司本身無法存取用戶的帳號密碼。若消費者基於對Meta的信任,願意承擔風險將資料交給Muse管理,亞馬遜不應過度干預。

歸根究底,亞馬遜封殺Muse的真正原因並非安全考量,而是商業利益的保衛戰。AI Agent購物將從根本上改變消費者在平台上的行為模式,進而影響亞馬遜的廣告收入與市場地位。

AI Agent購物對亞馬遜的衝擊:短期減少消費與廣告收入,長期動搖護城河

AI Agent購物對亞馬遜的影響可分為短期與長期兩個層面。短期而言,當AI Agent取代真人購物時,將減少推薦商品的曝光機會與隨機購買行為,直接影響平台的交易量。同時,商家在亞馬遜上投放的廣告也無法觸及AI Agent,廣告收入將面臨下滑風險。

長期來看,影響更為深遠。目前美國消費者的購物習慣是直接開啟亞馬遜網站或App,這是亞馬遜最重要的護城河。但如果未來消費者的第一站變成詢問Muse或其他AI助理,而非直接造訪亞馬遜,這條護城河將被大幅填平。亞馬遜將從一個直接的消費入口,降級為背後的供貨管道。

因此,亞馬遜的封殺行動本質上是對其商業模式的防禦。雖然亞馬遜本身也有AI購物助理Alexa for Shopping,但消費者可能更偏好使用日常習慣的AI助理。如何讓外部AI Agent在符合亞馬遜利益的前提下運作,將是雙方談判的關鍵。

亞馬遜的談判籌碼:物流與Prime會員的不可取代性

亞馬遜在美國電商市場的競爭優勢極為穩固,核心來自兩個難以複製的壁壘。第一是物流體系,亞馬遜提供當日到貨、隔日到貨等快速配送服務,一旦消費者養成快速到貨的習慣,就難以接受其他平台較慢的配送速度。第二是Prime會員制度,會員享有免運費、專屬折扣等多項福利,形成高度的用戶黏著度。

這兩大優勢賦予亞馬遜極強的議價能力。即使Muse或其他AI Agent再受歡迎,若無法在亞馬遜上購物,消費者最終仍會回到亞馬遜的平台。因為在其他電商平台購物不僅需要支付運費,配送速度也較慢,對Prime會員而言是完全無法接受的體驗。

這也印證了一個重要趨勢:在AI時代,建立在實體世界的護城河(如物流、會員體系)反而比純數位世界的護城河更具價值。AI可以輕易取代數位服務,但無法複製實體的物流網絡與配送能力。

Meta與亞馬遜的潛在合作模式:API付費、廣告分潤與佣金拆帳

面對亞馬遜的強勢立場,Meta可能尋求多種合作模式來化解僵局。第一種是API付費模式,亞馬遜可能要求外部AI Agent透過付費API進行購物操作,而非直接瀏覽網頁,同時在API回傳的資料中嵌入推薦商品資訊,維持廣告曝光。

第二種是廣告整合模式,亞馬遜的廣告可以投放到Muse的使用介面上,當用戶進行電商購物時,仍能看到亞馬遜的廣告,亞馬遜則可能與Meta進行廣告分潤。第三種是成交抽成模式,亞馬遜對透過Muse完成的交易抽取一定比例的佣金,而Meta未來若向消費者收取跑腿佣金,也可與亞馬遜拆分。

此外,意圖資料(intent data)的分享也是可能的合作方向,但涉及隱私問題,短期內實現的難度較高。整體而言,Meta在這次對抗中處於劣勢,必須盡快與亞馬遜達成協議,否則將把競爭優勢拱手讓給競爭對手。

亞馬遜的護城河分析:物流與Prime會員是AI無法取代的實體壁壘

亞馬遜的競爭優勢已從早期的網站流量,轉移到物流體系與Prime會員制度。這種轉變在AI時代顯得格外重要,因為AI可以輕易取代數位世界的服務,但無法複製實體世界的物流網絡。當日到貨、免運費、會員專屬折扣等福利,構成了消費者無法脫離亞馬遜的強大拉力。

對於Meta而言,Muse目前的成功只是短暫的窗口期。如果無法解決在亞馬遜上購物的問題,消費者最終仍會回到亞馬遜的平台,Muse的實用性將大打折扣。更關鍵的是,競爭對手的AI Agent若搶先與亞馬遜達成合作,Meta將失去先發優勢。

這場平台之爭也揭示了AI時代的投資邏輯:擁有實體世界壁壘的企業,反而比純數位企業更具防禦性。亞馬遜的物流體系、Prime會員生態,都是AI難以撼動的競爭優勢,這也是投資人在評估科技巨頭時應重點關注的面向。

Muse台灣缺席的原因與AI Agent對CPU需求的推升效應

許多台灣用戶好奇為何Muse尚未在台灣推出,核心原因在於Meta目前的算力不足。Muse在美國市場的需求已相當緊繃,Meta現階段的GPU資源尚不足以支撐大規模的國際擴張。未來Meta可能透過減少免費額度或調整服務策略來因應算力瓶頸。

值得關注的是,AI Agent的普及將大幅推升CPU需求。雖然AI模型在進行推理判斷時主要使用GPU,但AI Agent在執行實際任務時——例如瀏覽網頁、讀取資料、點擊按鈕、填寫表單——都是使用CPU進行操作。隨著AI Agent應用日益廣泛,CPU與GPU的用量比例可能回到1:1的水準。

這對於半導體產業的投資人而言是一個重要訊號。過去市場焦點多集中在GPU的需求爆發,但AI Agent的崛起將帶動新一波的CPU需求成長,相關供應鏈值得關注。

結論

本週的AI產業動態反映出幾個重要趨勢:第一,AI模型競爭正從單純的智力評分轉向產品化與差異化,模型加Harness的整合能力將成為決勝關鍵;第二,AI Agent的普及正在重塑平台經濟的權力結構,擁有實體世界壁壘的企業反而在AI時代更具防禦性;第三,AI產業的算力需求正從GPU擴散到CPU,為半導體供應鏈帶來新的成長動能。投資人在佈局AI主題時,應關注這些結構性的轉變,而非僅聚焦於短期的模型評分競賽。

相關個股

產業 / 題材