Gemini 4 Argon 發表觀察:跑分很漂亮,但這次最值得看的是發布方式
9 月 30 日,Google DeepMind 發表了 Gemini 4 Argon。發表文由 DeepMind 資深副總裁 Koray Kavukcuoglu 署名,定位寫得很明確:處理「複雜、長時程」的工作流程——真實世界的軟體工程、法律與財務這類企業知識工作,以及資安防禦。
讀完官方發表和幾篇外媒報導,我們最直接的感想是:數字確實很強,但這次真正值得花時間想的,是 Google 選擇怎麼把它交出來——以及,現在幾乎沒有人用得到它。
我們平常做 AI 應用開發與多模型整合,所以以下的視角會偏向「這對實際要導入的人代表什麼」。
註:本文寫於 2026 年 10 月 5 日。Argon 目前尚未開放一般 API,文中的跑分與內部案例都來自 Google 官方發表與外媒整理,我們沒有實測過。開放後會再補一篇上手紀錄。
先看官方說了什麼
定位:長時程的軟體工程、企業知識工作(法律、財務、稅務)、資安防禦。
輸出上限:單次最多 100 萬個輸出 token,上一代是 6.4 萬。
價格:推廣期每百萬 token 輸入 2 美元、輸出 10 美元;快取輸入再便宜 95%(每百萬 0.1 美元)。推廣期結束後調為輸入 4 美元、輸出 20 美元。
開放狀態:目前只開放給 Google Fairwind 計畫裡的「受信任資安防守方」。下一批是付費 API 客戶與 Google AI Ultra 訂閱者,但沒有公布日期。
想法一:跑分很漂亮,但成績單是自己公布的
根據 VentureBeat 的統計,Google 揭露的 18 項基準測試中,Argon 有 13 項領先或並列。幾項差距特別大的如下(單位為 %,數字取自 Google 公布、VentureBeat 整理):
基準測試 | Gemini 4 Argon | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|---|
Harvey Legal Agent(法律代理) | 19.6 | 3.8 | 5.4 |
AutomationBench(業務自動化) | 51.3 | 42.5 | 41.4 |
Vals Finance Agent v2(財務代理) | 65.4 | 58.6 | 53.5 |
DeepSWE v1.1(軟體工程) | 77.9 | 74.2 | 74.1 |
GraphWalks(長脈絡推理) | 84.2 | 66.8 | 71.8 |
Terminal-bench 4.0(終端機操作) | 57.4 | 66.4 | — |
FrontierSWE v2(軟體工程) | 55.0 | — | 65.5 |
「—」表示報導未列出該數字。看這張表,我們有三個想法:
第一,不是全面輾壓。在 Terminal-bench 4.0 上 Claude Opus 5.5 領先 9 分;FrontierSWE v2 與 Terminal-Bench Science 則是 GPT-6 Astra 領先約 10 分。所謂「寫程式最強」,要看你寫的是哪一種程式——大型 repo 的工程任務,和需要大量操作終端機的代理任務,排名並不一樣。
第二,絕對值比排名更有資訊。Harvey 法律代理測試的 19.6% 是對手的三到五倍,但換個角度看,八成的任務仍然沒有完成。AutomationBench 的 51.3% 也是一樣:領先,但只做對一半。「領先」和「可以放手交給它」之間,還有很長一段距離。
第三,目前沒有人能獨立驗證。這些數字全部由 Google 公布,而 API 尚未開放,第三方無從重現。我們不是說數字有問題,而是「官方跑分」和「在你自己的任務上表現如何」,經驗上常常是兩回事。
想法二:100 萬輸出 token,改變的是工作的形狀
比起跑分領先,這是我們最在意的一項規格。
輸出上限 6.4 萬 token 的意思是:一次回應大概只能寫出幾千行程式碼。任務一大就得切塊、排程、再把結果拼回去——老實說,AI 整合工作有不小比例就是在處理這種切與拼。上限拉到 100 萬,這件事的前提就變了。
Google 自己舉的內部案例很能說明規模:
大規模 C/C++ 轉 Rust 的遷移,官方提到超過 80 萬行,案例包含 Fuchsia 的 Zircon 核心。
libgav1 影片解碼器:取代約 32,000 行手寫 SIMD 程式碼,新解碼器快 2.7 倍。
資料中心記憶體最佳化:找出的改進釋放了超過 300 TiB 的記憶體。
我們的看法是:當模型一次能寫出這麼多,瓶頸會從「生成」移到「驗證」。80 萬行的 diff 誰來審?最後真正卡住你的,會是測試覆蓋率、CI 流程和分階段上線的機制。測試本來就薄弱的團隊,拿到更大的輸出上限並不會比較輕鬆,只會更快得到一份更大、更難審查的改動。
另外算一下成本:一次寫滿 100 萬 token 的輸出,推廣價是 10 美元,正式價 20 美元。對一次程式碼遷移來說不算貴;但放進會自動重試的代理迴圈裡,就很容易累積起來。記得設輸出上限。
想法三:最強的模型,先交給防守的人
這是我們認為這次發表最有意義的部分。
Argon 沒有公開上市,而是先交給 Fairwind 計畫的成員。Google 給的理由很直接:Argon 能夠找出、驗證並修補關鍵軟體漏洞——而同一種能力,換個人用就能拿來攻擊。Google 表示會在廣泛開放前,先強化針對資安與 CBRN(化學、生物、放射、核子)濫用的防護,包括監測模型的內部激活;也參與了美國政府自願性的模型上市前審查流程。
據外媒整理,Fairwind 目前有超過 650 個合作夥伴,優先順序是政府與資安主管機關、關鍵基礎設施營運者、大型科技平台;使用者必須是具名帳號並採用抗網路釣魚的多因素驗證,不得分享或轉售存取權。部分夥伴拿到的,甚至是拿掉資安防護限制的版本。
把時間拉長一點看,這不是 Google 獨有的做法。半年內,三家頂尖實驗室各自走了一條路:
Anthropic(4 月):Claude Mythos Preview 只透過 Project Glasswing 提供給約 50 家經過審核的組織,當時表示沒有全面開放的計畫。
OpenAI(9 月初):GPT-6 Astra 全面開放,但進階的攻擊性資安能力鎖在 Daybreak 計畫裡,公開版本只做程式碼安全審查、修補這類防禦性工作。
Google(9 月底):Argon 整個模型先給防守方,其他人之後再說。
細節不同,方向一致:「發表日 = 所有人都能用」,已經不是頂尖模型的預設了。能力會先交給可以被識別、被問責的人,再逐步擴大。我們認為這是合理的——這些模型找到的漏洞需要時間修補,讓防守方先跑一段,正是重點所在。
對一般企業來說,這帶來兩個很實際的影響:
依賴套件的更新節奏要加快。這類模型最常掃的,是被大量使用的開源套件與基礎設施,接下來修補會發得更密。「落後幾個版本」的代價會比以前高。據報導,Wiz 已經透過「Scan for Good」計畫用 Argon 在一套醫療軟體中找到了嚴重漏洞。
提示注入降低,不等於歸零。在 Gray Swan 的間接提示注入測試中,Argon 被攻破的比例是 0.7%(Claude Opus 5.5 為 1.0%、GPT-6 Astra 為 8.5%)。這是很大的進步,但當一個代理每天要讀上千份外部文件和信件,0.7% 還是會發生。權限邊界、高風險操作的人工確認,這些系統設計層的防護不能因為模型變強就省略——這也是我們做整合時一定會堅持的部分。
想法四:推廣價很香,但請用正式價做預算
以頂尖模型來說,輸入 2 美元、輸出 10 美元的推廣價相當有侵略性。快取輸入只要每百萬 0.1 美元這點更值得注意:對於每一輪都要重送同一份長脈絡(整個 codebase、一整套合約、作業手冊)的代理工作流程,快取命中率往往比牌價更能決定帳單金額。
但「推廣期」的意思就是之後會翻倍到 4 美元/20 美元,而結束日期沒有公布。做預算時請直接用正式價估,推廣價當作額外的紅利就好。
對正在導入 AI 的團隊,我們的建議
現在什麼都不用改。你呼叫不到它,不需要為了一個用不到的模型重寫產品路線圖。
把模型放在可替換的位置。光是這一個月,「跑分第一」就換過手。模型呼叫應該包在一層抽象之後,提示詞與評測流程不要綁死在單一廠商;換模型應該是改設定、重跑評測,而不是重寫系統。
先準備自己的評測集。從你的業務裡挑 20 到 50 個真實任務(一份真實的合約、一張真實的工單、一段真實的舊程式碼),附上已知的正確答案。等 Argon 開放 API,你一天之內就能知道它對你來說是不是更好。這比任何排行榜都有用,而且之後每個新模型都能重複使用。
預算用正式價估。理由如上。
補強測試與權限邊界。更大的輸出、更強的代理,會把你現有的驗證與權限設計一起放大——不論那個設計是好是壞。
結語
Argon 最讓我們在意的不是「18 項中領先 13 項」,而是它代表的新常態:頂尖能力會先交給能被問責的人,再慢慢到所有人手上;而模型一次能寫出的量,已經超過大多數團隊一次能審查的量。
這兩件事指向同一個結論:接下來拉開差距的,不只是你用了哪個模型,而是你的系統能不能安全地接住它。
Argon 開放 API 後,我們會用自己的評測集實測,再寫一篇上手紀錄。如果你的團隊正在評估多模型架構,或想知道新模型該怎麼接進既有系統,歡迎到聯絡頁聊聊。