產業觀察

Claude Haiku 5.5 發表觀察:等了快一年的入門款,補上四層產品線的最後一塊

2026年10月8日
Claude Haiku 5.5 發表觀察:等了快一年的入門款,補上四層產品線的最後一塊

10 月 7 日,Anthropic 發表了 Claude Haiku 5.5。官方的形容是:「我們發表過最便宜、最快、也最有能力的小模型。」

距離上一代 Haiku 4.5(2025 年 10 月 15 日)將近一年。這段時間裡,Opus 從 4.5 一路更新到 5.5,Sonnet 也走過 4.6、5、5.5 三個版本,Anthropic 甚至在 Opus 之上多開了一個新等級 Fable——只有 Haiku 停在原地,連 5 都直接跳過。所以這篇的標題,我們用了「終於」兩個字。

我們平常做 AI 應用開發與多模型整合,所以以下的視角會偏向「這對實際要導入的人代表什麼」。

註:本文寫於 2026 年 10 月 8 日,Haiku 5.5 發表隔天。跑分與價格來自 Anthropic 官方發表與外媒整理,我們還沒在自己的評測集上實測過。

先看官方說了什麼

  • 定位:大量、對成本敏感的工作——摘要、壓縮對話脈絡、資料庫查詢、分類,以及在 Opus/Sonnet 底下當子代理(subagent)。官方也直說:複雜的代理式寫程式,Sonnet 5.5 和 Opus 5.5 仍是比較好的選擇。

  • 價格:提示在 10 萬 token 以內,每百萬 token 輸入 0.1 美元、輸出 0.5 美元;超過 10 萬,輸入 0.5 美元、輸出 2.5 美元。Haiku 4.5 是輸入 1 美元、輸出 5 美元。

  • 規格:脈絡長度 100 萬 token(前代 20 萬),單次輸出上限 12.8 萬 token(前代 6.4 萬)。

  • 新功能:第一個可以調整 effort(思考深度)的 Haiku,分 low、medium、high、xhigh、max 五段,預設是 medium。

  • 上架:Claude 平台、AWS、Google Cloud、Microsoft Azure 同步開放。

想法一:入門款「終於」更新,四個等級第一次站上同一代

先看這五週的時間線:

  • 9 月初:Fable 5.1(最高等級)

  • 9 月 22 日:Opus 5.5

  • 9 月 28 日:Sonnet 5.5

  • 10 月 7 日:Haiku 5.5

Haiku 5.5 一出,Claude 的四個等級第一次全部屬於 5 世代。在這之前的幾個月,開發者的處境有點尷尬:主力模型已經是 5 世代,最便宜的那一層卻還是一年前的 4.5。想把整套系統升級到同一代,最後總會卡在最小的那一顆。

這件事比聽起來重要。對很多產品來說,每天被呼叫幾萬次的不是旗艦模型,而是分類、路由、摘要、抽取這些小任務——它們跑的就是入門款。旗艦模型的更新決定「能做到多難的事」,入門款的更新則直接決定帳單和延遲。

Haiku 這次從 4.5 直接跳到 5.5,等於一次補上整整一代的差距。從下面的跑分來看,這一年沒有白等。

想法二:官方比較表,每個分數代表什麼

以下是 Anthropic 官方公布的比較表,Sonnet 5.5 為參考欄:

評測項目

Haiku 5.5

Haiku 4.5

GPT-6 Luna

Sonnet 5.5(參考)

知識工作:GDPval-AA v2.1

1620

735

1437

1840

知識工作:AA-Briefcase v1.1

1578

614

1336

1824

電腦操作:OSWorld 2.1(離線子集)

72.4%

15.7%

48.9%

83.9%

跨領域推理:Humanity's Last Exam(不用工具)

45.9%

10.2%

—

56.9%

跨領域推理:Humanity's Last Exam(用工具)

57.4%

18.7%

—

64.5%

代理式寫程式:Terminal-Bench 4.0

39.2%

0.0%

16.4%

70.6%

代理式寫程式:FrontierCode 1.1(Main)

46.4%

—

42.4%

52.1%(xhigh)

視覺推理:Chartography(不用工具)

46.4%

6.4%

29.1%

61.6%

「—」表示官方沒有提供數字。所有數字都由 Anthropic 自行測試與公布。

先講怎麼讀。表裡有兩種分數。最上面兩列知識工作評測都出自評測機構 Artificial Analysis(GDPval-AA 涵蓋 44 種職業的實際工作產出),用的是類似棋賽的 Elo 積分:把不同模型的產出兩兩比較,算出相對強弱。所以 1620 不是「答對 1620 題」,而是要和別人的分數相減來看。其餘各列則是百分比,代表完成率或答對率。

Elo 有一個好用的換算:照標準公式,差 200 分大約是 3 比 1 的勝率,差 400 分大約是 10 比 1。下面就用這個方式解讀知識工作那兩列。

跟 Haiku 4.5 比:不是升級,是換了一個等級

知識工作的 Elo 從 735 跳到 1620,差了 885 分。照標準公式粗估,兩者的產出拿去比,Haiku 4.5 能贏的機率不到 1%。

更值得注意的是幾項「從接近零開始」的成績:

  • 電腦操作(OSWorld 2.1):15.7% → 72.4%,約 4.6 倍。

  • 看懂圖表(Chartography):6.4% → 46.4%,約 7 倍。

  • 終端機裡的代理任務(Terminal-Bench 4.0):0.0% → 39.2%。

這代表一年前「Haiku 根本做不來、只能交給 Sonnet」的工作——操作電腦介面、讀圖表、在終端機裡完成多步驟任務——現在入門款也接得起來了。

不過 0.0% 要看清楚:Terminal-Bench 4.0 是在 Haiku 4.5 之後才出現、難度更高的新版測驗。它說明的是測驗門檻跟著模型一起往上爬,不是 Haiku 4.5 當年沒有用——它發表時的賣點,是「Sonnet 4 等級的寫程式能力、三分之一的價格」。

跟 GPT-6 Luna 比:同一個價格,有數字的項目全部領先

Luna 是 OpenAI 在 9 月 22 日推出的入門款,價格同樣是每百萬 token 輸入 0.1 美元、輸出 0.5 美元。兩週後 Anthropic 用一模一樣的價格推出 Haiku 5.5,這幾欄等於是正面對決。

  • 差距最大的是代理任務與電腦操作:Terminal-Bench 39.2% 對 16.4%(約 2.4 倍),OSWorld 72.4% 對 48.9%(多 23.5 個百分點)。

  • 知識工作的 Elo 分別領先 183 分和 242 分,換算下來,Haiku 5.5 的產出在大約四分之三到八成的比較中勝出。

  • 差距最小的是 FrontierCode:46.4% 對 42.4%,只差 4 個百分點。

但這幾欄要打折看。評測項目是 Anthropic 選的,Luna 的分數怎麼測出來的,官方沒有說明;Humanity's Last Exam 兩列也沒有 Luna 的數字。目前看得到的第三方數字是:Artificial Analysis 的綜合智慧指數給 Haiku 5.5(high)38 分,在 182 個模型中排第 10,同價位模型的中位數是 13。方向一致,但完整的同場比較,還要等獨立評測跟上。

跟 Sonnet 5.5 比:二十分之一的價格,七成五到九成的成績,只有一項例外

Sonnet 5.5 的價格是輸入 2 美元、輸出 10 美元,剛好是 Haiku 5.5(10 萬 token 以內)的 20 倍。把 Haiku 5.5 的分數除以 Sonnet 5.5 的分數:

  • OSWorld 2.1:86%

  • Humanity's Last Exam:不用工具 81%,用工具 89%

  • FrontierCode 1.1:89%(而且 Sonnet 那一格是用 xhigh 跑的)

  • Chartography:75%

  • Terminal-Bench 4.0:56%

知識工作的兩列,Sonnet 分別領先 220 分和 246 分,換算是 Sonnet 在大約八成的比較中勝出。

大部分項目,Haiku 用二十分之一的價格拿到七成五到九成的成績;唯一明顯掉隊的是 Terminal-Bench,也就是需要長時間、多步驟、在終端機裡自己除錯的代理任務。這和官方的定位完全一致:範圍明確的小任務交給 Haiku,長鏈條的代理工作留給 Sonnet 和 Opus。

還有一個有意思的細節:Haiku 5.5 用工具的 Humanity's Last Exam 成績(57.4%),略高於 Sonnet 5.5 不用工具的成績(56.9%)。小模型配上搜尋、程式執行這些工具,可以追平大一級模型的「裸考」。對系統設計的啟示是:決定升級模型之前,先檢查工具有沒有接好,往往更划算。

最容易被忽略的:這些分數是用哪個 effort 跑的?

官方表格裡,只有 Sonnet 5.5 的 FrontierCode 標了 effort(xhigh),Haiku 5.5 的各項都沒有標。但 Haiku 5.5 這次第一次有 effort 可調,而 effort 對分數的影響很大。

根據 VentureBeat 對官方「成本對分數」圖表的判讀,Terminal-Bench 的 39.2% 是在最高的 max 下跑出來的;預設的 medium 大約只有 20%。

這代表表上的分數和表上的價格,不一定是同一個設定下的結果。effort 越高,模型想得越多、輸出的 token 越多,每個任務的實際花費也越高。Anthropic 自己也附了一張成本對分數的圖,那才是比較完整的讀法:跑分要和成本一起看。實務上,請在自己的任務上把 low、medium、high 都跑一輪,再決定預設值。

想法三:「便宜 90%」要看條件

價格是這次最吸睛的數字,但有三個細節要一起看:

  1. 10 萬 token 是一條線。90% 的降幅只適用於 10 萬 token 以內的提示;超過的話,整個請求改用較高的費率,只便宜 50%。Anthropic 表示 Haiku 4.5 約九成的請求落在 10 萬以內,綜合估算平均便宜約 75%。

  2. 新的 tokenizer 會多算約 30% 的 token。同一段文字在 Haiku 5.5 上會被切成更多 token。粗估換算下來,10 萬以內實際約便宜 87%,超過 10 萬則只剩約 35%。

  3. 思考預設開啟。Haiku 4.5 不會主動思考,Haiku 5.5 預設以 medium 思考,而思考的部分也算輸出 token。

換句話說,100 萬 token 的脈絡長度能用,但不便宜:一旦超過 10 萬,費率就是五倍。如果你的工作流程能把每次請求控制在 10 萬以內,再搭配提示快取(快取讀取每百萬 token 只要 0.01 美元),Haiku 5.5 才是真的便宜。

另一個訊號是價格地板。Luna 9 月 22 日以 0.1/0.5 美元推出,兩週後 Haiku 5.5 用同一個價格跟上;Google 目前最便宜的 Gemini 3.5 Flash-Lite 則是輸入 0.3、輸出 2.5 美元。入門款的價格,現在就落在這裡。

想法四:為什麼只有 Anthropic 有完整的四個等級

先釐清「四大」:一般指的是 OpenAI、Google、Anthropic,再加上 xAI 或 Meta,看你問誰。把各家目前的產品線攤開來看:

公司

目前的產品線

我們的觀察

Anthropic

Fable 5.1/Opus 5.5/Sonnet 5.5/Haiku 5.5

四個等級都屬於 5 世代、都已正式開放,五週內全部更新完

OpenAI

GPT-6 Astra/Sol/Luna

三個等級;官方模型列表上沒有 GPT-6 的 mini 或 nano

Google

Gemini 4 Argon/Gemini 3.1 Pro/3.8 Flash/3.5 Flash-Lite

名義上四層,但 Argon 只開放給 Fairwind 計畫、3.1 Pro 在 API 上仍是預覽版,四層分屬四個版本號

xAI

Grok 4.7、4.6、4.5、4.3、4.20 等

以版本號和「推理/非推理」等後綴區分,沒有固定的等級命名

Meta 的 Muse Spark 目前也以版本更新為主,還沒有分級的產品線。

所以更精確的說法是:四個等級都在同一代、而且都已正式開放的,目前只有 Anthropic。Google 名目上也有四層,但最上面那層一般人用不到,最核心的 Pro 還停在 3.1 預覽版。

為什麼 Anthropic 會走成這樣?以下是我們的解讀:

第一,第四層是「安全優先發布」長出來的。Anthropic 原本只有 Haiku、Sonnet、Opus 三層。今年 4 月,能力更強的 Claude Mythos Preview 只透過 Project Glasswing 提供給少數經過審核的組織;6 月 9 日推出的 Fable 5,則是這個新等級的公開版本,發表時被判定為資安、生物等高風險的請求,會改由 Opus 回答。

也就是說,Anthropic 沒有把最強的模型直接叫做「新的 Opus」,而是在上面另開一層。結果是 Opus 可以繼續當大家日常使用的旗艦,甚至還降價(Opus 5.5 是輸入 4 美元、輸出 20 美元,比 Opus 5 的 5/25 美元便宜)。Google 和 OpenAI 用存取計畫處理同樣的問題(Argon 的 Fairwind 計畫、GPT-6 Astra 進階資安能力的 Daybreak 計畫),Anthropic 則把它變成產品線裡的一層。

第二,企業要的是一條價格曲線,不只是一個最強的模型。四個等級的價格(每百萬 token 輸入/輸出)是:Fable 10/50 美元、Opus 4/20 美元、Sonnet 2/10 美元、Haiku 0.1/0.5 美元。對照 OpenAI:Sol 和 Sonnet 同價、Luna 和 Haiku 同價、頂規對頂規;Anthropic 多出來的,是夾在頂規和主力之間的 Opus。團隊可以依任務難度在四個價位之間挑,而不是只能在「最強」和「便宜」之間二選一。

也值得注意:前三層之間的價差只有 2 到 2.5 倍,Sonnet 和 Haiku 之間卻差了 20 倍。Haiku 的定價已經不是「小一號的 Sonnet」,而是另一種用途的工具。

第三,名字穩定,遷移成本就低。Haiku、Sonnet、Opus 這組名字從 2024 年 3 月的 Claude 3 用到現在,每一層的定位幾乎沒變。兩年前寫下「分類用 Haiku、主流程用 Sonnet」的團隊,今天換個版本號就能升級,不用重新設計架構。相比之下,Google 的四層分屬 3.1、3.5、3.8、4 四個版本號,最上層還改用代號;xAI 則以版本號區分。這無關技術高下,但對做整合的人來說,可預期的命名本身就是一種產品力。

第四,代理時代需要「主管加助手」。多代理架構裡,通常由一個強模型負責規劃與判斷,再把查資料、摘要、分類這些範圍明確的工作分派給小模型。官方列出的客戶案例就是這樣用的:Cognition 的 Devin Fusion 由 Opus 5.5 當主力、Haiku 5.5 當助手;金融 AI 公司 Rogo 讓 Haiku 5.5 當子代理,進 10-K 年報抓出簡報需要的營收數字。

四個等級出自同一個家族,API 行為一致;依官方的遷移指南,Opus 5.5 和 Sonnet 5.5 還能讀取 Haiku 5.5 的思考紀錄,對話從 Haiku 升級到大模型時,推理的脈絡不會斷。

接下來的戰略意義

入門款的戰場,從價格轉向代理能力。當兩家的入門款都是 0.1/0.5 美元,價格就不再是差異。從比較表來看,真正拉開距離的是電腦操作和終端機代理任務,這也會是接下來各家入門款比拚的重點。

「主管加助手」會變成預設架構。一個成本只有二十分之一、分數有七成五到九成的模型,會讓很多過去「用 LLM 太貴」的工作變得划算:每一封信、每一張工單、每一行日誌都先過一次模型分類或摘要。架構上的問題,會從「要不要用 AI」變成「怎麼分工」。

安全機制一路下放到最小的模型。Haiku 5.5 這次開始有安全分類器:資安防護比 Haiku 4.5 嚴格、比 Sonnet 5.5 寬鬆,滲透測試這類偏攻擊端的請求會被擋。而且 Haiku 5.5 沒有伺服器端的備援(fallback)機制,被拒絕的請求不會自動轉給其他模型。就算是最便宜的批次處理流程,也得開始處理「模型拒答」這種情況。

訂閱和 API 的界線開始模糊。這次同時宣布:Max 5x 訂閱者每月有 100 美元的 API 額度、Max 20x 有 200 美元、Team 方案最多 500 美元共用。Anthropic 顯然想把重度使用者從聊天介面帶到 API 上,自己動手做。

接下來看 Google。Anthropic 這一輪已經全部更新完,OpenAI 的 GPT-6 三層也到齊了;Gemini 4 目前只有 Argon,Pro、Flash 這幾層什麼時候換代、價格落在哪裡,會是下一季入門款市場最大的變數。

對正在導入 AI 的團隊,我們的建議

  1. 還在用 Haiku 4.5 的,值得排時間遷移,但不只是改模型名稱。幾個在 Haiku 4.5 上合法的寫法,在 5.5 會直接回錯誤:自訂 temperature/top_p/top_k、預先填入(prefill)助手回覆、用 budget_tokens指定思考預算。另外思考預設開啟,回應可能以思考區塊開頭,max_tokens 設得很緊的分類流程也可能被思考吃光。

  2. 用自己的流量算帳。用新的 tokenizer 重新計算 token 數,再看有多少請求超過 10 萬 token。官方的「平均便宜 75%」是平均值,你的工作負載可能更好,也可能更差。

  3. 明確指定 effort。預設是 medium,不是跑分常用的 max。在自己的評測集上跑 low、medium、high 三段,挑成本和品質最平衡的那一段。

  4. 重新檢查哪些任務可以往下放。現在交給 Sonnet 的抽取、分類、摘要,值得用 Haiku 5.5 重測一次;長鏈條的代理式寫程式,則先留在 Sonnet 或 Opus。

  5. 處理拒答。檢查回應的 stop_reason,被拒絕時要有自己的備援路徑。

  6. 模型依然放在可替換的位置。Luna 和 Haiku 同價、各有強項,下個月排名還可能換手。換模型應該是改設定、重跑評測,而不是重寫系統。

結語

Haiku 5.5 本身的進步很實在:價格是十分之一,好幾項能力從「做不到」變成「做得到」。但我們覺得更值得記下來的,是它補上的那一塊:Anthropic 的四個等級第一次全部站上同一代,主管和助手可以從同一個家族裡挑。

入門款的角色也變了。它不再只是「便宜版的聊天機器人」,而是代理系統裡負責大量雜務的那一層。接下來拉開差距的,不只是你用了哪個模型,而是你怎麼替它們分工。

如果你的團隊正在規劃多模型架構,或想知道哪些任務適合交給小模型,歡迎到聯絡頁聊聊。

參考資料