TLDR Claude Haiku 5.5 被稱為其有史以來最便宜、最快、最強大的小型模型。為分類、擷取、路由、摘要與子代理等高量、對延遲敏感的工作負載而設計,提供 100 萬 token 的上下文視窗、最高 128K 的輸出 token,以及具可調整努力等級的自適應思考。
平均而言,其運行成本比 Haiku 4.5 低約 75%,同時在代理與電腦操作等基準上有大幅提升。開發者可透過官方 Claude API(claude-haiku-5-5)、Amazon Bedrock、Google Cloud、Microsoft Foundry,或 CometAPI 等成本優化閘道(起價 $0.08 / $0.40)存取。
Key Takeaways
- Release & Positioning: 於 2026 年 10 月 7 日推出,屬於 Claude 5.5 家族中的小型高吞吐模型——非常適合即時支援、文件處理與委派的代理步驟。
- Core Specs: 1M-token 上下文、128K 最大輸出(透過 Batch API beta 可達 300K)、自適應思考(預設 medium 努力)、文字 + 圖像輸入 → 文字輸出、知識截斷至 2026 年 6 月。
- Pricing Advantage: 對於不超過 100K 的提示,輸入 $0.10 / 百萬 token、輸出 $0.50 / 百萬 token(在多數請求上較 Haiku 4.5 約便宜 90%);超過 100K 的提示採用更高級距。快取讀取最低 $0.01。CometAPI 提供約低 20% 的 Standard 費率。
- Performance Leap: 相較 Haiku 4.5 有重大提升(例如 OSWorld 72.4% vs 15.7%,Terminal-Bench 39.2% vs 0%,GDPval-AA 1620 vs 735 Elo),並在多項測試上保持與 GPT-6 Luna 競爭甚至領先。
- Developer Features: Effort 參數(
low–max)、提示快取、Batch API(五折)、電腦/瀏覽器使用(beta SDK 支援)。必須省略 temperature/top_p/top_k,否則會發生 400 錯誤。
What Is Claude Haiku 5.5 and Why It Matters in 2026
Claude Haiku 5.5 是 Anthropic 最新的 Claude 家族輕量級模型。不同於為複雜推理與長期代理優化且成本更高的 Opus 5.5 與 Sonnet 5.5,Haiku 5.5 專為高量、成本敏感與延遲關鍵的工作負載而生。Anthropic 形容它是「我們有史以來最便宜、最快、最強大的小型模型」。
典型生產用例如下:
- 客戶支援中的工單分類與路由
- 從長篇文件中抽取欄位與摘要
- 為更大型模型壓縮對話歷史
- 類資料庫的查詢與結構化資料任務
- 由更強模型協調時,處理狹窄編碼、工具使用或瀏覽器步驟的快速子代理
由於其相較前代在成本與速度上大幅改善,同時在實務代理任務上縮小品質差距,許多團隊正在重新設計流程,使 Haiku 5.5 處理多數請求,僅在困難案例時升級至 Sonnet 或 Opus。來自 Asana、HubSpot、Box 等的早期客戶回饋指出,延遲降低超過 30%,且在高量內部評測中可測得準確度提升。
Technical Specifications of Claude Haiku 5.5
| Specification | Value | Notes |
|---|---|---|
| Model ID (Claude API) | claude-haiku-5-5 | 無日期後綴 |
| Amazon Bedrock | anthropic.claude-haiku-5-5 (或 global/us/eu/au/jp profiles) | |
| Context window | 1,000,000 tokens | 以新分詞器計算約 555k 字 |
| Max output (Messages API) | 128,000 tokens | 透過 Batch API + beta 標頭可達 300K |
| Input modalities | Text + images | |
| Output modality | Text | |
| Thinking | Adaptive(預設開啟) | 透過 effort 控制 |
| Default effort | medium | 選項:low、medium、high、xhigh、max |
| Knowledge cutoff | June 2026 | |
| Retirement commitment | Not before October 7, 2027 | |
| Tokenizer | Newer(與 Claude 4.7+ 同系列) | 相同文字比 Haiku 4.5 約多 30% tokens |
更大的上下文與輸出上限,加上自適應思考,使 Haiku 5.5 相較先前需要激進截斷或固定思考預算的小型模型,更適合實際生產系統。
Responses and completion checks
請按類型讀取內容區塊,而非假設 content[0] 就是可見答案。在接受輸出前檢查 stop_reason:max_tokens 表示生成遭截斷;拒絕則需要明確的應用層回應。對於啟用工具的請求,請處理工具使用區塊,並以原生格式返回工具結果,而非將其視為已完成的文字答案。
What Changed Compared With Claude Haiku 4.5 API?
Capacity, behavior and pricing changes
| Dimension | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| Context window | 200K | 1M | 1M |
| Maximum output | 64K | 128K | 128K |
| Adaptive effort | No | Yes | Yes |
| Anthropic input / MTok | $1.00 | $0.10 | $2.00 |
| Anthropic output / MTok | $5.00 | $0.50 | $10.00 |
| Positioning | Legacy fast model | Routine work at scale | Harder complex tasks |
上述比較的 Haiku 5.5 價格適用於不超過 100,000 tokens 的提示;更長提示的費率更高。這些是 Anthropic Standard 費率,非 CometAPI 費率。該比較是路由的起點,並非聲稱模型在所有方面表現相同。
對於 Haiku 4.5 的整合,關鍵實作變更包含:以自適應思考取代手動預算、提供 effort 控制、選擇性解析內容區塊,以及更新 token 計數。相同文字大約會使用多約 30% 的輸入 tokens。請重新計算具代表性的提示,而非沿用 Haiku 4.5 的 token 預估。遷移章節將這些變更整理為部署檢查清單。
Reported benchmark improvements
| Benchmark | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| OSWorld 2.1 (offline subset; partial credit) | 15.7% | 72.4% | 83.9% |
| Terminal-Bench 4.0 | 0.0% | 39.2% | 70.6% |
| Humanity’s Last Exam (no tools) | 10.2% | 45.9% | 56.9% |
| Chartography (no tools) | 6.4% | 46.4% | 61.6% |
| GDPval-AA v2.1 (Elo) | 735 | 1,620 | 1,840 |
Anthropic 在其發佈基準摘要中報告了上述分數。這些是評估結果,而非本指南中 CometAPI 範例的即時測試。OSWorld 的 72.4% 為部分得分,而非嚴格的任務完成率。
Haiku 5.5 系統卡描述了評估條件。標準 Haiku 5.5 評測在未特別註明時使用自適應思考、max effort 與預設取樣;產品預設為 medium。OSWorld 使用 82 項離線任務、無網路存取、1080p 解析度與 500 次動作上限。Terminal-Bench 4.0 對 Haiku 5.5 使用 Claude Code 的裸模式、無網路出口、每任務 10 次試驗;Sonnet 的設定不同。HLE 與 Chartography 上述結果為無工具設定。GDPval-AA 報告來自 Artificial Analysis 評估的 Elo。比較結果時,請匹配相同的測試框架、effort 以及工具設定。

Anthropic 的原始 OSWorld 圖表顯示了 effort、每任務成本與部分得分之間的關係。它不衡量 API 延遲,也不保證在你的工作負載上能有相同表現。
這些分數顯示其電腦操作與一般任務能力遠強於 Haiku 4.5,但不保證在你的應用中取得相同結果。請在投入生產流量前,先運行具有代表性的評估集。
上述基準表與所附圖表保留作為模型比較。它們是報告的評估,而非 CometAPI 範例的即時測試。在評估應用時,請使用相同的任務分佈、effort 與工具設定;基準分數並不能代表閘道延遲或你的實際成功率。
How to Use Claude Haiku 5.5 API Through CometAPI
Create a key and choose the native route
建立 CometAPI 帳號,確認對 claude-haiku-5-5 的存取權,並產生伺服端 API 金鑰。於環境中設定 COMETAPI_KEY。請將金鑰置於版本控制與瀏覽器程式碼之外。Anthropic 與 CometAPI 的金鑰屬於不同供應商;本修訂指南中的每個範例均須使用 CometAPI 金鑰。
export COMETAPI_KEY="your_cometapi_api_key"
pip install --upgrade anthropic
$env:COMETAPI_KEY="your_cometapi_api_key"
| Integration | SDK base URL | Request path | Credential |
|---|---|---|---|
| Anthropic-compatible Messages | https://api.cometapi.com | /v1/messages | COMETAPI_KEY |
| OpenAI-compatible Chat Completions | https://api.cometapi.com/v1 | /chat/completions | COMETAPI_KEY |
CometAPI 支援 Claude 的原生 Messages 與 content-block 格式。 以 CometAPI 根 base URL 使用 Anthropic SDK。對於 Claude 特有的思考與內容區塊,本指南偏好使用原生 Messages。若已有 OpenAI 風格的應用,可選擇相容的 Chat Completions 路由。請在實際使用的閘道路由上確認進階欄位支援情況。
Send a minimal request and verify the result
curl https://api.cometapi.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $COMETAPI_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 2048,
"output_config": {"effort": "low"},
"messages": [{"role": "user", "content": "Summarize three AI uses in customer support."}]
}'
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com",
timeout=60.0,
max_retries=2,
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{"role": "user", "content": "Classify this ticket: I cannot log in."}],
)
if response.stop_reason != "end_turn":
raise RuntimeError(f"Unaccepted completion: {response.stop_reason}")
print("".join(block.text for block in response.content if block.type == "text"))
print(response.usage)
將 Python 範例儲存為 example.py 並執行 python example.py。成功檢查點為:回應完成,且包含可見文字與 usage 欄位。若為驗證失敗,表示金鑰需要檢查;若為模型/路由錯誤,表示需要檢查模型 ID、端點或帳號存取。
Use the same native format from JavaScript
npm install @anthropic-ai/sdk
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
apiKey: process.env.COMETAPI_KEY,
baseURL: "https://api.cometapi.com",
timeout: 60_000,
maxRetries: 2,
});
const response = await client.messages.create({
model: "claude-haiku-5-5",
max_tokens: 2048,
output_config: {effort: "low"},
messages: [{role: "user", content: "Extract product, quantity and price: 3 laptops at $900 each."}],
});
if (response.stop_reason !== "end_turn") {
throw new Error("Unaccepted completion: " + response.stop_reason);
}
for (const block of response.content) {
if (block.type === "text") console.log(block.text);
}
請使用受支援的 Node.js 版本。將檔案儲存為 example.mjs,設定 COMETAPI_KEY 並執行 node example.mjs。記錄你驗證用於部署的 SDK 版本。
Adapt an existing OpenAI-compatible application
若你的應用已使用 Chat Completions,請安裝 openai 套件並配置下方分離的用戶端。此路由返回 choices,而非原生的內容區塊。請將特定路由的解析邏輯分離,並在依賴閘道轉譯前,先測試思考、圖像與工具支援。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="claude-haiku-5-5",
max_tokens=2048,
messages=[
{"role": "system", "content": "Be concise and helpful."},
{"role": "user", "content": "Explain API rate limits."},
],
)
print(response.choices[0].message.content)
Sending images to Claude Haiku 5.5 API
請將圖像與指示一併傳送,並明確指定所需的證據與輸出。官方視覺介面 接受以 base64 資料、圖像 URL 或受支援的上傳檔案參考所提供的圖像內容區塊。此範例讀取本地 PNG,將圖像置於問題之前,並要求能夠對照原始資料檢查的數值。
透過原生 Anthropic Messages API 分析一個真實的本地 PNG。
import os
import base64
from pathlib import Path
import anthropic
# Replace dashboard.png with a real PNG file you are authorized to analyze.
image_data = base64.b64encode(Path("dashboard.png").read_bytes()).decode("ascii")
anthropic_client = anthropic.Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
response = anthropic_client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": [
{"type": "image", "source": {
"type": "base64", "media_type": "image/png", "data": image_data
}},
{"type": "text", "text": (
"Read the visible dashboard metrics. List anomalies with their "
"labels and values, and state when text is unreadable."
)},
],
}],
)
for block in response.content:
if block.type == "text":
print(block.text)
請使用與實際檔案相符的 MIME 類型。提交前檢查可讀性、圖像尺寸與請求大小限制;避免傳送對任務無助的高解析媒體。若使用 CometAPI,請如其 Messages 範例所示更換金鑰與根 base URL,並於實際路由上驗證圖像支援。
Controlling Claude Haiku 5.5 reasoning
Haiku 5.5 預設使用自適應思考。官方思考配置 說明了何時允許停用,以及如何返回思考區塊。請透過 output_config.effort 設定 effort;不要重用舊版的 budget_tokens。
| Effort | Good starting use case | Trade-off |
|---|---|---|
| low | 短分類、簡單擷取 | 通常更低的 token 使用與延遲 |
| medium | 支援回覆、常規代理工作 | 平衡的預設 |
| high | 多步驟文件分析 | 潛在更強的推理 |
| xhigh | 困難的評測 | 更多處理與成本 |
| max | 高推理強度情境 | 最高潛在推理開銷 |
以低 effort 配置自適應思考。
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)response = anthropic_client.messages.create( model="claude-haiku-5-5", max_tokens=4096, thinking={"type": "adaptive"}, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Classify as billing, technical, or account: cannot log in."}],)for block in response.content: if block.type == "text": print(block.text)
開發者可在 low、medium 與 high 努力下停用思考,但無法在 xhigh 或 max 停用。即使思考文字被隱藏,思考仍會消耗計費的輸出 tokens 與 max_tokens 預算。空的思考欄位仍可能帶有簽章;它不代表沒有發生任何推理。在延續工具對話時,請保持返回的內容區塊不變。
Example request with thinking disabled
以停用思考的原生請求本文進行傳送。
{ "model": "claude-haiku-5-5", "max_tokens": 1024, "thinking": {"type": "disabled"}, "output_config": {"effort": "low"}, "messages": [ {"role": "user", "content": "Return sentiment only: positive, neutral, negative."} ]}
Streaming Claude Haiku 5.5 responses
串流可逐步傳送可見文字,並在互動式應用中改善回應體驗。在請求成功完成前,請將串流文字視為暫定內容。
使用 Anthropic Python SDK 串流可見文字。
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)with anthropic_client.messages.stream( model="claude-haiku-5-5", max_tokens=4096, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Explain API caching."}],) as stream: for text in stream.text_stream: print(text, end="", flush=True)
Claude Haiku 5.5 API Pricing
Compare token rates and prompt-length bands
費率查於 2026 年 10 月 8 日。下表以每百萬 tokens 的美元價格比較 Anthropic Standard 定價 與 已公布的 CometAPI 費率。級距由提示長度決定:不超過 100,000 tokens 與超過 100,000 tokens。較長請求使用對應的高級距費率,而非僅對超出部分加收。帳務、快取使用與可選工具需另行核對。
| Token category | Anthropic ≤100K | CometAPI ≤100K | Anthropic >100K | CometAPI >100K |
|---|---|---|---|---|
| Input | $0.10 | $0.08 | $0.50 | $0.40 |
| Output | $0.50 | $0.40 | $2.50 | $2.00 |
| Cache read | $0.01 | $0.008 | $0.05 | $0.04 |
| 5-min cache write | $0.125 | $0.10 | $0.625 | $0.50 |
| 1-hour cache write | $0.20 | $0.16 | $1.00 | $0.80 |
以上為原文文章的費率快照。購買或部署前,請檢查最新 CometAPI 列表與帳戶計費;該列表中的起始輸入費率並非涵蓋所有提示級距、快取操作或可選工具的完整報價。
Example: Cost of 100,000 support requests
假設每月 100,000 次請求,每次包含 2,000 個輸入 tokens 與 300 個計費輸出 tokens,含任意生成的思考。每個提示均屬於不超過 100K 的級距。不含快取、工具費與重試。
| Component | Usage | Anthropic | CometAPI |
|---|---|---|---|
| Input | 200M tokens | $20.00 | $16.00 |
| Output | 30M tokens | $15.00 | $12.00 |
| Total | 100,000 requests | $35.00 | $28.00 |
在此假設下,差額為每月 $7,即 20%。實際生產成本取決於請求長度、隱藏思考、快取與重試行為。
請使用目標模型的當前 token 計數進行計算。成本 = 輸入 tokens × 適用輸入費率 / 1,000,000 + 計費輸出 tokens × 適用輸出費率 / 1,000,000,另加可適用的快取、工具與重試費用。思考 tokens 屬於計費輸出的一部分。
Reduce cost without losing accepted-task quality
| Optimization | Action | Benefit |
|---|---|---|
| Effort tuning | 在品質允許下使用 low | 降低推理開銷 |
| Prompt reduction | 移除多餘的對話歷史 | 減少輸入 tokens |
| Prompt caching | 保持可重用的穩定前綴 | 降低重複輸入成本 |
| Streaming | 以到達即渲染的方式呈現 tokens | 改善感知回應速度 |
| Schema validation | 及早拒絕不合規紀錄 | 減少下游返工 |
| Model routing | 將複雜任務升級路由 | 更佳的成本-品質平衡 |
| Batch processing | 對可離線批次的請求使用 Batch | 可能取得額外節省 |
不要自動選擇最低 effort。單次呼叫雖然較便宜,但若導致更多重試,總成本可能提高。請評估準確度、p50/p95 延遲、token 使用與每個成功任務的成本。
關於提示快取,請重用穩定前綴,並檢視快取建立與快取讀取的使用狀況,而非假設命中。Haiku 5.5 在文件化的 Claude API 上,快取的最低可快取提示為 512 tokens。變更 effort 可能使快取前綴失效;請在對話內保持設定穩定。1M 的上下文視窗是容量上限,而非建議每次都傳送所有文件。
請維持可重用的穩定前綴以利快取,縮短不必要的輸入,並評測 effort 的變更。串流改善的是感知回應速度,並不會自動降低計費用量。請在完整流程中比較每個成功任務的成本,包括重試與工具呼叫。
Claude Haiku 4.5 to Haiku 5.5 Migration Guide
Update the integration and request format
| Area | Migration action |
|---|---|
| Model ID | 換成 claude-haiku-5-5 |
| Thinking | 以自適應思考取代手動 budget_tokens |
| Effort | 需要時使用 output_config.effort |
| Sampling | 省略 temperature、top_p 與 top_k;任何 top_k 值都不支援 |
| Response parser | 處理多種內容區塊類型 |
| Output budget | 預留足夠空間給思考與最終輸出 |
| Prefill | 移除不支援的 assistant 預填 |
| Caching | 變更 effort 時重新測試提示 |
| Tool integrations | 驗證支援的工具版本 |
對於此處使用的 CometAPI 路由,保留 COMETAPI_KEY 與原生 base URL,同時變更模型 ID 與請求配置。將過去以預算啟用思考的方式改為自適應思考與 effort。移除 assistant 預填,並省略取樣參數。保持 Claude 原生內容陣列與相容路由 choices 回應的差異。
Preserve state and recalculate budgets
官方 Haiku 5.5 遷移指南 指出,相同文字的輸入 tokens 約比 Haiku 4.5 多 30%。請重新計數具代表性的提示,並在導流前調整限制。返回的思考區塊僅適用於產生它們的帳號或已連結帳號;帳號變更可能使這些區塊被靜默丟棄。請以追加方式保留對話前綴,而非在生成後修改較早的訊息。檢查 stop_reason,包括 max_tokens 與拒絕,並在接受輸出前明確處理。
請以目標模型重新計數具代表性的提示,並調整 max_tokens、延遲限制與請求成本預估。將儲存的對話在將要重放的帳號與閘道路由上進行測試;不要假設帶簽章的思考區塊可在不相關的帳號或被改寫的對話前綴中可攜。
Conclusion
Claude Haiku 5.5 代表了成本效率與高吞吐 AI 的真正拐點。藉由在多數請求上,以大約過往 Haiku 一成的價格提供顯著更佳的代理與電腦操作表現,Anthropic 讓能幹的小型模型大規模部署變得切實可行。無論你直接呼叫官方 API、透過 Amazon Bedrock 路由,或使用如 CometAPI 這類提供進一步節省與營運簡化的統一路由,速度、能力與價格的結合開啟了先前不具經濟可行性的全新產品可能性。
