TLDR AnthropicはClaude Haiku 5.5を「これまでで最も安価で、最速、そして最も有能な小型モデル」と位置付けています。分類、抽出、ルーティング、要約、サブエージェントなどの高ボリューム・低レイテンシ用途向けに設計され、1ミリオントークンのコンテキストウィンドウ、最大128Kの出力トークン、可変のeffortで調整可能なアダプティブ思考を提供します。
平均して、エージェント的およびコンピュータ利用ベンチマークで大幅な向上を示しつつ、Haiku 4.5の運用コストより約75%低くなります。開発者は公式のClaude API(claude-haiku-5-5)、Amazon Bedrock、Google Cloud、Microsoft Foundry、あるいはCometAPI($0.08 / $0.40から)などのコスト最適化ゲートウェイを通じて利用できます。
重要なポイント
- リリースとポジショニング: 2026年10月7日にClaude 5.5ファミリーの小型・高スループットモデルとしてリリース。リアルタイムサポート、ドキュメント処理、委任されたエージェントのステップに最適。
- 中核仕様: 1Mトークンコンテキスト、最大出力128K(Batch APIベータで300K)、アダプティブ思考(デフォルトはmedium effort)、テキスト+画像入力→テキスト出力、知識カットオフは2026年6月。
- 価格優位: 100Kトークンまでのプロンプトに対して入力$0.10/出力$0.50(多くのリクエストでHaiku 4.5比約90%安価)。100K超は上位ティア。キャッシュ読み取りは$0.01まで低廉。CometAPIは標準レートで約20%低く提供。
- 性能飛躍: Haiku 4.5比で大幅向上(例: OSWorld 72.4% vs 15.7%、Terminal-Bench 39.2% vs 0%、GDPval-AA 1620 vs 735 Elo)。多くのテストでGPT-6 Lunaに対して競争力があるか、先行。
- 開発者向け機能: Effortパラメータ(low〜max)、プロンプトキャッシング、Batch API(50%オフ)、コンピュータ/ブラウザ利用(SDKベータ対応)。temperature/top_p/top_kを含めると400エラー。
Claude Haiku 5.5とは何か、そして2026年になぜ重要か
Claude Haiku 5.5はClaudeファミリーの軽量帯における最新モデルです。複雑な推論や長期的エージェント向けに最適化されたより高価なOpus 5.5やSonnet 5.5とは異なり、Haiku 5.5は高ボリューム、コスト重視、レイテンシ重要なワークロードに特化しています。Anthropicはこれを「これまでにリリースした小型モデルの中で最も安価で、最速、そして最も有能」と説明しています。
代表的なプロダクション用途には次が含まれます:
- カスタマーサポートでのチケット分類とルーティング
- 長文ドキュメントからの項目抽出と要約
- 大型モデル向け会話履歴の圧縮
- データベース型クエリや構造化データ処理
- より強力なモデルがオーケストレーションする中で、限定的なコーディング・ツール利用・ブラウザ操作を担う高速サブエージェント
前世代より劇的に安価かつ高速であり、実用的なエージェントタスクの品質差を大きく縮めたため、多くのチームがパイプラインを再設計し、Haiku 5.5が大半のリクエストを処理して難しいケースのみをSonnetやOpusにエスカレーションする構成に移行しています。Asana、HubSpot、Boxなどからの初期顧客フィードバックでは、レイテンシが30%以上低減し、高ボリュームの内部評価で測定可能な精度向上が示されています。
Claude Haiku 5.5の技術仕様
| 仕様項目 | 値 | 注記 |
|---|---|---|
| モデルID(Claude API) | claude-haiku-5-5 | 日付サフィックスなし |
| Amazon Bedrock | anthropic.claude-haiku-5-5(またはglobal/us/eu/au/jpプロファイル) | |
| コンテキストウィンドウ | 1,000,000トークン | 約555k語(新しいトークナイザー) |
| 最大出力(Messages API) | 128,000トークン | Batch API+ベータヘッダーで300K |
| 入力モダリティ | テキスト+画像 | |
| 出力モダリティ | テキスト | |
| 思考 | アダプティブ(デフォルトでオン) | effortで制御 |
| デフォルトのeffort | medium | オプション: low, medium, high, xhigh, max |
| 知識カットオフ | 2026年6月 | |
| リタイアメントコミットメント | 少なくとも2027年10月7日以前は廃止しない | |
| トークナイザー | 新しい(Claude 4.7+と同系統) | 同じテキストでHaiku 4.5比約30%多いトークン |
出典: Anthropicのモデル概要とプラットフォームドキュメント。
より大きなコンテキストと出力上限に加え、アダプティブ思考の組み合わせにより、Aggressiveな切り捨てや固定思考予算を必要とした従来の小型モデルより、Haiku 5.5は本番システムで遥かに使いやすくなっています。
レスポンスと完了チェック
contentブロックはタイプごとに読み取り、content[0]が可視テキストであると仮定しないでください。出力を受け入れる前にstop_reasonを確認します。max_tokensは生成の切り詰めを示し、refusalはアプリ側の明示的な対応が必要です。ツール対応のリクエストでは、ツール利用ブロックを処理し、完了テキストとして扱うのではなく、ツール結果をネイティブ形式で返してください。
Claude Haiku 5.5 APIはHaiku 4.5から何が変わったか
キャパシティ、挙動、価格の変更
| 次元 | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| コンテキストウィンドウ | 200K | 1M | 1M |
| 最大出力 | 64K | 128K | 128K |
| アダプティブeffort | なし | あり | あり |
| Anthropic入力/MTok | $1.00 | $0.10 | $2.00 |
| Anthropic出力/MTok | $5.00 | $0.50 | $10.00 |
| ポジショニング | レガシー高速モデル | スケールでの日常業務 | より困難な複雑タスク |
上記のHaiku 5.5価格は、100,000トークンまでのプロンプトに適用されます。より長いプロンプトは高いティアとなります。これらはAnthropic標準レートであり、CometAPIレートではありません。この比較はルーティングの出発点であり、各モデルの性能が同一であるという主張ではありません。
Haiku 4.5の統合における主な実装変更は、手動の思考予算からアダプティブ思考への置換、effort制御、コンテンツブロックの選択的パース、そして更新されたトークン数です。同一テキストでも約30%多くの入力トークンを消費する可能性があります。Haiku 4.5のトークン見積もりを使い回さず、代表的なプロンプトを再カウントしてください。移行セクションでは、これらの変更をデプロイ用チェックリストに落とし込みます。
報告されたベンチマーク改善
| ベンチマーク | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| OSWorld 2.1(オフラインサブセット;部分点) | 15.7% | 72.4% | 83.9% |
| Terminal-Bench 4.0 | 0.0% | 39.2% | 70.6% |
| Humanity’s Last Exam(ツールなし) | 10.2% | 45.9% | 56.9% |
| Chartography(ツールなし) | 6.4% | 46.4% | 61.6% |
| GDPval-AA v2.1(Elo) | 735 | 1,620 | 1,840 |
Anthropicは上記スコアをローンチベンチマークサマリーで報告しています。これは評価結果の報告であり、このガイドにあるCometAPIのサンプルをライブでテストしたものではありません。OSWorldの72.4%は部分点であり、厳密なタスク完了率ではありません。
Haiku 5.5のシステムカードは評価条件を説明しています。標準のHaiku 5.5評価では、特記がない限りアダプティブ思考のmax effortとデフォルトサンプリングを使用します。製品のデフォルトはmediumです。OSWorldは82のオフラインタスク、インターネット未使用、1080p解像度、500アクション上限で実行されます。Terminal-Bench 4.0はClaude Codeをベアモード、インターネットエグレスなし、Haiku 5.5ではタスクごとに10トライアルで使用します。Sonnetの設定は異なります。HLEとChartographyはツールなしです。GDPval-AAはArtificial Analysis評価のEloレーティングを報告します。比較時は関連するハーネス、effort、ツール設定を一致させてください。

AnthropicのオリジナルのOSWorldグラフィックは、effort、タスクごとのコスト、部分点スコアの関係を示しています。APIレイテンシを測定するものではなく、あなたのワークロードで同じ性能を保証するものでもありません。
これらのスコアは、Haiku 4.5よりはるかに強力なコンピュータ利用と一般タスク性能を示しますが、あなたのアプリケーションで同じ結果を保証するものではありません。プロダクション投入前に代表的な評価セットを実施してください。
ベンチマーク表と提供グラフィックはモデル比較として保持されています。これは報告された評価であり、このガイドのCometAPI例のライブテストではありません。アプリケーションの評価では、同じタスク分布、effort、ツール設定を使用してください。ベンチマークスコアはゲートウェイのレイテンシやあなた自身の成功率を確立するものではありません。
CometAPI経由でClaude Haiku 5.5 APIを使う方法
キーを作成し、ネイティブルートを選択する
CometAPIアカウントを作成し、claude-haiku-5-5へのアクセスを確認してサーバーサイドAPIキーを生成します。環境変数COMETAPI_KEYを設定します。キーはソース管理やブラウザコードの外に保管してください。AnthropicのキーとCometAPIのキーは別プロバイダーのものです。この改訂ガイドのすべての例ではCometAPIのキーを使用してください。
export COMETAPI_KEY="your_cometapi_api_key"
pip install --upgrade anthropic
$env:COMETAPI_KEY="your_cometapi_api_key"
| 統合 | SDKベースURL | リクエストパス | 資格情報 |
|---|---|---|---|
| Anthropic互換のMessages | https://api.cometapi.com | /v1/messages | COMETAPI_KEY |
| OpenAI互換のChat Completions | https://api.cometapi.com/v1 | /chat/completions | COMETAPI_KEY |
CometAPIはClaudeのネイティブMessagesとコンテンツブロック形式をサポートします。 CometAPIのルートベースURLでAnthropic SDKを使用してください。本ガイドではClaude固有のthinkingとコンテンツブロックのため、ネイティブMessagesが推奨ルートです。既存のOpenAIスタイルのアプリケーションには互換のChat Completionsルートも選択可能です。高度なフィールドのサポートは、実際のゲートウェイルートで確認してください。
最小リクエストを送信し、結果を検証する
curl https://api.cometapi.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $COMETAPI_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 2048,
"output_config": {"effort": "low"},
"messages": [{"role": "user", "content": "Summarize three AI uses in customer support."}]
}'
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com",
timeout=60.0,
max_retries=2,
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{"role": "user", "content": "Classify this ticket: I cannot log in."}],
)
if response.stop_reason != "end_turn":
raise RuntimeError(f"Unaccepted completion: {response.stop_reason}")
print("".join(block.text for block in response.content if block.type == "text"))
print(response.usage)
Pythonの例をexample.pyとして保存し、python example.pyを実行します。成功チェックポイントは、可視テキストとusageフィールドを含む完了レスポンスです。認証エラーはキーの確認が必要であり、モデル/ルートのエラーはモデルID、エンドポイント、またはアカウントアクセスの確認が必要です。
JavaScriptでも同じネイティブ形式を使う
npm install @anthropic-ai/sdk
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
apiKey: process.env.COMETAPI_KEY,
baseURL: "https://api.cometapi.com",
timeout: 60_000,
maxRetries: 2,
});
const response = await client.messages.create({
model: "claude-haiku-5-5",
max_tokens: 2048,
output_config: {effort: "low"},
messages: [{role: "user", content: "Extract product, quantity and price: 3 laptops at $900 each."}],
});
if (response.stop_reason !== "end_turn") {
throw new Error("Unaccepted completion: " + response.stop_reason);
}
for (const block of response.content) {
if (block.type === "text") console.log(block.text);
}
サポート対象のNode.jsリリースを使用してください。ファイルをexample.mjsとして保存し、COMETAPI_KEYを設定してnode example.mjsを実行します。デプロイに向けて検証したSDKバージョンを記録します。
既存のOpenAI互換アプリケーションを適応させる
すでにChat Completionsを使用しているアプリケーションでは、openaiパッケージをインストールし、下記の別クライアントを構成してください。このルートはネイティブのコンテンツブロックではなくchoicesを返します。思考、画像、ツールをゲートウェイ翻訳に頼る前に、ルート特有のパースを分離し、テストしてください。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="claude-haiku-5-5",
max_tokens=2048,
messages=[
{"role": "system", "content": "Be concise and helpful."},
{"role": "user", "content": "Explain API rate limits."},
],
)
print(response.choices[0].message.content)
Claude Haiku 5.5 APIに画像を送信する
画像とともに、必要な根拠と出力を指定する指示を使用してください。公式のビジョンインターフェースは、base64データ、画像URL、またはサポートされるアップロードファイル参照を含む画像コンテンツブロックを受け付けます。この例ではローカルのPNGを読み込み、質問の前に画像を配置し、元データに照らして検証可能な値を求めています。
ネイティブのAnthropic Messages APIで実際のローカルPNGを解析します。
import os
import base64
from pathlib import Path
import anthropic
# Replace dashboard.png with a real PNG file you are authorized to analyze.
image_data = base64.b64encode(Path("dashboard.png").read_bytes()).decode("ascii")
anthropic_client = anthropic.Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
response = anthropic_client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": [
{"type": "image", "source": {
"type": "base64", "media_type": "image/png", "data": image_data
}},
{"type": "text", "text": (
"Read the visible dashboard metrics. List anomalies with their "
"labels and values, and state when text is unreadable."
)},
],
}],
)
for block in response.content:
if block.type == "text":
print(block.text)
実際のファイルに合致するMIMEタイプを使用してください。送信前に可読性、画像サイズ、リクエストサイズ上限を確認し、タスクに役立たない高解像度メディアの送信は避けてください。CometAPIを使う場合は、Messagesの例で示したキーとルートベースURLに変更し、利用する正確なルートで画像のサポートを検証してください。
Claude Haiku 5.5の推論制御
Haiku 5.5はデフォルトでアダプティブ思考を使用します。公式のthinking構成は、disabledが受け付けられる条件とthinkingブロックが返される方法を説明します。effortはoutput_config.effortで設定し、レガシーのbudget_tokensは再利用しないでください。
| Effort | 良い開始ユースケース | トレードオフ |
|---|---|---|
| low | 短い分類、単純な抽出 | トークン使用とレイテンシが一般に低い |
| medium | サポート応答、日常的なエージェント作業 | バランスの取れたデフォルト |
| high | 複数ステップの文書分析 | より多くの推論を行う可能性 |
| xhigh | 困難な評価 | さらなる処理とコスト |
| max | 推論集中型のケース | 最高の推論支出の可能性 |
low effortでアダプティブ思考を構成します。
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)response = anthropic_client.messages.create( model="claude-haiku-5-5", max_tokens=4096, thinking={"type": "adaptive"}, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Classify as billing, technical, or account: cannot log in."}],)for block in response.content: if block.type == "text": print(block.text)
開発者はlow、medium、highのeffortではthinkingを無効化できますが、xhighやmaxでは無効化できません。thinkingは、テキストが非表示でも課金される出力トークンおよびmax_tokensの予算を消費します。空のthinkingフィールドでもシグネチャを含む場合があり、推論が行われなかった証拠にはなりません。ツール会話を継続する際は、返されたコンテンツブロックを変更せずに保持してください。
thinkingを無効化したリクエスト例
thinkingを無効化したネイティブリクエスト本文を送信します。
{ "model": "claude-haiku-5-5", "max_tokens": 1024, "thinking": {"type": "disabled"}, "output_config": {"effort": "low"}, "messages": [ {"role": "user", "content": "Return sentiment only: positive, neutral, negative."} ]}
Claude Haiku 5.5のレスポンスをストリーミング
ストリーミングは可視テキストを逐次的に配信し、インタラクティブなアプリケーションの応答性を高めます。ストリーミングされたテキストは、リクエストが正常に完了するまで暫定的なものとして扱ってください。
Anthropic Python SDKで可視テキストをストリーミングします。
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)with anthropic_client.messages.stream( model="claude-haiku-5-5", max_tokens=4096, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Explain API caching."}],) as stream: for text in stream.text_stream: print(text, end="", flush=True)
Claude Haiku 5.5 APIの価格
トークンレートとプロンプト長バンドの比較
レートは2026年10月8日に確認。表はAnthropic標準価格と公開されたCometAPIレートを、ミリオントークン当たりのUSDで比較します。バンドはプロンプト長で決まり、100,000トークン以下と100,000トークン超に分かれます。長いリクエストでは該当する上位バンドのレートが適用され、超過トークンへの単なるサーチャージではありません。アカウントの課金、キャッシュ使用、およびオプションツールは別途整合が必要です。
| トークンカテゴリー | Anthropic ≤100K | CometAPI ≤100K | Anthropic >100K | CometAPI >100K |
|---|---|---|---|---|
| 入力 | $0.10 | $0.08 | $0.50 | $0.40 |
| 出力 | $0.50 | $0.40 | $2.50 | $2.00 |
| キャッシュ読み取り | $0.01 | $0.008 | $0.05 | $0.04 |
| 5分キャッシュ書き込み | $0.125 | $0.10 | $0.625 | $0.50 |
| 1時間キャッシュ書き込み | $0.20 | $0.16 | $1.00 | $0.80 |
原記事のレートスナップショットを上記に保持しています。現在のCometAPIリスティングとアカウントの課金を購入・導入前に確認してください。リスティングの開始入力レートは、すべてのプロンプト長バンド、キャッシュ操作、オプションツールに対する完全な見積もりではありません。
例: 100,000件のサポートリクエストのコスト
月間100,000件のリクエストを想定し、各リクエストが2,000入力トークンと300の課金対象出力トークン(生成されたthinkingを含む)を使用するものとします。すべてのプロンプトが100K以下のバンドに該当します。キャッシング、ツール料金、リトライは除外します。
| コンポーネント | 使用量 | Anthropic | CometAPI |
|---|---|---|---|
| 入力 | 200Mトークン | $20.00 | $16.00 |
| 出力 | 30Mトークン | $15.00 | $12.00 |
| 合計 | 100,000リクエスト | $35.00 | $28.00 |
この仮定では、差は月額$7、つまり20%です。実際のコストはリクエスト長、非表示の推論、キャッシング、リトライ挙動に依存します。
計算ではモデルの現在のトークン数を使用してください。コスト=入力トークン×該当する入力レート/1,000,000+課金対象出力トークン×該当する出力レート/1,000,000+別途適用されるキャッシュ、ツール、リトライの料金。thinkingトークンは課金対象出力の一部です。
受理タスク品質を損なわずにコストを下げる
| 最適化 | アクション | 便益 |
|---|---|---|
| effort調整 | 品質が許す範囲でlowを使用 | 推論オーバーヘッドの低減 |
| プロンプト削減 | 冗長な会話履歴を削除 | 入力トークンの削減 |
| プロンプトキャッシュ | 再利用するコンテキストを安定化 | 繰り返し入力コストの低減 |
| ストリーミング | トークンを到着順にレンダリング | 体感応答性の向上 |
| スキーマ検証 | 不正なレコードを早期に拒否 | 下流の手戻りの削減 |
| モデルルーティング | 複雑なタスクをエスカレーション | コストと品質のバランス改善 |
| バッチ処理 | オフラインでバッチ可能なリクエストを集約 | 追加の節約の可能性 |
自動的に最も低いeffortを選ばないでください。個々の呼び出しが安くても、リトライが増えれば総コストが増える可能性があります。精度、p50/p95レイテンシ、トークン使用、成功タスク当たりコストを評価してください。
プロンプトキャッシングでは、安定したプレフィックスを再利用し、キャッシュ作成とキャッシュ読み取りの使用量を確認してヒットを仮定しないでください。Claude APIのドキュメントでは、Haiku 5.5のキャッシュ可能なプロンプトは最小512トークンです。effortの変更はキャッシュ済みプレフィックスを無効化する可能性があります。会話内では設定を安定させてください。1Mのコンテキストウィンドウは容量上限であり、毎ターンにすべての文書を送る推奨ではありません。
キャッシュ可能な安定プレフィックスを維持し、不要な入力を短縮し、effort変更をベンチマークしてください。ストリーミングは体感応答性を改善しますが、課金使用量を自動的に減らすものではありません。リトライやツール呼び出しも含む全体ワークフローで、受理タスク当たりコストを比較してください。
Claude Haiku 4.5からHaiku 5.5への移行ガイド
統合とリクエスト形式を更新する
| 項目 | 移行アクション |
|---|---|
| モデルID | claude-haiku-5-5に置換 |
| thinking | 手動のbudget_tokensからアダプティブ思考に置換 |
| effort | 必要に応じてoutput_config.effortを使用 |
| サンプリング | temperature、top_p、top_kを省略(top_kは非対応) |
| レスポンスパーサー | 複数のコンテンツブロックタイプを処理 |
| 出力予算 | 推論と最終出力に十分な余裕を確保 |
| プレフィル | 非対応のassistantプレフィルを削除 |
| キャッシング | effort変更時にプロンプトを再テスト |
| ツール統合 | サポートされるツールバージョンを検証 |
本ガイドで使用するCometAPIルートでは、モデルIDとリクエスト設定を変更しつつ、COMETAPI_KEYとネイティブベースURLは維持してください。レガシーのenabled thinkingと予算は、アダプティブ思考とeffortに置換します。assistantプレフィルを削除し、サンプリングパラメータは省略します。Claudeのネイティブのcontent配列と、互換ルートのchoicesレスポンスの区別を保持してください。
状態を保持し、予算を再計算する
公式のHaiku 5.5移行ガイドでは、同一テキストでもHaiku 4.5比で入力トークンが約30%増えると報告しています。代表的なプロンプトを再カウントし、トラフィック移行前に上限を再調整してください。返されたthinkingブロックは、それを生成したアカウントまたはリンクされたアカウントでのみ機能します。アカウント変更により、これらのブロックが暗黙に失われる可能性があります。生成後に以前のメッセージを改変せず、追記専用の会話プレフィックスを保持してください。stop_reason(max_tokensやrefusalを含む)を検査し、出力を受け入れる前に明示的に処理してください。
対象モデルで代表的なプロンプトを再カウントし、max_tokens、レイテンシ制限、リクエストコスト見積もりを再調整してください。保存済み会話は、再生するアカウントとゲートウェイルートでテストし、署名付きthinkingブロックが無関係なアカウントや書き換えられた会話プレフィックス間で移植可能だと仮定しないでください。
結論
Claude Haiku 5.5は、コスト効率の高い高スループットAIにおける真の転換点です。大半のリクエストで前世代Haikuの約10分の1の価格を実現しつつ、エージェント的・コンピュータ利用性能を劇的に向上させることで、有能な小型モデルの大規模導入を現実的なものにしました。公式APIを呼び出す場合でも、Amazon Bedrockを経由する場合でも、CometAPIのような統合ゲートウェイを活用してさらに節約と運用の簡素化を図る場合でも、速度、能力、価格の組み合わせは、これまで経済的に難しかった新たなプロダクト可能性を開きます。
