TLDR Claude Haiku 5.5 được gọi là mẫu nhỏ rẻ nhất, nhanh nhất và mạnh nhất mà họ từng phát hành. Được thiết kế cho khối lượng lớn, nhạy cảm độ trễ như phân loại, trích xuất, định tuyến, tóm tắt và các tác vụ subagent, nó cung cấp cửa sổ ngữ cảnh 1 triệu token, tối đa 128K token đầu ra, tư duy thích ứng với mức effort có thể điều chỉnh.
Trung bình, chi phí vận hành thấp hơn khoảng 75% so với Haiku 4.5 trong khi đạt được mức tăng lớn trên các benchmark về agent và sử dụng máy tính. Nhà phát triển có thể truy cập qua Claude API chính thức (claude-haiku-5-5), Amazon Bedrock, Google Cloud, Microsoft Foundry, hoặc các gateway tối ưu chi phí như CometAPI (bắt đầu từ $0.08 / $0.40).
Key Takeaways
- Phát hành & định vị: Ra mắt ngày 7 tháng 10, 2026 như mẫu nhỏ, thông lượng cao trong gia đình Claude 5.5—lý tưởng cho hỗ trợ thời gian thực, xử lý tài liệu và các bước agent được ủy quyền.
- Thông số cốt lõi: Ngữ cảnh 1M token, đầu ra tối đa 128K (300K qua Batch API beta), tư duy thích ứng (mặc định effort trung bình), đầu vào văn bản + hình ảnh → đầu ra văn bản, knowledge cutoff tháng 6/2026.
- Lợi thế giá: $0.10 input / $0.50 output mỗi triệu token cho prompt đến 100K (≈90% rẻ hơn Haiku 4.5 trên hầu hết yêu cầu); bậc cao hơn cho >100K. Cache read thấp đến $0.01. CometAPI cung cấp mức Standard thấp hơn ≈20%.
- Bước nhảy hiệu năng: Tăng lớn so với Haiku 4.5 (ví dụ, OSWorld 72.4% vs 15.7%, Terminal-Bench 39.2% vs 0%, GDPval-AA 1620 vs 735 Elo) đồng thời vẫn cạnh tranh hoặc vượt GPT-6 Luna ở nhiều bài kiểm tra.
- Tính năng cho developer: Tham số effort (
low–max), prompt caching, Batch API (giảm 50%), computer/browser use (hỗ trợ SDK beta). Phải bỏ qua temperature/top_p/top_k nếu không sẽ gặp lỗi 400.
Claude Haiku 5.5 là gì và vì sao quan trọng vào năm 2026
Claude Haiku 5.5 là mẫu mới nhất của Anthropic trong phân khúc nhẹ của gia đình Claude. Khác với Opus 5.5 và Sonnet 5.5 đắt hơn và tối ưu cho suy luận phức tạp và agent dài hạn, Haiku 5.5 được xây dựng cho khối lượng lớn, chi phí nhạy và độ trễ quan trọng. Anthropic mô tả nó là “mẫu nhỏ rẻ nhất, nhanh nhất và mạnh nhất mà chúng tôi từng phát hành.”
Các trường hợp sử dụng điển hình trong sản xuất bao gồm:
- Phân loại và định tuyến ticket trong hỗ trợ khách hàng
- Trích xuất trường và tóm tắt từ tài liệu dài
- Nén lịch sử hội thoại cho các mẫu lớn hơn
- Truy vấn kiểu cơ sở dữ liệu và tác vụ dữ liệu có cấu trúc
- Subagent nhanh xử lý các bước hẹp về coding, dùng công cụ hoặc trình duyệt trong khi một mẫu mạnh hơn điều phối
Vì nó rẻ hơn và nhanh hơn rất nhiều so với thế hệ trước đồng thời thu hẹp đáng kể khoảng cách chất lượng ở các tác vụ agent thực tế, nhiều đội đang tái kiến trúc pipeline để Haiku 5.5 xử lý phần lớn yêu cầu và chỉ nâng cấp các trường hợp khó lên Sonnet hoặc Opus. Phản hồi sớm từ Asana, HubSpot, Box và những bên khác ghi nhận giảm độ trễ 30%+ và tăng độ chính xác có thể đo lường trên các đánh giá nội bộ khối lượng lớn.
Thông số kỹ thuật của Claude Haiku 5.5
| Thông số | Giá trị | Ghi chú |
|---|---|---|
| Model ID (Claude API) | claude-haiku-5-5 | Không có hậu tố ngày |
| Amazon Bedrock | anthropic.claude-haiku-5-5 (hoặc profile global/us/eu/au/jp) | |
| Context window | 1,000,000 token | ≈555k từ với tokenizer mới |
| Max output (Messages API) | 128,000 token | 300K với Batch API + beta header |
| Input modalities | Văn bản + hình ảnh | |
| Output modality | Văn bản | |
| Thinking | Thích ứng (bật mặc định) | Điều khiển qua effort |
| Default effort | medium | Tùy chọn: low, medium, high, xhigh, max |
| Knowledge cutoff | Tháng 6/2026 | |
| Cam kết duy trì | Không trước ngày 7 tháng 10, 2027 | |
| Tokenizer | Mới hơn (cùng họ với Claude 4.7+) | Cùng văn bản ≈30% nhiều token hơn Haiku 4.5 |
Nguồn: tổng quan model của Anthropic và tài liệu nền tảng.
Giới hạn ngữ cảnh và đầu ra lớn hơn, kết hợp tư duy thích ứng, khiến Haiku 5.5 hữu dụng hơn nhiều cho hệ thống sản xuất thực thay vì các mẫu nhỏ trước đây buộc phải cắt bớt mạnh hoặc cố định ngân sách tư duy.
Kiểm tra phản hồi và completion
Đọc các khối nội dung theo loại, thay vì giả định content[0] là câu trả lời hiển thị. Kiểm tra stop_reason trước khi chấp nhận đầu ra: max_tokens cho biết một bản sinh bị cắt ngắn và refusal cần một phản hồi ứng dụng rõ ràng. Với các yêu cầu bật tool, xử lý các khối tool-use và trả về kết quả tool ở định dạng gốc thay vì coi đó là một câu trả lời văn bản đã hoàn tất.
Đã thay đổi gì so với Claude Haiku 4.5 API?
Thay đổi về năng lực, hành vi và giá
| Chiều | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| Context window | 200K | 1M | 1M |
| Maximum output | 64K | 128K | 128K |
| Adaptive effort | Không | Có | Có |
| Anthropic input / MTok | $1.00 | $0.10 | $2.00 |
| Anthropic output / MTok | $5.00 | $0.50 | $10.00 |
| Định vị | Mẫu nhanh cũ | Công việc thường quy ở quy mô | Tác vụ phức tạp hơn |
Giá của Haiku 5.5 trong so sánh này áp dụng cho prompt đến 100,000 token; prompt dài hơn tốn nhiều hơn. Đây là mức Standard của Anthropic, không phải mức của CometAPI. Bảng so sánh là điểm khởi đầu định tuyến, không khẳng định các mẫu hoạt động giống hệt nhau.
Đối với tích hợp Haiku 4.5, các thay đổi triển khai chính là tư duy thích ứng thay cho ngân sách thủ công, kiểm soát effort, phân tích có chọn lọc các khối nội dung và số đếm token cập nhật. Cùng một văn bản có thể dùng nhiều hơn khoảng 30% token đầu vào. Đếm lại các prompt đại diện thay vì tái sử dụng ước tính token của Haiku 4.5. Phần migration biến các thay đổi này thành checklist triển khai.
Cải thiện benchmark được báo cáo
| Benchmark | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| OSWorld 2.1 (tập offline; chấm điểm một phần) | 15.7% | 72.4% | 83.9% |
| Terminal-Bench 4.0 | 0.0% | 39.2% | 70.6% |
| Humanity’s Last Exam (không tool) | 10.2% | 45.9% | 56.9% |
| Chartography (không tool) | 6.4% | 46.4% | 61.6% |
| GDPval-AA v2.1 (Elo) | 735 | 1,620 | 1,840 |
Anthropic báo cáo các điểm số trên trong tóm tắt benchmark ra mắt. Đây là kết quả đánh giá được báo cáo, không phải bài test trực tiếp của các ví dụ CometAPI trong hướng dẫn này. OSWorld 72.4% là chấm điểm một phần, không phải tỷ lệ hoàn thành nhiệm vụ nghiêm ngặt.
Haiku 5.5 system card mô tả điều kiện đánh giá. Đánh giá chuẩn của Haiku 5.5 sử dụng tư duy thích ứng ở effort tối đa và sampling mặc định trừ khi có ghi chú; mặc định sản phẩm là medium. OSWorld dùng 82 nhiệm vụ offline, không truy cập internet, độ phân giải 1080p và giới hạn 500 thao tác. Terminal-Bench 4.0 dùng Claude Code ở chế độ bare, không egress internet và 10 lần thử mỗi nhiệm vụ với Haiku 5.5; thiết lập của Sonnet khác. HLE và Chartography ở trên là không tool. GDPval-AA báo xếp hạng Elo từ đánh giá của Artificial Analysis. Khớp bộ công cụ, effort và thiết lập tool phù hợp khi so sánh kết quả.

Biểu đồ OSWorld gốc của Anthropic cho thấy mối quan hệ giữa effort, chi phí mỗi nhiệm vụ và điểm chấm một phần. Nó không đo độ trễ API hoặc đảm bảo hiệu năng tương tự trên workload của bạn.
Các điểm số cho thấy năng lực sử dụng máy tính và tác vụ tổng quát mạnh hơn nhiều so với Haiku 4.5, nhưng không đảm bảo kết quả tương tự trong ứng dụng của bạn. Hãy chạy một tập đánh giá đại diện trước khi chuyển lưu lượng sản xuất.
Bảng benchmark và hình minh họa được giữ lại như so sánh model. Đây là đánh giá được báo cáo chứ không phải bài test trực tiếp các ví dụ CometAPI. Hãy dùng cùng phân phối nhiệm vụ, effort và thiết lập tool khi đánh giá một ứng dụng; một điểm benchmark không thiết lập độ trễ gateway hay tỷ lệ thành công của riêng bạn.
Cách dùng Claude Haiku 5.5 API qua CometAPI
Tạo khóa và chọn route native
Tạo tài khoản CometAPI, xác nhận quyền truy cập claude-haiku-5-5 và tạo API key phía máy chủ. Đặt COMETAPI_KEY trong môi trường. Giữ khóa ngoài mã nguồn và mã trình duyệt. Khóa Anthropic và CometAPI thuộc các nhà cung cấp khác nhau; dùng khóa CometAPI cho mọi ví dụ trong hướng dẫn cập nhật này.
export COMETAPI_KEY="your_cometapi_api_key"
pip install --upgrade anthropic
$env:COMETAPI_KEY="your_cometapi_api_key"
| Tích hợp | SDK base URL | Request path | Credential |
|---|---|---|---|
| Anthropic-compatible Messages | https://api.cometapi.com | /v1/messages | COMETAPI_KEY |
| OpenAI-compatible Chat Completions | https://api.cometapi.com/v1 | /chat/completions | COMETAPI_KEY |
CometAPI hỗ trợ định dạng Messages và content-block gốc của Claude. Dùng Anthropic SDK với root base URL của CometAPI. Native Messages là route ưu tiên trong hướng dẫn này cho tư duy đặc thù Claude và content block. Route Chat Completions tương thích là lựa chọn cho ứng dụng kiểu OpenAI sẵn có. Xác nhận hỗ trợ field nâng cao trên đúng route gateway.
Gửi yêu cầu tối thiểu và xác minh kết quả
curl https://api.cometapi.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $COMETAPI_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 2048,
"output_config": {"effort": "low"},
"messages": [{"role": "user", "content": "Summarize three AI uses in customer support."}]
}'
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com",
timeout=60.0,
max_retries=2,
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{"role": "user", "content": "Classify this ticket: I cannot log in."}],
)
if response.stop_reason != "end_turn":
raise RuntimeError(f"Unaccepted completion: {response.stop_reason}")
print("".join(block.text for block in response.content if block.type == "text"))
print(response.usage)
Lưu ví dụ Python là example.py và chạy python example.py. Điểm kiểm tra thành công là một phản hồi hoàn tất với văn bản hiển thị và các trường usage. Lỗi xác thực nghĩa là cần kiểm tra khóa; lỗi model/route nghĩa là cần kiểm tra model ID, endpoint hoặc quyền truy cập tài khoản.
Dùng cùng định dạng native với JavaScript
npm install @anthropic-ai/sdk
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
apiKey: process.env.COMETAPI_KEY,
baseURL: "https://api.cometapi.com",
timeout: 60_000,
maxRetries: 2,
});
const response = await client.messages.create({
model: "claude-haiku-5-5",
max_tokens: 2048,
output_config: {effort: "low"},
messages: [{role: "user", content: "Extract product, quantity and price: 3 laptops at $900 each."}],
});
if (response.stop_reason !== "end_turn") {
throw new Error("Unaccepted completion: " + response.stop_reason);
}
for (const block of response.content) {
if (block.type === "text") console.log(block.text);
}
Dùng bản Node.js được hỗ trợ. Lưu file là example.mjs, đặt COMETAPI_KEY và chạy node example.mjs. Ghi lại phiên bản SDK bạn xác nhận cho triển khai.
Thích ứng ứng dụng tương thích OpenAI hiện có
Nếu ứng dụng của bạn đã dùng Chat Completions, cài gói openai và cấu hình client riêng bên dưới. Route này trả về choices thay vì content block native. Giữ parsing theo route riêng và kiểm tra thinking, hình ảnh và tool trước khi phụ thuộc vào gateway translation.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="claude-haiku-5-5",
max_tokens=2048,
messages=[
{"role": "system", "content": "Be concise and helpful."},
{"role": "user", "content": "Explain API rate limits."},
],
)
print(response.choices[0].message.content)
Gửi hình ảnh đến Claude Haiku 5.5 API
Dùng một hình ảnh cùng với hướng dẫn chỉ rõ bằng chứng và đầu ra bạn cần. Giao diện vision chính thức chấp nhận content block hình ảnh với dữ liệu base64, URL ảnh, hoặc tham chiếu file đã upload được hỗ trợ. Ví dụ này đọc một PNG cục bộ, đặt ảnh trước câu hỏi, và yêu cầu các giá trị có thể đối chiếu với nguồn.
Phân tích một PNG cục bộ thực qua Anthropic Messages API gốc.
import os
import base64
from pathlib import Path
import anthropic
# Replace dashboard.png with a real PNG file you are authorized to analyze.
image_data = base64.b64encode(Path("dashboard.png").read_bytes()).decode("ascii")
anthropic_client = anthropic.Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
response = anthropic_client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": [
{"type": "image", "source": {
"type": "base64", "media_type": "image/png", "data": image_data
}},
{"type": "text", "text": (
"Read the visible dashboard metrics. List anomalies with their "
"labels and values, and state when text is unreadable."
)},
],
}],
)
for block in response.content:
if block.type == "text":
print(block.text)
Dùng MIME type khớp với file thực. Kiểm tra khả năng đọc, kích thước ảnh và giới hạn kích thước yêu cầu trước khi gửi; tránh gửi media độ phân giải cao không giúp cho tác vụ. Với CometAPI, đổi khóa và root base URL như ví dụ Messages của nó, và xác minh hỗ trợ hình ảnh trên đúng route.
Kiểm soát reasoning của Claude Haiku 5.5
Haiku 5.5 dùng tư duy thích ứng theo mặc định. Cấu hình thinking chính thức giải thích khi nào disabled được chấp nhận và cách các block thinking được trả về. Đặt effort qua output_config.effort; không tái dùng legacy budget_tokens.
| Effort | Tình huống khởi đầu phù hợp | Đánh đổi |
|---|---|---|
| low | Phân loại ngắn, trích xuất đơn giản | Thường ít token và độ trễ thấp hơn |
| medium | Phản hồi hỗ trợ, công việc agent thường | Cân bằng mặc định |
| high | Phân tích tài liệu nhiều bước | Có thể nhiều reasoning hơn |
| xhigh | Đánh giá khó | Xử lý và chi phí nhiều hơn |
| max | Trường hợp đòi hỏi reasoning cao | Mức tiêu tốn reasoning tiềm năng cao nhất |
Cấu hình tư duy thích ứng với effort thấp.
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)response = anthropic_client.messages.create( model="claude-haiku-5-5", max_tokens=4096, thinking={"type": "adaptive"}, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Classify as billing, technical, or account: cannot log in."}],)for block in response.content: if block.type == "text": print(block.text)
Developer có thể tắt thinking ở effort low, medium và high, nhưng không ở xhigh hoặc max. Thinking tiêu thụ token đầu ra bị tính phí và ngân sách max_tokens ngay cả khi văn bản thinking bị ẩn. Một trường thinking rỗng vẫn có thể mang chữ ký; nó không chứng minh rằng không có reasoning. Giữ nguyên các content block trả về khi tiếp tục hội thoại tool.
Ví dụ yêu cầu với thinking tắt
Gửi body request native với thinking bị tắt.
{ "model": "claude-haiku-5-5", "max_tokens": 1024, "thinking": {"type": "disabled"}, "output_config": {"effort": "low"}, "messages": [ {"role": "user", "content": "Return sentiment only: positive, neutral, negative."} ]}
Streaming phản hồi của Claude Haiku 5.5
Streaming cung cấp văn bản hiển thị theo từng phần và cải thiện độ phản hồi trong ứng dụng tương tác. Xem văn bản stream là tạm thời cho đến khi yêu cầu hoàn tất thành công.
Stream văn bản hiển thị với Anthropic Python SDK.
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)with anthropic_client.messages.stream( model="claude-haiku-5-5", max_tokens=4096, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Explain API caching."}],) as stream: for text in stream.text_stream: print(text, end="", flush=True)
Giá của Claude Haiku 5.5 API
So sánh mức token và các băng độ dài prompt
Mức giá kiểm tra ngày 8 tháng 10, 2026. Bảng so sánh giá Standard của Anthropic với mức CometAPI công bố, tính theo USD trên mỗi triệu token. Băng được xác định bởi độ dài prompt: đến 100,000 token và hơn 100,000. Yêu cầu dài hơn dùng mức băng cao hơn áp dụng, không chỉ phụ phí cho phần vượt quá. Lập hóa đơn tài khoản, cached usage và tool tùy chọn phải đối soát riêng.
| Loại token | Anthropic ≤100K | CometAPI ≤100K | Anthropic >100K | CometAPI >100K |
|---|---|---|---|---|
| Input | $0.10 | $0.08 | $0.50 | $0.40 |
| Output | $0.50 | $0.40 | $2.50 | $2.00 |
| Cache read | $0.01 | $0.008 | $0.05 | $0.04 |
| Cache write 5 phút | $0.125 | $0.10 | $0.625 | $0.50 |
| Cache write 1 giờ | $0.20 | $0.16 | $1.00 | $0.80 |
Bảng mức của bài viết gốc được giữ lại phía trên. Kiểm tra danh sách CometAPI hiện tại và lập hóa đơn tài khoản trước khi mua hoặc triển khai; mức input khởi điểm trong danh sách không phải báo giá đầy đủ cho mọi băng độ dài prompt, thao tác cache hoặc tool tùy chọn.
Ví dụ: Chi phí 100,000 yêu cầu hỗ trợ
Giả sử 100,000 yêu cầu mỗi tháng, mỗi yêu cầu có 2,000 token input và 300 token output bị tính phí, bao gồm mọi thinking sinh ra. Mỗi prompt thuộc băng đến 100K. Loại trừ cache, phí tool và retry.
| Thành phần | Sử dụng | Anthropic | CometAPI |
|---|---|---|---|
| Input | 200M token | $20.00 | $16.00 |
| Output | 30M token | $15.00 | $12.00 |
| Tổng | 100,000 yêu cầu | $35.00 | $28.00 |
Với giả định này, chênh lệch minh họa là $7 mỗi tháng, tức 20%. Chi phí sản xuất phụ thuộc vào độ dài yêu cầu, reasoning ẩn, caching và hành vi retry.
Dùng số đếm token hiện tại của model trong phép tính. Chi phí = token input × mức input áp dụng / 1,000,000 + token output bị tính phí × mức output áp dụng / 1,000,000, cộng thêm riêng phí cache, tool và retry nếu có. Token thinking là một phần của output bị tính phí.
Giảm chi phí mà không mất chất lượng tác vụ chấp nhận
| Tối ưu hóa | Hành động | Lợi ích |
|---|---|---|
| Tinh chỉnh effort | Dùng low khi chất lượng cho phép | Giảm overhead reasoning |
| Giảm prompt | Bỏ lịch sử hội thoại thừa | Ít token input hơn |
| Prompt caching | Giữ ổn định ngữ cảnh tái sử dụng | Giảm chi phí input lặp lại |
| Streaming | Hiển thị token khi đến | Cải thiện cảm nhận phản hồi |
| Xác thực schema | Loại bản ghi sai định dạng sớm | Giảm rework phía sau |
| Định tuyến model | Nâng cấp các tác vụ phức tạp | Cân bằng chi phí-chất lượng tốt hơn |
| Xử lý theo lô | Batch các yêu cầu offline phù hợp | Có thể tiết kiệm thêm |
Không tự động chọn effort thấp nhất. Một cuộc gọi rẻ hơn có thể tăng tổng chi phí nếu tạo thêm retry. Đánh giá độ chính xác, độ trễ p50/p95, mức dùng token và chi phí mỗi tác vụ thành công.
Với prompt caching, tái sử dụng một tiền tố ổn định và kiểm tra cache creation và cache read usage thay vì giả định hit. Haiku 5.5 có mức tối thiểu 512 token có thể cache trên Claude API được tài liệu. Thay đổi effort có thể làm mất hiệu lực tiền tố đã cache; giữ thiết lập ổn định trong một hội thoại. Cửa sổ ngữ cảnh 1M là trần dung lượng, không phải khuyến nghị gửi mọi tài liệu ở mỗi lượt.
Giữ một tiền tố ổn định có thể tái sử dụng để caching, rút ngắn input không cần thiết và benchmark các thay đổi effort. Streaming cải thiện cảm nhận phản hồi chứ không tự động giảm mức tính phí. So sánh chi phí mỗi tác vụ chấp nhận trên toàn workflow, bao gồm retry và gọi tool.
Hướng dẫn Migration từ Claude Haiku 4.5 sang Haiku 5.5
Cập nhật tích hợp và định dạng yêu cầu
| Khu vực | Hành động migration |
|---|---|
| Model ID | Thay bằng claude-haiku-5-5 |
| Thinking | Thay budget_tokens thủ công bằng tư duy thích ứng |
| Effort | Dùng output_config.effort nếu cần |
| Sampling | Bỏ temperature, top_p và top_k; mọi giá trị top_k đều không được hỗ trợ |
| Trình phân tích | Xử lý nhiều loại content-block |
| Ngân sách output | Dành đủ chỗ cho reasoning và đầu ra cuối |
| Prefill | Bỏ assistant prefilling không được hỗ trợ |
| Caching | Kiểm thử lại prompt khi thay đổi effort |
| Tích hợp tool | Xác minh phiên bản tool được hỗ trợ |
Với route CometAPI được dùng ở đây, giữ COMETAPI_KEY và base URL native trong khi đổi model ID và cấu hình yêu cầu. Thay thinking legacy bật với ngân sách bằng tư duy thích ứng và effort. Bỏ assistant prefilling và các tham số sampling. Duy trì sự khác biệt giữa mảng nội dung native của Claude và phản hồi choices của route tương thích.
Bảo toàn trạng thái và tính lại ngân sách
Hướng dẫn migration Haiku 5.5 chính thức báo cáo khoảng 30% nhiều token input cho cùng văn bản so với Haiku 4.5. Đếm lại các prompt đại diện và điều chỉnh giới hạn trước khi chuyển lưu lượng. Các block thinking trả về chỉ hoạt động trong tài khoản đã tạo hoặc tài khoản liên kết; thay đổi tài khoản có thể âm thầm làm rơi các block đó. Giữ một tiền tố hội thoại chỉ-append thay vì sửa các tin nhắn trước đó sau khi sinh. Kiểm tra stop_reason, bao gồm max_tokens và refusal, và xử lý rõ ràng trước khi chấp nhận đầu ra.
Đếm lại các prompt đại diện với model mục tiêu và điều chỉnh max_tokens, giới hạn độ trễ và ước tính chi phí yêu cầu. Kiểm thử các hội thoại lưu trữ với tài khoản và route gateway sẽ phát lại; đừng giả định các block thinking có chữ ký có thể mang qua giữa các tài khoản không liên quan hoặc các tiền tố hội thoại bị viết lại.
Kết luận
Claude Haiku 5.5 đại diện cho một điểm bẻ cong thực sự về AI hiệu quả chi phí và thông lượng cao. Bằng cách mang lại hiệu năng agent và sử dụng máy tính tốt hơn đáng kể ở mức giá khoảng một phần mười so với Haiku trước đây trên đa số yêu cầu, Anthropic đã khiến việc triển khai quy mô lớn các mẫu nhỏ nhưng mạnh trở nên thực tế. Dù bạn gọi API chính thức, định tuyến qua Amazon Bedrock, hay dùng một gateway hợp nhất như CometAPI để tiết kiệm thêm và đơn giản hóa vận hành, sự kết hợp giữa tốc độ, năng lực và giá mở ra các khả năng sản phẩm mới trước đây không kinh tế.
