TLDR Claude Haiku 5.5 ถูกยกให้เป็นโมเดลขนาดเล็กที่ถูกที่สุด เร็วที่สุด และทรงประสิทธิภาพที่สุดเท่าที่เคยวางจำหน่าย ออกแบบมาสำหรับเวิร์กโหลดปริมาณสูงและไวต่อความหน่วง เช่น การจัดหมวดหมู่ การสกัดข้อมูล การกำหนดเส้นทาง การสรุป และงานซับเอเจนต์ โดยรองรับหน้าต่างบริบท 1 ล้านโทเคน เอาต์พุตได้สูงสุด 128K โทเคน และการคิดแบบปรับได้พร้อมระดับ effort ที่ปรับได้
โดยเฉลี่ยมีต้นทุนการทำงานต่ำกว่า Haiku 4.5 ราว 75% ขณะเดียวกันได้คะแนนดีขึ้นมากในเบนช์มาร์กด้านความเป็นเอเจนต์และการใช้คอมพิวเตอร์ นักพัฒนาสามารถเข้าถึงผ่าน Claude API อย่างเป็นทางการ (claude-haiku-5-5), Amazon Bedrock, Google Cloud, Microsoft Foundry หรือเกตเวย์ที่ประหยัดต้นทุนอย่าง CometAPI (เริ่มต้นที่ $0.08 / $0.40)
ประเด็นสำคัญ
- การเปิดตัวและการวางตำแหน่ง: เปิดตัว 7 ตุลาคม 2026 ในฐานะโมเดลขนาดเล็กแบบอัตราส่งผ่านสูงของตระกูล Claude 5.5 เหมาะสำหรับการสนับสนุนแบบเรียลไทม์ การประมวลผลเอกสาร และขั้นตอนซับเอเจนต์ที่มอบหมายงาน
- สเปคหลัก: บริบท 1M โทเคน, เอาต์พุตสูงสุด 128K (300K ผ่าน Batch API รุ่นเบต้า), การคิดแบบปรับได้ (ค่าเริ่มต้นคือ medium effort), อินพุตข้อความ + ภาพ → เอาต์พุตข้อความ, ขอบเขตความรู้ถึงมิถุนายน 2026
- ข้อได้เปรียบด้านราคา: $0.10 อินพุต / $0.50 เอาต์พุต ต่อหนึ่งล้านโทเคนสำหรับพรอมป์ตถึง 100K (≈ถูกกว่า Haiku 4.5 ประมาณ 90% ในคำขอส่วนใหญ่); ระดับราคาที่สูงขึ้นสำหรับพรอมป์ตเกิน 100K การอ่านแคชต่ำสุด $0.01 CometAPI มีเรท Standard ต่ำกว่าประมาณ 20%
- ก้าวกระโดดด้านประสิทธิภาพ: ดีขึ้นมากเมื่อเทียบกับ Haiku 4.5 (เช่น OSWorld 72.4% vs 15.7%, Terminal-Bench 39.2% vs 0%, GDPval-AA 1620 vs 735 Elo) และยังแข่งขันได้หรือเหนือ GPT-6 Luna ในหลายการทดสอบ
- ฟีเจอร์สำหรับนักพัฒนา: พารามิเตอร์ effort (
low–max), การแคชพรอมป์ต, Batch API (ลด 50%), การใช้คอมพิวเตอร์/เบราว์เซอร์ (รองรับ SDK รุ่นเบต้า) ต้องละเว้น temperature/top_p/top_k มิฉะนั้นจะเกิดข้อผิดพลาด 400
Claude Haiku 5.5 คืออะไร และสำคัญอย่างไรในปี 2026
Claude Haiku 5.5 เป็นผลงานล่าสุดของ Anthropic ในไลน์โมเดลน้ำหนักเบาของตระกูล Claude ต่างจาก Opus 5.5 และ Sonnet 5.5 ที่มีราคาแพงกว่าและเน้นการให้เหตุผลที่ซับซ้อนและเอเจนต์ระยะยาว Haiku 5.5 ถูกออกแบบมาเพื่อเวิร์กโหลดปริมาณสูง ต้นทุนอ่อนไหว และความหน่วงสำคัญ Anthropic อธิบายว่าเป็น “โมเดลขนาดเล็กที่ถูกที่สุด เร็วที่สุด และทรงความสามารถที่สุดที่เราเคยปล่อย”
กรณีการใช้งานโปรดักชันทั่วไป ได้แก่:
- การจัดหมวดหมู่ทิคเก็ตและกำหนดเส้นทางในงานซัพพอร์ต
- การสกัดฟิลด์และสรุปเนื้อหาจากเอกสารยาว
- การย่อประวัติการสนทนาเพื่อใช้กับโมเดลที่ใหญ่กว่า
- คิวรีสไตล์ฐานข้อมูลและงานข้อมูลเชิงโครงสร้าง
- ซับเอเจนต์ที่รวดเร็วสำหรับงานเจาะจงแคบ เช่น โค้ด เครื่องมือ หรือขั้นตอนในเบราว์เซอร์ ขณะที่โมเดลที่แข็งแกร่งกว่าทำหน้าที่ออเคสเตรต
เนื่องจากมีต้นทุนถูกลงและเร็วขึ้นกว่าเดิมอย่างมาก พร้อมลดช่องว่างคุณภาพในงานเอเจนต์เชิงปฏิบัติ ทีมจำนวนมากจึงออกแบบสถาปัตยกรรมใหม่เพื่อให้ Haiku 5.5 รับภาระคำขอส่วนใหญ่ และยกระดับไปยัง Sonnet หรือ Opus เฉพาะกรณียาก ฟีดแบกลูกค้าช่วงแรกจาก Asana, HubSpot, Box และรายอื่นระบุการลดความหน่วงเกิน 30% และการยกระดับความแม่นยำที่วัดได้ในอีวาลูเอชันภายในปริมาณสูง
ข้อมูลเชิงเทคนิคของ Claude Haiku 5.5
| Specification | Value | Notes |
|---|---|---|
| Model ID (Claude API) | claude-haiku-5-5 | ไม่มี suffix วันที่ |
| Amazon Bedrock | anthropic.claude-haiku-5-5 (หรือโปรไฟล์ global/us/eu/au/jp) | |
| Context window | 1,000,000 tokens | ≈555k คำ ด้วยโทเคไนเซอร์ใหม่ |
| Max output (Messages API) | 128,000 tokens | 300K ด้วย Batch API + beta header |
| Input modalities | ข้อความ + รูปภาพ | |
| Output modality | ข้อความ | |
| Thinking | Adaptive (เปิดโดยค่าเริ่มต้น) | ควบคุมผ่าน effort |
| Default effort | medium | ตัวเลือก: low, medium, high, xhigh, max |
| Knowledge cutoff | June 2026 | |
| Retirement commitment | ไม่ก่อนวันที่ October 7, 2027 | |
| Tokenizer | ใหม่กว่า (ตระกูลเดียวกับ Claude 4.7+) | ข้อความเดียวกัน ≈โทเคนมากกว่า 30% เทียบกับ Haiku 4.5 |
ที่มา: ภาพรวมโมเดลและเอกสารแพลตฟอร์มของ Anthropic.
ขนาดบริบทและเอาต์พุตที่ใหญ่ขึ้นเมื่อรวมกับการคิดแบบปรับได้ ทำให้ Haiku 5.5 ใช้งานได้จริงมากขึ้นสำหรับระบบโปรดักชัน เมื่อเทียบกับโมเดลขนาดเล็กก่อนหน้าที่ต้องตัดทอนอย่างรุนแรงหรือมีงบประมาณการคิดแบบตายตัว
การตอบกลับและการตรวจสอบคอมพลีชัน
อ่านบล็อกเนื้อหาตามชนิด แทนการสมมุติว่า content[0] คือคำตอบที่มองเห็น ตรวจสอบ stop_reason ก่อนยอมรับเอาต์พุต: max_tokens บ่งชี้การเจนเนอเรชันถูกตัด และการปฏิเสธต้องการการตอบสนองของแอปอย่างชัดเจน สำหรับคำขอที่เปิดใช้เครื่องมือ ให้ประมวลผลบล็อกการใช้เครื่องมือและคืนผลลัพธ์ของเครื่องมือในรูปแบบเนทีฟแทนที่จะปฏิบัติต่อเป็นคำตอบข้อความที่เสร็จสิ้นแล้ว
มีอะไรเปลี่ยนเมื่อเทียบกับ Claude Haiku 4.5 API?
การเปลี่ยนแปลงด้านขีดความสามารถ พฤติกรรม และราคา
| มิติ | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| Context window | 200K | 1M | 1M |
| Maximum output | 64K | 128K | 128K |
| Adaptive effort | ไม่มี | มี | มี |
| Anthropic input / MTok | $1.00 | $0.10 | $2.00 |
| Anthropic output / MTok | $5.00 | $0.50 | $10.00 |
| การวางตำแหน่ง | โมเดลเร็วแบบเดิม | งานประจำที่สเกลใหญ่ | งานซับซ้อนที่ยากกว่า |
ราคาของ Haiku 5.5 ในการเปรียบเทียบนี้ใช้กับพรอมป์ตถึง 100,000 โทเคน; พรอมป์ตที่ยาวกว่านั้นจะมีราคาสูงขึ้น ตารางนี้เป็นเรท Standard ของ Anthropic ไม่ใช่เรทของ CometAPI การเปรียบเทียบนี้เป็นจุดเริ่มต้นของการกำหนดเส้นทาง ไม่ใช่การอ้างว่าโมเดลทำงานเหมือนกันทุกประการ
สำหรับอินทิเกรชันที่ใช้ Haiku 4.5 การเปลี่ยนแปลงสำคัญคือการคิดแบบปรับได้แทนงบประมาณแบบแมนนวล การควบคุม effort การพาร์สเฉพาะบล็อกเนื้อหา และจำนวนโทเคนที่อัปเดต ข้อความเดียวกันอาจใช้โทเคนอินพุตมากขึ้นประมาณ 30% ควรนับโทเคนของพรอมป์ตตัวแทนใหม่แทนการใช้ค่าประมาณของ Haiku 4.5 ส่วนการย้ายใช้งานจะแปลงการเปลี่ยนแปลงเหล่านี้เป็นเช็กลิสต์การดีพลอย
การปรับปรุงเบนช์มาร์กรายงาน
| Benchmark | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| OSWorld 2.1 (offline subset; partial credit) | 15.7% | 72.4% | 83.9% |
| Terminal-Bench 4.0 | 0.0% | 39.2% | 70.6% |
| Humanity’s Last Exam (no tools) | 10.2% | 45.9% | 56.9% |
| Chartography (no tools) | 6.4% | 46.4% | 61.6% |
| GDPval-AA v2.1 (Elo) | 735 | 1,620 | 1,840 |
Anthropic รายงานคะแนนข้างต้นใน สรุปเบนช์มาร์กเปิดตัว ซึ่งเป็นผลการประเมินที่รายงาน ไม่ใช่การทดสอบสดของตัวอย่าง CometAPI ในคู่มือนี้ OSWorld ที่ 72.4% เป็นเครดิตบางส่วน ไม่ใช่อัตราการทำงานสำเร็จแบบเข้มงวด
Haiku 5.5 system card อธิบายเงื่อนไขการประเมิน การประเมินมาตรฐานของ Haiku 5.5 ใช้การคิดแบบปรับได้ที่ effort ระดับ max และการ sampling ค่าเริ่มต้น เว้นแต่ระบุไว้; ค่าดีฟอลต์ของผลิตภัณฑ์คือ medium OSWorld ใช้งานออฟไลน์ 82 งาน ไม่มีการเข้าถึงอินเทอร์เน็ต ความละเอียด 1080p และขีดจำกัด 500 การกระทำ Terminal-Bench 4.0 ใช้ Claude Code โหมด bare ไม่มีการออกอินเทอร์เน็ต และ 10 ครั้งต่อภารกิจสำหรับ Haiku 5.5; การตั้งค่าของ Sonnet แตกต่างกัน แถว HLE และ Chartography ไม่มีเครื่องมือ GDPval-AA รายงาน Elo จากการประเมินของ Artificial Analysis จับคู่ฮาร์เนส effort และการตั้งค่าเครื่องมือที่เกี่ยวข้องเมื่อเปรียบเทียบผลลัพธ์

กราฟิก OSWorld ดั้งเดิมของ Anthropic แสดงความสัมพันธ์ระหว่าง effort ต้นทุนต่อภารกิจ และคะแนนเครดิตบางส่วน มันไม่ได้วัด latency ของ API หรือรับประกันประสิทธิภาพเดียวกันในเวิร์กโหลดของคุณ
คะแนนแสดงให้เห็นถึงสมรรถนะด้านการใช้คอมพิวเตอร์และงานทั่วไปที่แข็งแกร่งยิ่งขึ้นเมื่อเทียบกับ Haiku 4.5 แต่ไม่ได้รับประกันผลลัพธ์เดียวกันในแอปพลิเคชันของคุณ ควรเรียกใช้ชุดการประเมินที่เป็นตัวแทนก่อนผันทราฟฟิกโปรดักชัน
ตารางเบนช์มาร์กและกราฟิกที่ให้มาถูกเก็บไว้เพื่อการเปรียบเทียบโมเดล เป็นผลการประเมินที่รายงาน ไม่ใช่การทดสอบสดของตัวอย่าง CometAPI ใช้การกระจายภารกิจเดียวกัน effort และการตั้งค่าเครื่องมือเดียวกันเมื่อประเมินแอปพลิเคชัน คะแนนเบนช์มาร์กไม่ได้บ่งชี้ latency ของเกตเวย์หรืออัตราความสำเร็จของคุณเอง
วิธีใช้ Claude Haiku 5.5 API ผ่าน CometAPI
สร้างคีย์และเลือกเส้นทางแบบเนทีฟ
สร้างบัญชี CometAPI ยืนยันการเข้าถึง claude-haiku-5-5 และสร้างคีย์ API ฝั่งเซิร์ฟเวอร์ ตั้งค่า COMETAPI_KEY ในสภาพแวดล้อม เก็บคีย์ไว้นอกซอร์สคอนโทรลและโค้ดฝั่งเบราว์เซอร์ คีย์ของ Anthropic และ CometAPI เป็นผู้ให้บริการคนละราย; ใช้คีย์ CometAPI สำหรับทุกตัวอย่างในคู่มือปรับปรุงนี้
export COMETAPI_KEY="your_cometapi_api_key"
pip install --upgrade anthropic
$env:COMETAPI_KEY="your_cometapi_api_key"
| Integration | SDK base URL | Request path | Credential |
|---|---|---|---|
| Anthropic-compatible Messages | https://api.cometapi.com | /v1/messages | COMETAPI_KEY |
| OpenAI-compatible Chat Completions | https://api.cometapi.com/v1 | /chat/completions | COMETAPI_KEY |
CometAPI รองรับ Messages และรูปแบบ content-block แบบเนทีฟของ Claude ใช้ Anthropic SDK กับ root base URL ของ CometAPI เส้นทาง Messages แบบเนทีฟเป็นทางเลือกที่แนะนำในคู่มือนี้สำหรับการคิดและ content blocks เฉพาะของ Claude เส้นทาง Chat Completions ที่เข้ากันได้เป็นตัวเลือกสำหรับแอปพลิเคชันสไตล์ OpenAI ที่มีอยู่ ตรวจสอบการรองรับฟิลด์ขั้นสูงบนเส้นทางเกตเวย์ที่คุณใช้งานจริง
ส่งคำขอขั้นต่ำและตรวจสอบผลลัพธ์
curl https://api.cometapi.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $COMETAPI_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 2048,
"output_config": {"effort": "low"},
"messages": [{"role": "user", "content": "Summarize three AI uses in customer support."}]
}'
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com",
timeout=60.0,
max_retries=2,
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{"role": "user", "content": "Classify this ticket: I cannot log in."}],
)
if response.stop_reason != "end_turn":
raise RuntimeError(f"Unaccepted completion: {response.stop_reason}")
print("".join(block.text for block in response.content if block.type == "text"))
print(response.usage)
บันทึกตัวอย่าง Python เป็น example.py และรัน python example.py เช็คพอยต์ที่สำเร็จคือการตอบกลับเสร็จสิ้นพร้อมข้อความที่มองเห็นและฟิลด์การใช้งาน ข้อผิดพลาดการยืนยันตัวตนหมายถึงคีย์ต้องตรวจสอบใหม่; ข้อผิดพลาดโมเดล/เส้นทางหมายถึงต้องตรวจสอบ model ID, endpoint หรือการเข้าถึงบัญชี
ใช้รูปแบบเนทีฟเดียวกันจาก JavaScript
npm install @anthropic-ai/sdk
import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
apiKey: process.env.COMETAPI_KEY,
baseURL: "https://api.cometapi.com",
timeout: 60_000,
maxRetries: 2,
});
const response = await client.messages.create({
model: "claude-haiku-5-5",
max_tokens: 2048,
output_config: {effort: "low"},
messages: [{role: "user", content: "Extract product, quantity and price: 3 laptops at $900 each."}],
});
if (response.stop_reason !== "end_turn") {
throw new Error("Unaccepted completion: " + response.stop_reason);
}
for (const block of response.content) {
if (block.type === "text") console.log(block.text);
}
ใช้เวอร์ชัน Node.js ที่รองรับ บันทึกไฟล์เป็น example.mjs ตั้งค่า COMETAPI_KEY และรัน node example.mjs บันทึกเวอร์ชัน SDK ที่คุณตรวจสอบสำหรับการดีพลอย
ปรับแอปพลิเคชันที่เข้ากันได้กับ OpenAI ที่มีอยู่
หากแอปของคุณใช้งาน Chat Completions อยู่แล้ว ให้ติดตั้งแพ็กเกจ openai และกำหนดค่าคลายเอนต์แยกต่างหากด้านล่าง เส้นทางนี้จะส่งคืน choices แทน content blocks แบบเนทีฟ แยกการพาร์สตามเส้นทางและทดสอบการคิด รูปภาพ และเครื่องมือก่อนพึ่งพาการแปลของเกตเวย์
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="claude-haiku-5-5",
max_tokens=2048,
messages=[
{"role": "system", "content": "Be concise and helpful."},
{"role": "user", "content": "Explain API rate limits."},
],
)
print(response.choices[0].message.content)
ส่งรูปภาพไปยัง Claude Haiku 5.5 API
ใช้ภาพพร้อมคำสั่งที่ระบุหลักฐานและเอาต์พุตที่คุณต้องการ อินเทอร์เฟซวิชันอย่างเป็นทางการ รองรับบล็อกเนื้อหาภาพด้วยข้อมูล base64, URL รูปภาพ หรือการอัปโหลดไฟล์ที่รองรับ ตัวอย่างนี้อ่าน PNG ภายในเครื่อง วางภาพก่อนคำถาม และขอค่าที่ตรวจสอบกับต้นทางได้
วิเคราะห์ PNG ภายในเครื่องผ่าน Anthropic Messages API แบบเนทีฟ
import os
import base64
from pathlib import Path
import anthropic
# Replace dashboard.png with a real PNG file you are authorized to analyze.
image_data = base64.b64encode(Path("dashboard.png").read_bytes()).decode("ascii")
anthropic_client = anthropic.Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
response = anthropic_client.messages.create(
model="claude-haiku-5-5",
max_tokens=2048,
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": [
{"type": "image", "source": {
"type": "base64", "media_type": "image/png", "data": image_data
}},
{"type": "text", "text": (
"Read the visible dashboard metrics. List anomalies with their "
"labels and values, and state when text is unreadable."
)},
],
}],
)
for block in response.content:
if block.type == "text":
print(block.text)
ใช้ MIME type ให้ตรงกับไฟล์จริง ตรวจสอบความสามารถในการอ่าน ขนาดภาพ และขีดจำกัดขนาดคำขอก่อนส่ง; หลีกเลี่ยงสื่อความละเอียดสูงที่ไม่ช่วยงาน สำหรับ CometAPI ให้เปลี่ยนคีย์และ root base URL ตามตัวอย่าง Messages ของมัน และตรวจสอบการรองรับรูปภาพบนเส้นทางที่ใช้งานจริง
ควบคุมการให้เหตุผลของ Claude Haiku 5.5
Haiku 5.5 ใช้การคิดแบบปรับได้โดยค่าเริ่มต้น การกำหนดค่าการคิดอย่างเป็นทางการ อธิบายว่าเมื่อใดรับโหมด disabled และวิธีคืนบล็อกการคิด ตั้งค่า effort ผ่าน output_config.effort; อย่าใช้ budget_tokens แบบเดิม
| Effort | กรณีใช้งานตั้งต้นที่ดี | สิ่งที่ต้องแลก |
|---|---|---|
| low | การจัดหมวดสั้นๆ การสกัดง่ายๆ | การใช้โทเคนและความหน่วงต่ำลงโดยทั่วไป |
| medium | การตอบซัพพอร์ต งานเอเจนต์ประจำ | สมดุลค่าเริ่มต้น |
| high | การวิเคราะห์เอกสารหลายขั้น | อาจมีการให้เหตุผลมากขึ้น |
| xhigh | การประเมินที่ยาก | การประมวลผลและต้นทุนมากขึ้น |
| max | กรณีที่เน้นการให้เหตุผลเข้มข้น | ศักยภาพการใช้เหตุผลสูงสุด |
กำหนดการคิดแบบปรับได้ด้วย effort ระดับต่ำ
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)response = anthropic_client.messages.create( model="claude-haiku-5-5", max_tokens=4096, thinking={"type": "adaptive"}, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Classify as billing, technical, or account: cannot log in."}],)for block in response.content: if block.type == "text": print(block.text)
นักพัฒนาสามารถปิดการคิดได้ในระดับ low, medium และ high แต่ไม่สามารถปิดในระดับ xhigh หรือ max การคิดจะกินโทเคนเอาต์พุตที่ถูกเรียกเก็บและงบประมาณ max_tokens แม้ว่าข้อความจะถูกซ่อน ฟิลด์การคิดที่ว่างยังอาจมีลายเซ็น; มันไม่ได้พิสูจน์ว่าไม่มีการให้เหตุผล เก็บ content blocks ที่คืนมาคงเดิมเมื่อดำเนินการสนทนากับเครื่องมือต่อ
ตัวอย่างคำขอที่ปิดการคิด
ส่งบอดีคำขอแบบเนทีฟพร้อมการคิดที่ปิดอยู่
{ "model": "claude-haiku-5-5", "max_tokens": 1024, "thinking": {"type": "disabled"}, "output_config": {"effort": "low"}, "messages": [ {"role": "user", "content": "Return sentiment only: positive, neutral, negative."} ]}
สตรีมการตอบกลับของ Claude Haiku 5.5
การสตรีมจะส่งข้อความที่มองเห็นทีละส่วนและช่วยเพิ่มความตอบสนองในแอปเชิงโต้ตอบ ถือว่าข้อความที่สตรีมเป็นชั่วคราวจนกว่าคำขอจะเสร็จสิ้นสำเร็จ
สตรีมข้อความที่มองเห็นด้วย Anthropic Python SDK
import osimport anthropicanthropic_client = anthropic.Anthropic( api_key=os.environ["ANTHROPIC_API_KEY"],)with anthropic_client.messages.stream( model="claude-haiku-5-5", max_tokens=4096, output_config={"effort": "low"}, messages=[{"role": "user", "content": "Explain API caching."}],) as stream: for text in stream.text_stream: print(text, end="", flush=True)
ราคา Claude Haiku 5.5 API
เปรียบเทียบอัตราโทเคนและช่วงความยาวพรอมป์ต
ตรวจสอบเมื่อ 8 ตุลาคม 2026 ตารางนี้เปรียบเทียบ ราคา Standard ของ Anthropic กับ เรท CometAPI ที่เผยแพร่ เป็น USD ต่อหนึ่งล้านโทเคน ช่วงถูกกำหนดจากความยาวพรอมป์ต: ถึง 100,000 โทเคนเทียบกับมากกว่า 100,000 โทเคน คำขอที่ยาวกว่าใช้เรทช่วงสูงที่เกี่ยวข้อง ไม่ใช่เพียงส่วนที่เกิน โครงสร้างบัญชี การใช้แคช และเครื่องมือเสริมต้องกระทบยอดแยกต่างหาก
| Token category | Anthropic ≤100K | CometAPI ≤100K | Anthropic >100K | CometAPI >100K |
|---|---|---|---|---|
| Input | $0.10 | $0.08 | $0.50 | $0.40 |
| Output | $0.50 | $0.40 | $2.50 | $2.00 |
| Cache read | $0.01 | $0.008 | $0.05 | $0.04 |
| 5-min cache write | $0.125 | $0.10 | $0.625 | $0.50 |
| 1-hour cache write | $0.20 | $0.16 | $1.00 | $0.80 |
เรทย์ต้นฉบับในบทความถูกเก็บไว้ด้านบน ตรวจสอบ ลิสต์ CometAPI ปัจจุบัน และบิลลิงบัญชีก่อนซื้อหรือดีพลอย; เรทอินพุตเริ่มต้นที่ลิสต์ไว้ไม่ใช่ใบเสนอราคาครบสำหรับทุกช่วงความยาวพรอมป์ต การดำเนินการแคช หรือเครื่องมือเสริม
ตัวอย่าง: ต้นทุนคำขอซัพพอร์ต 100,000 รายการ
สมมุติคำขอรายเดือน 100,000 รายการ แต่ละรายการมีอินพุต 2,000 โทเคนและเอาต์พุตที่เรียกเก็บ 300 โทเคน รวมถึงการคิดที่เจนเนอเรต ทุกพรอมป์ตอยู่ในช่วงถึง 100K ไม่รวมแคช เครื่องมือเสริม และการลองใหม่
| Component | Usage | Anthropic | CometAPI |
|---|---|---|---|
| Input | 200M tokens | $20.00 | $16.00 |
| Output | 30M tokens | $15.00 | $12.00 |
| Total | 100,000 requests | $35.00 | $28.00 |
ภายใต้สมมุติฐานนี้ ความต่างเชิงตัวอย่างคือ $7 ต่อเดือน หรือ 20% ต้นทุนโปรดักชันขึ้นกับความยาวคำขอ การให้เหตุผลที่ซ่อนอยู่ แคช และพฤติกรรมการลองใหม่
ใช้จำนวนโทเคนของโมเดลปัจจุบันในการคำนวณ Cost = โทเคนอินพุต × อัตราอินพุตที่ใช้ได้ / 1,000,000 + โทเคนเอาต์พุตที่เรียกเก็บ × อัตราเอาต์พุตที่ใช้ได้ / 1,000,000 บวกค่าการแคช เครื่องมือ และการลองใหม่ที่ใช้ได้ การให้เหตุผลถือเป็นส่วนหนึ่งของโทเคนเอาต์พุตที่เรียกเก็บ
ลดต้นทุนโดยไม่ลดคุณภาพงานที่ยอมรับ
| Optimization | Action | Benefit |
|---|---|---|
| Effort tuning | ใช้ low เมื่อคุณภาพอนุญาต | ลดโอเวอร์เฮดการให้เหตุผล |
| Prompt reduction | ตัดประวัติการสนทนาที่ซ้ำซ้อน | ลดโทเคนอินพุต |
| Prompt caching | รักษาบริบทที่ใช้ซ้ำให้คงที่ | ลดต้นทุนอินพุตที่ซ้ำ |
| Streaming | เรนเดอร์โทเคนเมื่อมาถึง | การตอบสนองที่รู้สึกเร็วขึ้น |
| Schema validation | ปฏิเสธเรคอร์ดที่ไม่ถูกฟอร์แมตแต่เนิ่นๆ | ลดงานแก้ไขปลายน้ำ |
| Model routing | ยกระดับกรณีที่ซับซ้อน | สมดุลต้นทุน-คุณภาพดีขึ้น |
| Batch processing | ประมวลผลงานออฟไลน์ที่เข้าเกณฑ์เป็นชุด | อาจประหยัดเพิ่มได้ |
อย่าเลือก effort ต่ำสุดโดยอัตโนมัติ คำเรียกที่ถูกลงอาจเพิ่มต้นทุนรวมถ้าทำให้ต้องลองใหม่มากขึ้น ประเมินความแม่นยำ latency p50/p95 การใช้โทเคน และต้นทุนต่อภารกิจที่สำเร็จ
สำหรับ การแคชพรอมป์ต รักษาพรีฟิกซ์ที่คงที่และตรวจสอบการสร้างแคชและการอ่านแคช แทนการสมมุติว่าโดนแคช Haiku 5.5 มีพรอมป์ตขั้นต่ำที่แคชได้ 512 โทเคนบน Claude API ที่มีเอกสาร การเปลี่ยน effort อาจทำให้พรีฟิกซ์ที่แคชไว้ใช้ไม่ได้; รักษาการตั้งค่าให้คงที่ภายในบทสนทนา หน้าต่างบริบท 1M เป็นเพดานความจุ ไม่ใช่คำแนะนำให้ส่งทุกเอกสารในทุกเทิร์น
รักษาพรีฟิกซ์ที่นำกลับมาใช้ใหม่ได้ให้คงที่ ลดอินพุตที่ไม่จำเป็น และทดสอบผลของการเปลี่ยน effort การสตรีมช่วยเพิ่มความรู้สึกการตอบสนอง แต่อัตโนมัติไม่ได้ลดการเรียกเก็บโทเคน เปรียบเทียบต้นทุนต่อภารกิจที่ยอมรับได้ในเวิร์กโฟลว์ครบถ้วน รวมถึงการลองใหม่และการเรียกเครื่องมือ
คู่มือย้ายจาก Claude Haiku 4.5 ไป Haiku 5.5
อัปเดตอินทิเกรชันและรูปแบบคำขอ
| พื้นที่ | การย้ายใช้งาน |
|---|---|
| Model ID | แทนที่ด้วย claude-haiku-5-5 |
| Thinking | แทนงบประมาณแบบแมนนวล budget_tokens ด้วยการคิดแบบปรับได้ |
| Effort | ใช้ output_config.effort หากต้องการ |
| Sampling | ละเว้น temperature, top_p และ top_k; ค่า top_k ใดๆ ไม่รองรับ |
| Response parser | รองรับหลายชนิดของ content-block |
| Output budget | เผื่อวงเงินเพียงพอสำหรับการคิดและเอาต์พุตสุดท้าย |
| Prefill | ลบ assistant prefilling ที่ไม่รองรับ |
| Caching | ทดสอบพรอมป์ตใหม่เมื่อเปลี่ยน effort |
| Tool integrations | ตรวจสอบเวอร์ชันเครื่องมือที่รองรับ |
สำหรับเส้นทาง CometAPI ที่ใช้ที่นี่ ให้คง COMETAPI_KEY และ base URL แบบเนทีฟไว้ ขณะเปลี่ยน model ID และการกำหนดค่าคำขอ แทนการคิดแบบ enabled ที่มีงบประมาณ ด้วยการคิดแบบปรับได้และ effort ลบ assistant prefilling และละเว้นพารามิเตอร์ sampling รักษาความต่างระหว่าง content array แบบเนทีฟของ Claude และการตอบแบบ choices ของเส้นทางที่เข้ากันได้
รักษาสถานะและคำนวณงบประมาณใหม่
คู่มือย้าย Haiku 5.5 อย่างเป็นทางการ รายงานว่าอินพุตโทเคนเพิ่มขึ้นประมาณ 30% สำหรับข้อความเดียวกันเมื่อเทียบกับ Haiku 4.5 นับพรอมป์ตตัวแทนใหม่และจูนลิมิตก่อนย้ายทราฟฟิก บล็อกการคิดที่คืนมาทำงานได้เฉพาะในบัญชีที่สร้างไว้หรือบัญชีที่ลิงก์; การเปลี่ยนบัญชีอาจทำให้บล็อกเหล่านั้นหายโดยเงียบๆ รักษาพรีฟิกซ์บทสนทนาแบบเพิ่มต่อ (append-only) แทนการแก้ไขข้อความก่อนหน้า ตรวจสอบ stop_reason รวมถึง max_tokens และ refusal และจัดการอย่างชัดเจนก่อนยอมรับเอาต์พุต
นับพรอมป์ตตัวแทนใหม่ด้วยโมเดลเป้าหมายและปรับ max_tokens ขีดจำกัดความหน่วง และประมาณต้นคำขอ ทดสอบบทสนทนาที่เก็บไว้กับบัญชีและเส้นทางเกตเวย์ที่จะรีเพลย์ อย่าสมมุติว่าบล็อกการคิดที่ลงลายเซ็นสามารถพกพาข้ามบัญชีที่ไม่เกี่ยวข้องหรือพรีฟิกซ์บทสนทนาที่ถูกเขียนใหม่
บทสรุป
Claude Haiku 5.5 เป็นจุดเปลี่ยนที่แท้จริงสำหรับ AI ที่คุ้มค่าและอัตราส่งผ่านสูง ด้วยประสิทธิภาพด้านเอเจนต์และการใช้คอมพิวเตอร์ที่ดีขึ้นอย่างมากพร้อมราคาประมาณหนึ่งในสิบของ Haiku รุ่นก่อนในคำขอส่วนใหญ่ Anthropic ทำให้การดีพลอยโมเดลขนาดเล็กที่ทรงความสามารถในสเกลใหญ่เป็นเรื่องปฏิบัติได้จริง ไม่ว่าคุณจะเรียกใช้ API อย่างเป็นทางการ ใช้ผ่าน Amazon Bedrock หรือเกตเวย์รวมอย่าง CometAPI เพื่อประหยัดต้นทุนและความเรียบง่ายในการปฏิบัติการ การผสานของความเร็ว ความสามารถ และราคาเปิดโอกาสผลิตภัณฑ์ใหม่ๆ ที่ก่อนหน้านี้ไม่คุ้มต้นทุน
