GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
ai-model/Nghiên cứu CometAPI

Cách sử dụng GPT-6 Astra API: Hướng dẫn đầy đủ cho nhà phát triển

Cách sử dụng GPT-6 Astra API thông qua CometAPI với các ví dụ về Responses API, kiểm soát suy luận, đầu vào hình ảnh, đầu ra có cấu trúc, công cụ, giá cả và di chuyển.

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 9, 2026 17 phút đọc
Cách sử dụng GPT-6 Astra API: Hướng dẫn đầy đủ cho nhà phát triển
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Tóm tắt

GPT-6 Astra API trong CometAPI phù hợp nhất cho các quy trình công việc khó, giàu công cụ, nơi chất lượng hoàn thành quan trọng hơn mức giá token thấp nhất. Mô hình hỗ trợ cửa sổ ngữ cảnh 1.050.000 token, 128.000 token đầu ra, đầu vào hình ảnh, đầu ra có cấu trúc, streaming, gọi hàm và năm mức suy luận. Bắt đầu với Responses API, suy luận medium, bộ công cụ hẹp và một phép đánh giá đo chi phí trên mỗi nhiệm vụ được chấp nhận. Mức giá token cơ bản hiện tại của CometAPI thấp hơn 20% so với mức tương ứng của OpenAI.

Những điểm chính

  • Astra được tối ưu cho công việc đầu-cuối khó, bao gồm lập trình, sử dụng máy tính, nghiên cứu và tự động hóa chuyên nghiệp.
  • Sử dụng Responses API cho các tích hợp mới dựa trên công cụ.
  • Chọn mức nỗ lực suy luận thấp nhất vượt qua đánh giá khối lượng công việc của bạn; không hỗ trợ none.
  • Giữ prompt dưới ngưỡng ngữ cảnh dài 272K bất cứ khi nào có thể, vì lịch giá cao hơn áp dụng cho toàn bộ yêu cầu.
  • Các đánh giá công khai cho thấy điểm cao hơn và chi phí API ước tính trên mỗi nhiệm vụ thấp hơn trong một số khối công việc khó, nhưng định tuyến sản xuất nên dựa trên tỷ lệ nhiệm vụ được chấp nhận của riêng bạn.

Bắt đầu nhanh với GPT-6 Astra API

  1. Tạo khóa CometAPI và lưu trong biến môi trường.
  2. Cài đặt OpenAI SDK.
  3. Gửi yêu cầu Responses API với model="gpt-6-astra".
  4. Thêm hợp đồng đầu ra nghiêm ngặt và xác thực kết quả.
  5. Chỉ kết nối các công cụ cần thiết cho quy trình.
  6. Kiểm thử tích hợp trên các nhiệm vụ tiêu biểu trước khi đưa vào sản xuất.

GPT-6 Astra API là gì?

Model mạnh nhất của OpenAI cho công việc đầu-cuối khó được thiết kế cho suy luận phức tạp, lập trình, sử dụng máy tính, nghiên cứu và tạo tài liệu. Trong ứng dụng API, giá trị của Astra nằm ở việc giữ vững ý định qua các quy trình dài, gọi công cụ, diễn giải kết quả và tiếp tục cho đến khi đáp ứng tiêu chí hoàn thành của ứng dụng.

Thông số kỹ thuật GPT-6 Astra API

Thông số OpenAIGPT-6 Astra
Model IDgpt-6-astra
Cửa sổ ngữ cảnh1.050.000 token
Đầu ra tối đa128.000 token
Mốc kiến thức30 tháng 4, 2026
Đầu vào và đầu raĐầu vào văn bản và hình ảnh; đầu ra văn bản
Mức suy luậnlow, medium, high, xhigh, max
Tính năng hỗ trợStreaming, gọi hàm, đầu ra có cấu trúc
Công cụ Responses APITìm kiếm web, tìm kiếm tệp, tạo hình ảnh, trình thông dịch mã, shell được lưu trữ, Apply Patch, sử dụng máy tính, MCP, tìm kiếm công cụ
Huấn luyện tinh chỉnhKhông hỗ trợ

Thách thức tích hợp là điều phối: cung cấp ngữ cảnh phù hợp, thực thi các công cụ được yêu cầu, kiểm tra kết quả của chúng và dừng lại khi đáp ứng tiêu chí hoàn thành của ứng dụng.

GPT-6 Astra API so với GPT-5.6 Sol: Có gì mới?

Hướng dẫn model hiện tại của OpenAI mô tả Astra mạnh hơn trong các quy trình đa bước khó đồng thời thường dùng ít token đầu ra hơn. Nó cũng bổ sung các kiểm soát quan trọng cho tác tử chạy lâu: gọi công cụ bất đồng bộ, điều hướng giữa lượt, thay đổi suy luận trong cuộc hội thoại và giám sát sai lệch.

Khía cạnhGPT-6 AstraGPT-5.6 Sol
Vai trò chínhCông việc đầu-cuối khó nhấtCông việc chuyên nghiệp phức tạp với chi phí token thấp hơn
Ngữ cảnh / đầu ra tối đa1,05M / 128K1,05M / 128K
Mốc kiến thức30 tháng 4, 202616 tháng 2, 2026
Gọi công cụ bất đồng bộHỗ trợDùng điều phối kết quả công cụ kiểu truyền thống
Điều hướng giữa lượtHỗ trợ qua Responses WebSocketDùng lượt tiếp theo hoặc ứng dụng khởi động lại
Thay đổi suy luận giữa hội thoạiconfiguration_update trong luồng tương thíchĐặt mức nỗ lực ở cấp độ yêu cầu
none reasoningKhông hỗ trợHỗ trợ
OpenAI Standard đầu vào / đầu ra$10 / $50 mỗi 1M$4 / $20 mỗi 1M
Vai trò định tuyến tốt nhấtThăng cấp cho công việc độ phức tạp caoMặc định cho lưu lượng phức tạp rộng hơn

Nâng cấp này không phải thay thế toàn bộ. Dùng Sol khi nó ổn định vượt qua nhiệm vụ; định tuyến sang Astra khi độ sâu công cụ, ngữ cảnh dài, thử lại hoặc chỉnh sửa của con người khiến model rẻ hơn trở nên đắt hơn trên thực tế.

Tại sao dùng GPT-6 Astra qua CometAPI?

GPT-6 Astra trong CometAPI dùng tuyến /v1/responses tương thích OpenAI. Giá ngữ cảnh ngắn $8/M đầu vào và $40/M đầu ra thấp hơn 20% so với OpenAI Standard tương ứng là $10/M và $50/M.

Một tích hợp SDK OpenAI hiện có có thể giữ thư viện khách, đồng thời thay đổi key, base_url và model ID. Dùng cùng cổng khi định tuyến công việc phù hợp tới GPT-5.6 Sol.

Bước 1: Lấy khóa API CometAPI

Tạo khóa trong bảng điều khiển CometAPI và lưu ngoài mã nguồn. Dùng trình quản lý bí mật triển khai trong sản xuất.

export COMETAPI_KEY="your_api_key"
$env:COMETAPI_KEY = "your_api_key"

Bước 2: Cài đặt OpenAI SDK

Cài đặt SDK hiện tại cho ngôn ngữ ứng dụng của bạn.

python -m pip install -U openai
npm install openai

Bước 3: Gửi yêu cầu đầu tiên

Dùng /v1/responses cho các tích hợp mới, đặc biệt khi quy trình sau này sẽ thêm công cụ hoặc đầu ra có cấu trúc.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    timeout=120.0,
    max_retries=2,
)

response = client.responses.create(
    model="gpt-6-astra",
    input="Give three practical ways to reduce API latency.",
    reasoning={"effort": "medium"},
)

if response.status != "completed":
    raise RuntimeError(f"Unexpected status: {response.status}")

print(response.output_text)

Bước 4: Kiểm thử trước khi đưa vào sản xuất

Chạy các nhiệm vụ tiêu biểu qua cả tuyến ứng viên và dự phòng. Ghi nhận tỷ lệ nhiệm vụ được chấp nhận, độ trễ, số lần thử lại, token đầu vào và đầu ra, lỗi công cụ và thời gian chỉnh sửa của con người. Chỉ thăng cấp Astra tại nơi kết quả cải thiện kinh tế hoàn thành thực tế của quy trình.

Đừng coi một prompt demo thành công là xác thực sản xuất. Bao gồm đầu vào mơ hồ, lỗi công cụ, thiếu dữ liệu và yêu cầu chạy lâu trong bộ kiểm thử.

Cách chọn mức độ suy luận

Các mức được hỗ trợ là low, medium, high, xhighmax. Dùng mức thấp nhất đáp ứng ổn định tiêu chí chấp nhận của bạn.

EffortĐiểm khởi đầu thực tiễn
lowPhân loại, viết lại và trích xuất đơn giản
mediumPhát triển, phân tích chung và hầu hết đánh giá ban đầu
highGỡ lỗi phức tạp, kiến trúc và tổng hợp đa nguồn
xhighNghiên cứu khó và công việc lập trình dài, nhiều giai đoạn
maxMột số ít nhiệm vụ khó nhất sau đánh giá

Cách dùng đầu vào hình ảnh

Dùng URL hình ảnh có thể truy cập hoặc tệp tải lên được hỗ trợ. Kết hợp hình ảnh với một nhiệm vụ kiểm tra cụ thể thay vì yêu cầu mô tả chung chung.

vision = client.responses.create(
    model="gpt-6-astra",
    input=[{
        "role": "user",
        "content": [
            {"type": "input_text", "text": "Identify one UI defect and propose a fix."},
            {"type": "input_image", "image_url": os.environ["SCREENSHOT_URL"]}
        ]
    }]
)

print(vision.output_text)

Cách dùng đầu ra có cấu trúc và stream phản hồi

Đầu ra có cấu trúc cung cấp hợp đồng có thể đọc máy; streaming cải thiện cảm nhận về độ phản hồi. Chúng giải quyết các vấn đề khác nhau và có thể dùng cùng nhau. Sự kiện vòng đời và text delta nên được xử lý riêng.

stream = client.responses.create(
    model="gpt-6-astra",
    input="Create a deployment checklist.",
    stream=True,
)

completed = False
for event in stream:
    if event.type == "response.output_text.delta":
        print(event.delta, end="", flush=True)
    elif event.type == "response.completed":
        completed = True
    elif event.type in {"response.failed", "response.incomplete", "error"}:
        raise RuntimeError(event.type)

if not completed:
    raise RuntimeError("Stream closed before completion")

Cách duy trì hội thoại có trạng thái

Để lịch sử có thể di chuyển, gửi lại các mục đầu vào của người dùng và đầu ra của model cần cho lượt tiếp theo. Nơi nhà cung cấp hỗ trợ, previous_response_id có thể tham chiếu tới một phản hồi đã lưu.

history = [{"role": "user", "content": "Give three latency improvements."}]
history.extend(
    item.model_dump(exclude={"id"}, exclude_none=True)
    for item in response.output
)
history.append({"role": "user", "content": "Turn them into a checklist."})

follow_up = client.responses.create(
    model="gpt-6-astra",
    input=history,
)
print(follow_up.output_text)

Cách dùng gọi hàm

Một vòng lặp hàm hoàn chỉnh có bốn phần: định nghĩa schema, nhận lệnh gọi công cụ, thực thi trong ứng dụng của bạn và trả về mục function_call_output với call_id gốc. Giữ quyền công cụ ở mức tối thiểu và xác thực mọi tham số trước khi thực thi.

import json

history = [{"role": "user", "content": "Check order A-1042."}]
turn = client.responses.create(model="gpt-6-astra", input=history, tools=tools)
history.extend(item.model_dump(exclude={"id"}, exclude_none=True) for item in turn.output)

for item in turn.output:
    if item.type == "function_call" and item.name == "get_order_status":
        args = json.loads(item.arguments)
        tool_result = {"order_id": args["order_id"], "status": "shipped"}
        history.append({
            "type": "function_call_output",
            "call_id": item.call_id,
            "output": json.dumps(tool_result),
        })

final = client.responses.create(model="gpt-6-astra", input=history, tools=tools)
print(final.output_text)

Cách dùng gọi công cụ bất đồng bộ

Gọi công cụ bất đồng bộ cho phép Astra tiếp tục công việc độc lập trong khi một hàm hoặc công cụ tùy chỉnh chạy lâu đang chờ. Đặt async: true trong định nghĩa công cụ, giữ call_id gốc, và trả kết quả khi công việc bên ngoài hoàn tất. Ứng dụng của bạn vẫn chịu trách nhiệm cho hàng đợi công việc, chính sách timeout, tính idempotent và khôi phục.

Đừng gửi lại cùng một công việc chạy lâu chỉ vì cửa sổ polling hết hạn. Lưu ID công việc và tiếp tục truy xuất.

Cách nhắc lệnh GPT-6 Astra API

Hướng dẫn nhắc lệnh của OpenAI nhấn mạnh tính chủ động, ưu tiên chỉ dẫn, phong cách, ủy quyền và xác minh hiệu chỉnh. Một prompt sản xuất hữu ích nên nêu nhiệm vụ, tài nguyên sẵn có, phép thử hoàn thành, ranh giới, định dạng mong đợi và cách xử lý thông tin thiếu.

Thành phần promptCần chỉ rõ
Nhiệm vụKết quả cụ thể cần tạo
Tài nguyênTệp, công cụ, dữ liệu và ngữ cảnh có thể dùng
Phép thử hoàn thànhĐiều kiện để coi là xong
Ranh giớiHành động được phép, bị cấm hoặc cần phê duyệt
Phong cách và định dạngĐộ dài, cấu trúc, giọng điệu và schema đầu ra
Bất địnhĐiều gì có thể suy đoán và điều gì phải làm rõ
Xác minhCần kiểm tra gì và khi nào dừng kiểm tra
Task: Review this API design and identify the three highest-impact migration risks.
Resources: Use the attached schema and deployment notes.
Completion test: Return three risks, evidence for each, and one acceptance test per risk.
Boundaries: Do not change production systems. Infer routine implementation details.
Clarification rule: Ask only if a missing requirement would materially change the result.
Style: Use concise prose and a final three-row table.
Verification: Check that every risk has an executable acceptance test.

Điểm chuẩn GPT-6 Astra: Điểm cao hơn, ít token hơn

Các đánh giá công khai hữu ích nhất khi đọc cùng chất lượng và kinh tế nhiệm vụ. Các điểm số dưới đây cho thấy nơi Astra tăng mạnh; mức tiết kiệm được báo cáo là ước lượng theo cấu hình, không phải bảo đảm cho mọi khối công việc.

Đánh giá công bốAstraSolKhác biệt
AutomationBench41,4%18,1%+23,3 điểm
OSWorld 2.072,6%65,7%+6,9 điểm
Terminal-Bench 4.057,9%37,3%+20,6 điểm
MRCR v2, 512K-1M96,3%73,8%+22,5 điểm

Cách sử dụng GPT-6 Astra API: Hướng dẫn đầy đủ cho nhà phát triển

Biểu đồ AutomationBench chính thức của OpenAI: độ chính xác so với chi phí API ước tính.

So sánh chi phí trên mỗi nhiệm vụCấu hình chất lượngTiết kiệm chi phí API so với Sol
DeepSWE v1.174,1% vs 72,7%; cấu hình điểm cao nhấtKhoảng 32%
Database migration63,4% vs 42,7%; thiết lập Astra chi phí thấpKhoảng 38%
Terminal-Bench 4.057,9% vs 37,3%; cấu hình được báo cáoKhoảng 9%

Kết nối với định giá là hai chiều. Thứ nhất, ít token đầu ra và ít lần thất bại có thể giảm chi phí API ước tính trên mỗi nhiệm vụ hoàn thành ngay cả khi Astra có giá token cao hơn. Thứ hai, mức giá được liệt kê của CometAPI thấp hơn 20% so với mức của nhà cung cấp tương ứng. Đây là hai hiệu ứng riêng: đừng cộng các tỷ lệ phần trăm lại với nhau, và đừng giả định mức tiết kiệm trong benchmark sẽ lặp lại trong sản xuất.

Định giá GPT-6 Astra API

Định giá đo theo triệu token. Khi đầu vào vượt 272K token, lịch ngữ cảnh dài áp dụng cho toàn bộ yêu cầu.

Định giá hiện tạiCometAPI ngữ cảnh ngắnCometAPI ngữ cảnh dàiOpenAI Standard
Đầu vào$8$16$10 ngắn / $20 dài
Đọc cache$0.80$1.60$1 ngắn / $2 dài
Ghi cache$10$20$12.50 ngắn / $25 dài
Đầu ra$40$60$50 ngắn / $75 dài

Giá và chính sách cổng có thể thay đổi. Xác minh cấu hình giá trực tiếp trước khi lập ngân sách hoặc mã hóa cứng mức giá.

Cách giảm chi phí API

  • Giữ tiền tố ổn định thân thiện với cache. Đặt chỉ dẫn chung và schema công cụ trước nội dung theo yêu cầu.
  • Tránh vượt 272K ngoài ý muốn. Chỉ truy xuất và khử trùng lặp ngữ cảnh có thể thay đổi câu trả lời.
  • Dùng mức suy luận thấp nhất vượt qua. Chỉ tăng khi tỷ lệ chấp nhận cải thiện.
  • Định tuyến lưu lượng dễ ở nơi khác. Dành Astra cho công việc hưởng lợi từ độ tin cậy hoàn thành.
  • Đo chi phí trên mỗi nhiệm vụ được chấp nhận. Bao gồm thử lại, phí công cụ và chi phí hóa việc duyệt của con người.

Cách di chuyển sang GPT-6 Astra

Khi chuyển từ GPT-5.6 Sol, thực hiện thay đổi nhỏ nhất tương thích và chạy lại cùng bộ đánh giá.

  1. Đặt model thành gpt-6-astra.
  2. Nếu tuyến cũ dùng suy luận none hoặc minimal, bắt đầu ở low.
  3. Dùng Responses cho quy trình gọi công cụ.
  4. Gỡ thông số sampling không hỗ trợ: temperature, top_ptop_logprobs; gỡ logprobs của Chat Completions.
  5. Kiểm thử lại đầu ra có cấu trúc, cache, streaming, vòng lặp công cụ và hành vi đặc thù nhà cung cấp.
  6. So sánh tỷ lệ nhiệm vụ được chấp nhận, độ trễ, thử lại, token và chỉnh sửa của con người trước khi đổi tuyến mặc định.
prompt = "Review this API design and identify migration risks."

baseline = client.responses.create(
    model="gpt-5.6-sol",
    input=prompt,
)

candidate = client.responses.create(
    model="gpt-6-astra",
    input=prompt,
    reasoning={"effort": "medium"},
)

Khi nào nên dùng GPT-6 Astra?

Dùng Astra khi thất bại nhiệm vụ gây tốn kém và quy trình kết hợp suy luận với công cụ, ngữ cảnh dài hoặc thực thi nhiều giai đoạn.

  • Gỡ lỗi ở quy mô kho lưu trữ, di trú và vòng lặp kiểm thử-và-thử lại.
  • Tác tử trình duyệt hoặc sử dụng máy tính.
  • Nghiên cứu chuyên sâu qua nhiều nguồn và công cụ.
  • Phân tích tài liệu rất dài hoặc mã nguồn lớn.
  • Quy trình khoa học và kỹ thuật dùng mã hoặc phần mềm bên ngoài.
  • Tự động hóa chuyên nghiệp nơi một lần chạy thất bại tạo chi phí phục hồi đáng kể.

Dùng tuyến rẻ hơn cho viết lại đơn giản, tóm tắt ngắn, phân loại và trích xuất thường lệ khi nó đã đáp ứng mục tiêu chất lượng.

Lỗi API thường gặp

401 Lỗi xác thực

Xác nhận yêu cầu gửi Authorization: Bearer <COMETAPI_KEY> và tiến trình đọc đúng biến môi trường.

400 Yêu cầu không hợp lệ

Kiểm tra tham số sampling không hỗ trợ, schema không hợp lệ hoặc giá trị suy luận không hỗ trợ như none.

404 Lỗi model hoặc endpoint

Xác nhận model="gpt-6-astra" và tuyến /v1/responses.

429 Giới hạn tốc độ

Dùng backoff lũy thừa với jitter và số lần thử lại giới hạn.

1 s -> 2 s -> 4 s -> 8 s -> capped retry window

5xx Lỗi máy chủ

Thử lại lỗi máy chủ tạm thời, nhưng đừng thử lại yêu cầu 4xx sai định dạng mà không thay đổi. Ghi log định danh yêu cầu mà không lưu trữ không cần thiết nội dung prompt nhạy cảm.

Câu hỏi thường gặp

Nên dùng model ID nào?

Dùng gpt-6-astra.

Nên dùng Responses API hay Chat Completions?

Dùng Responses cho các tích hợp mới, đặc biệt cho công cụ, đầu ra có cấu trúc, streaming, trạng thái và quy trình tác tử. Giữ Chat Completions chỉ khi yêu cầu tương thích biện minh.

Nên bắt đầu với mức suy luận nào?

Bắt đầu với medium, sau đó đánh giá low cho lưu lượng thường lệ và high hoặc cao hơn cho nhiệm vụ hưởng lợi đo lường được từ suy luận sâu hơn.

Astra có nhận hình ảnh không?

Có. Nó nhận đầu vào văn bản và hình ảnh và trả đầu ra văn bản.

Tuyến CometAPI luôn rẻ hơn 20% trên mỗi nhiệm vụ hoàn thành?

Không. Mức giá token niêm yết thấp hơn 20% so với nhà cung cấp tương ứng, nhưng tổng chi phí nhiệm vụ còn phụ thuộc vào kích thước ngữ cảnh, độ dài đầu ra, gọi công cụ, thử lại và công sức duyệt.

Astra có nên thay thế Sol ở mọi nơi?

Không. Sol vẫn là lựa chọn chi phí thấp cho nhiều khối công việc có giới hạn. Dùng Astra nơi thực thi mạnh hơn, độ tin cậy ngữ cảnh dài hoặc ít lần thất bại hơn thay đổi kinh tế tổng thể.

Kết luận

Astra giá trị nhất khi một cuộc gọi API là một bước trong quy trình khó thay vì điểm kết thúc. Ngữ cảnh dài, năm mức suy luận, đầu ra có cấu trúc, streaming, gọi hàm và các kiểm soát tác tử mới cho phép nhà phát triển có nhiều cách hơn để đưa công việc phức tạp đến hoàn thành.

Bắt đầu với Responses, suy luận medium, tiêu chí hoàn thành rõ ràng và quyền truy cập công cụ tối thiểu cần thiết. Đo tỷ lệ nhiệm vụ được chấp nhận và chi phí trên mỗi nhiệm vụ được chấp nhận, sau đó chỉ tăng mức suy luận hoặc định tuyến nhiều lưu lượng hơn sang Astra khi bằng chứng ủng hộ.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 9, 2026
Cập nhật lần cuối Sep 9, 2026
12 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm