摘要
CometAPI 中的 GPT-6 Astra API 最適合結合理解推理、程式碼、瀏覽器或電腦操作,以及多個外部工具的高難度代理工作流程。它是高階模型,團隊應將其保留用於那些較高完成率足以抵消較高權杖價格的任務。
實務設計模式是一個帶有明確工具、應用端權限、驗證、預算與對重大操作需人工核准的執行迴圈。從 Responses API 起步,量測每個被接受任務的成本,並將常規子任務導向成本更低的模型。
關鍵重點
- Astra 瞄準端到端的專業工作,而非孤立的文字生成。
- 報告顯示其最大提升集中在電腦使用、終端機任務、自動化、科學推理與多步專業工作流程。
- 非同步工具呼叫、中途導引與動態推理更新讓長時代理迴圈更具彈性。
- 模型支援 1.05 百萬權杖的情境視窗,但仍需檢索與狀態管理。
- 生產品質取決於權限、冪等性、驗證、可觀測性,以及在提示之外的評估。
Astra API 是什麼?哪些代理工作負載適合?
OpenAI 將 Astra 描述為其在複雜推理、程式設計、電腦使用、研究與文件創作方面最強的模型。官方規格提供1,050,000 權杖的情境與 128,000 權杖的輸出上限。接受文字與影像作為輸入,而文字是原生輸出形式。
OpenAI GPT-6 Astra 發佈視覺圖
| 官方 Astra 規格 | 數值 | 為何對代理重要 |
|---|---|---|
| Model ID | gpt-6-astra | 用於 API 請求的穩定識別子 |
| Context window | 1,050,000 tokens | 大型版本庫、文件與執行歷程 |
| Maximum output | 128,000 tokens | 長篇報告、程式碼與結構化產物 |
| Knowledge cutoff | April 30, 2026 | 仍需透過檢索工具以獲取最新資訊 |
| Reasoning effort | low, medium, high, xhigh, max | 允許以任務層級控制推理深度 |
| Input modalities | Text and images | 支援文件與視覺-電腦工作流程 |
| Core features | Streaming, function calling, Structured Outputs | 促成具型別且可觀測的編排 |
| Responses API tools | Web search, file search, code interpreter, hosted shell, computer use, MCP, tool search | 涵蓋檢索、執行與介面操作 |
| Fine-tuning | Not supported | 行為必須由提示、工具與應用程式邏輯控制 |
大型情境視窗降低了拆分每個輸入的需求,但不應將其視為記憶系統。耐久事實、檢索證據、暫時執行狀態與工具輸出應分離保存,讓代理僅接收目前決策所需的內容。
GPT-6 Astra 代理基準測試
最有用的評估是那些需要軟體操作、終端機工作、視覺互動或完成專業工作流程的任務。OpenAI 報告的結果顯示,在以執行為主的任務上提升更大,較之廣泛智慧指標。
| 官方基準來源 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | 結果 |
|---|---|---|---|---|
| AutomationBench | 41.4% | 18.1% | 31.4% | Astra 領先 Sol 23.3 個百分點 |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | Astra 比 Sol 高 20.6 點,較 Fable 高 2.1 點 |
| FrontierMath Tier 4 v2 | 97.6% | 83.0% | 87.8% | Astra 領先比較模型 |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 在廣泛科學推理上的優勢較小 |
| OSWorld 2.0 | 72.6% | 65.7% | — | 在視覺-電腦任務完成上更強 |
| ScreenSpot-Pro | 92.7% | 76.9% | — | 較 Sol 提升 15.8 點 |
| Database migration tasks | 63.9% | 42.7% | 57.8% | 在完成的營運性工作中展現最強價值 |
在所有三個模型均有報告分數的基準行上,GPT-6 Astra 皆領先 GPT-5.6 Sol 與 Claude Fable 5.1。其對 Claude Fable 5.1 最小的領先為 Terminal-Bench 4.0 的 2.1 個百分點,而較大的優勢出現在 AutomationBench、FrontierMath Tier 4 v2、GPQA Diamond 與資料庫遷移任務。OpenAI 亦報告在 OSWorld 對比中模擬任務時間減少 47%,當代理延遲影響業務吞吐量時尤為重要。
使用基準結果來挑選待測工作負載。最終決策應依據由你自家工具、權限、失敗模式與驗收標準組成的評估集做出。
哪些 Astra 功能會改變代理架構?
GPT-6 Astra 非同步工具呼叫
非同步工具呼叫允許模型在應用程式執行緩慢操作期間,繼續有用的推理、呼叫彼此獨立的工具,或回答請求中不相關的部分。應用程式仍須執行工具,並以原始呼叫 ID 回傳其結果。
當工作流程同時查詢資料倉儲、等待渲染作業、檢查多個 API,並準備報告時很有用。獨立動作可並行推進,而不必讓整個代理迴圈等待。
GPT-6 Astra 中途導引
中途導引與推理更新允許應用程式在工作進行中新增指示,或在不重寫原始提示前綴的情況下改變推理力度。這支援在長時間運行的工作中進行修正與重設優先順序。
GPT-6 Astra 的結構化工具設計
函式呼叫與 Structured Outputs 為工具提供具名操作與型別化參數。模型提出動作建議,而應用程式在執行前驗證權限、綱要、預算與商務規則。相較於要求模型用自然語言表達寫入操作,此分離更可靠。
應如何設計 Astra 代理?
傳統的語言模型請求遵循短路徑:提示 → 模型 → 答案。代理需要可觀測的迴圈:
目標 → 情境選擇 → 規劃 → 工具選擇 → 授權動作 → 觀察 → 驗證 → 完成或升級
每個轉換都可能失敗:錯誤的工具選擇、不合格的參數、誤解的輸出、重複動作、未授權寫入、預算超支或過早完成。因此,外圍應用程式必須掌握執行權與驗證。
| 層級 | 責任 | 控制 |
|---|---|---|
| 模型 | 詮釋目標、推理、選擇工具與綜合結果 | 提示與工具描述 |
| 編排器 | 執行工具、維持狀態、重試暫時性失敗並停止迴圈 | 決定性的應用程式邏輯 |
| 政策層 | 授權動作並強制限制 | 權限、預算與核准閘道 |
| 驗證器 | 檢查證據與完成條件 | 規則、測試、評分器或人工審核 |
| 可觀測性 | 記錄執行軌跡 | 追蹤 ID、日誌、度量與稽核紀錄 |
如何透過 CometAPI 呼叫 Astra API?
CometAPI 中的 GPT-6 Astra API 透過與 OpenAI 相容的 Responses 工作流使用模型 ID gpt-6-astra。在送出第一個請求前,完成以下設定:
- 建立 CometAPI 帳戶,啟用 GPT-6 Astra 存取權,並產生 API 金鑰。
- 使用
pip install --upgrade openai安裝或升級 OpenAI Python SDK。 - 將金鑰與 OpenAI 相容的基底 URL 存入
COMETAPI_KEY與COMETAPI_BASE_URL;切勿在生產中硬編碼機密。 - 確認工作區已啟用 Responses 端點與
gpt-6-astra模型 ID,然後執行下方範例。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url=os.environ["COMETAPI_BASE_URL"],
)
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
input=(
"Analyze this operational incident. Identify the probable root cause, "
"propose a remediation plan, and separate confirmed facts from assumptions."
),
)
print(response.output_text)
成功的首次整合應回傳一個回應物件與可讀的 output_text。在生產中,加入明確的逾時設定、僅重試暫時性失敗,並記錄請求 ID、模型、延遲、權杖用量與最終工作流狀態。
如何打造可呼叫工具的 Astra 代理?
以下範例將讀取工具與具影響的寫入工具分離。模型可以請求退款,但應用程式碼仍必須驗證授權與資格。
tools = [
{
"type": "function",
"name": "get_order",
"description": "Read an order. This tool has no side effects.",
"parameters": {
"type": "object",
"properties": {"order_id": {"type": "string"}},
"required": ["order_id"],
"additionalProperties": False,
},
},
{
"type": "function",
"name": "check_refund_eligibility",
"description": "Check eligibility without issuing a refund.",
"parameters": {
"type": "object",
"properties": {"order_id": {"type": "string"}},
"required": ["order_id"],
"additionalProperties": False,
},
},
{
"type": "function",
"name": "create_refund_request",
"description": "Create a request after authorization and eligibility checks.",
"parameters": {
"type": "object",
"properties": {
"order_id": {"type": "string"},
"reason": {"type": "string"},
},
"required": ["order_id", "reason"],
"additionalProperties": False,
},
},
]
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
tools=tools,
input=(
"Order A18422 arrived damaged. Determine whether a refund is allowed. "
"Do not create a request until eligibility has been verified."
),
)
``````python
import json
def execute_tool(name, arguments):
if name == "get_order":
return get_order(**arguments)
if name == "check_refund_eligibility":
return check_refund_eligibility(**arguments)
if name == "create_refund_request":
assert_user_is_authorized()
assert_refund_is_eligible(arguments["order_id"])
return create_refund_request(**arguments)
raise ValueError(f"Unknown tool: {name}")
while True:
calls = [item for item in response.output if item.type == "function_call"]
if not calls:
break
outputs = []
for call in calls:
result = execute_tool(call.name, json.loads(call.arguments))
outputs.append({
"type": "function_call_output",
"call_id": call.call_id,
"output": json.dumps(result),
})
response = client.responses.create(
model="gpt-6-astra",
previous_response_id=response.id,
tools=tools,
input=outputs,
)
print(response.output_text)
模型提出建議動作。應用程式擁有執行權。寫入工具必須獨立強制執行權限、限制、冪等性與政策條件。
如何使用 Astra 自動化長時工作流程?
生產級研究代理應接收結構化目標,而非模糊的「研究多家公司」指示。
{
"objective": "Create a competitor launch brief",
"companies": ["Competitor A", "Competitor B", "Competitor C"],
"required_fields": [
"latest product",
"launch date",
"price",
"key differentiators",
"primary sources"
],
"output": "executive brief"
}
- 定義目標。 設定必填欄位、輸出格式、期限與驗收標準。
- 檢索證據。 使用網頁搜尋、檔案搜尋、資料庫或透過 MCP 連結的系統以獲取最新資訊。
- 驗證證據。 標注一手來源、二手來源、推論、衝突與缺失資料。
- 升級不確定性。 當信心低於需求門檻時,請求更多證據或人工判斷。
- 產出並驗證產物。 在宣告完成前檢查每個必填欄位。
此設計讓證據處理可稽核,並使模型推理與系統的驗收規則分離。
何時應讓 Astra 代理使用電腦自動化?
優先選擇最具結構的介面:資料庫或查詢介面,其次是 API,再來是 MCP 或其他具型別工具,最後才是瀏覽器或電腦操作。結構化介面提供穩定欄位、可預期錯誤、驗證與可機器讀取的輸出。
當缺乏可用 API、必須操作傳統應用、工作流程依賴視覺檢查,或代理必須測試真實使用者介面時,電腦自動化是適切的。Astra 在 ScreenSpot-Pro 92.7% 與 OSWorld 2.0 72.6% 的結果支援其用於視覺互動,但這些工作流程仍需受控環境與明確政策。
如何讓 Astra 代理在生產中安全運作?
代理安全主要是應用架構問題。OpenAI 將 Astra 放在關鍵網路安全能力門檻,因此邊界存取與可稽核性更加重要。
分離讀與寫工具
在適當情況下,使讀取操作廣泛可用,但對寫入要求更嚴格的檢查。避免一個同時能檢視與改動敏感系統的通用工具。
對重大操作要求核准
對刪除資料、對外發布、修改生產環境、授權權限、匯款、取消帳戶或其他高影響交易使用核准閘道。
讓每個寫入具冪等性
付款、退款、訊息與帳戶更新應接受冪等鍵,以避免重試造成重複副作用。
在提示之外強制預算
在程式碼中追蹤權杖、工具呼叫、金額、牆鐘時間與工作流程步驟的預算。達到限制時以決定性方式終止。
記錄執行軌跡
記錄目標、模型、推理設定、所選工具、參數、結果、授權結果、核准事件、錯誤、重試、權杖用量與最終狀態。
Astra API 定價
官方 Standard 費率為標準情境層級的輸入 $10/M、輸出 $50/M。超過 272K 輸入權杖的請求,將以更高的長情境費率計費。
| 定價層級 | OpenAI Standard | CometAPI 定價 |
|---|---|---|
| 短情境輸入 | $10/M | $8/M |
| 短情境輸出 | $50/M | $40/M |
| 快取輸入 | $1/M | $0.80/M |
| 快取寫入 | $12.50/M | $10/M |
| 長情境輸入 | $20/M | $16/M |
| 長情境輸出 | $75/M | $60/M |
僅看權杖單價無法描述代理經濟。使用以下作業度量:
每個被接受任務的成本
= model tokens + tool charges + retries + infrastructure + human correction,除以正確完成的任務數。
Astra 與其他代理模型的比較
| 維度 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| Context | 1.05M | 1.05M | 1M | 1M |
| Maximum output | 128K | 128K | 128K | 64K |
| 主要強項 | 困難的端到端代理工作 | 成本較低的前沿推理 | 高階長周期代理 | 高量多模態工作流程 |
| 影像輸入 | Yes | Yes | Yes | Yes |
| 音訊與影片輸入 | No | No | No | Yes |
| AutomationBench | 41.4% | 18.1% | 31.4% | — |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 19.1% |
| CometAPI input rate | $8/M | $3.20/M | $8/M | $0.60/M |
| CometAPI output rate | $40/M | $16/M | $40/M | $3/M |
| 最佳適配 | 高價值且困難的自動化 | 注重成本的 OpenAI 代理 | 長時高階代理 | 注重成本的多模態代理 |
當困難的多步執行是瓶頸時,Astra 是最強選擇。當現有工作流程已可靠完成時,Sol 在經濟性上更契合。Fable 在高階長周期工作上仍具競爭力,而 Gemini 則在高量多模態應用中提供不同的成本與模態配置。
實務系統可依任務複雜度進行路由,而非為每個請求選一個模型。
選擇 GPT-6 Astra:成本最佳化與適用時機
- 依量測到的複雜度路由。使用有評估支撐的路由器,將 GPT-6 Astra 保留給需要更深推理、工具使用或高失敗成本而需升級的任務。
- 快取穩定前綴。重用不隨請求改變的政策、綱要與文件。
- 檢索相關情境。不要因為有百萬權杖視窗就把它填滿。
- 限制代理步數。在執行開始前定義完成與停止條件。
- 調整推理力度。對可預期的子任務使用低或中等,僅在歧義或驗證失敗正當化成本時提高。
- 並行執行獨立工具。降低牆鐘延遲而不增加不必要的模型回合。
- 套用最終決策規則。將 GPT-6 Astra 用於困難推理結合長周期執行、軟體工程、電腦操作、多個外部工具、專業產物創建,或失敗成本高的情境。對分類、擷取、標註、常規摘要與延遲敏感的低價值請求使用成本更低的模型——除非評估顯示 Astra 明顯降低每個被接受任務的成本。
哪些生產指標對 Astra 代理重要?
| 指標 | 解答的問題 |
|---|---|
| 任務完成率 | 工作流程是否真的完成? |
| 首次成功率 | 是否無需修復或重試就完成? |
| 工具選擇準確度 | 模型是否選擇了正確操作? |
| 參數有效性 | 工具參數是否有效? |
| 人工介入率 | 需要人員挽救的頻率? |
| 未授權動作率 | 是否嘗試了超出政策的動作? |
| 每個被接受任務的成本 | 正確自動化的實際成本是多少? |
| P50 與 P95 完成時間 | 端到端延遲有多可預期? |
| 驗證失敗率 | 代理錯誤宣稱成功的頻率? |
主要的生產度量是正確、安全且在預算內完成的工作比例。
常見問題
Astra 的模型 ID 是什麼?
模型 ID 為 gpt-6-astra。
Astra 是否支援函式呼叫?
是。它支援函式呼叫與 Structured Outputs。工具呼叫應使用 Responses API。
Astra 是否支援 MCP?
是。MCP 包含在其 Responses API 工具之中。
Astra 能控制電腦嗎?
是。支援電腦使用,但應用程式必須提供受控環境、政策邊界與驗證。
什麼是非同步工具呼叫?
它允許模型在應用程式執行緩慢的非同步工具呼叫時,持續進行有用工作。
什麼是中途導引?
它允許應用程式在任務進行中送出更新指示。
Astra 的情境視窗有多大?
支援 1,050,000 權杖的情境以及最多 128,000 權杖的輸出。
Astra 的成本是多少?
OpenAI Standard 定價在標準情境層級下的輸入為 $10/M、輸出為 $50/M。閘道供應商與情境層級可能有不同價格。
是否每個代理都應使用 Astra?
否。當較高完成率能抵銷其較高價格時再選用。對可預期、高量的子任務路由到成本更低的模型。
我能透過 CometAPI 建立 Astra 代理嗎?
可以。CometAPI 提供與 OpenAI 相容的 Responses 工作流。在導入生產流量前,驗證應用程式所需的每個工具與參數。
