GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
ai-model/Nghiên cứu CometAPI

Các điểm chuẩn GPT-6 Astra: Những con số thực sự nói lên điều gì

请提供需要翻译的原文内容(支持 HTML/Markdown/JSON/XML/代码等),并注明目标语言(默认 Tiếng Việt)。本助手不提供原创分析,仅在严格保持原始结构与技术元素不变的前提下进行翻译。

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 14, 2026 25 phút đọc
Các điểm chuẩn GPT-6 Astra: Những con số thực sự nói lên điều gì
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Tóm tắt

GPT-6 Astra đạt điểm tiêu đề xuất sắc; mức tăng lớn nhất xuất hiện khi suy luận phải chuyển hóa thành hành động: thao tác terminal, sử dụng phần mềm, tự động hóa, truy hồi trong ngữ cảnh dài, quy trình khoa học và an ninh mạng. Trên các bài kiểm tra học thuật đã gần bão hòa, mức cải thiện so với thế hệ OpenAI trước đó thường nhỏ hơn.

Mô hình kết hợp cửa sổ ngữ cảnh 1,050,000 token với hỗ trợ công cụ phong phú. Các benchmark thực thi do OpenAI công bố cho thấy nâng cấp thực tế mạnh nhất trong công việc có tầm nhìn dài; tuy nhiên thiết kế harness, mức nỗ lực suy luận, độ trễ và quyền truy cập công cụ ảnh hưởng đáng kể tới kết quả.

Điểm rút ra chính

  • Lợi thế rõ ràng nhất của Astra nằm ở thực thi dạng tác nhân, không phải mọi hình thức hỏi–đáp.
  • Kết quả Terminal-Bench, AutomationBench, computer-use và di trú cơ sở dữ liệu cho thấy mức dịch chuyển lớn hơn đáng kể so với GPQA hay DeepSWE.
  • Kết quả ARC-AGI-3 chứng minh trạng thái mô hình, quản lý ngữ cảnh và harness đánh giá có thể chi phối điểm cuối cùng.
  • Cửa sổ ngữ cảnh lớn chỉ có ý nghĩa khi thông tin vẫn truy hồi được gần ngưỡng; MRCR có giá trị thông tin hơn so với chỉ quảng bá về sức chứa.
  • Giá token cao hơn không tự động đồng nghĩa với chi phí tác vụ cao hơn nếu mô hình cần ít token, ít lượt, ít thử lại hoặc ít sửa của con người.
  • Quyết định triển khai nên so sánh đồng thời tỷ lệ thành công, thời gian trôi qua, tổng chi phí, độ tin cậy công cụ và gánh nặng chỉnh sửa.

Tổng quan nhanh về GPT-6 Astra

OpenAI chỉ định tối đa 128,000 token đầu ra, đầu vào văn bản và hình ảnh, đầu ra văn bản, và mức nỗ lực suy luận từ thấp tới tối đa. Các thông số này cho phép quy trình lớn, nhiều bước; nhưng chúng không chứng minh mô hình sẽ truy hồi đúng bằng chứng hay hoàn thành tác vụ một cách đáng tin cậy.

Thông số chính thứcGPT-6 Astra trong CometAPIÝ nghĩa thực tiễn
Model IDgpt-6-astraĐịnh danh ổn định dùng định tuyến API
Context window1,050,000 tokensHỗ trợ kho lớn, lưu trữ và lịch sử tác nhân
Maximum output128,000 tokensCho phép báo cáo, bản vá và tạo phẩm có cấu trúc lớn
Knowledge cutoffApril 30, 2026Sự kiện sau đó cần công cụ hoặc nguồn cung cấp
InputText and imagesHỗ trợ tài liệu, ảnh chụp màn hình, sơ đồ và chứng cứ hỗn hợp
OutputTextSản sinh văn bản, mã và văn bản có cấu trúc
Reasoning effortlow, medium, high, xhigh, maxĐánh đổi độ trễ và chi phí để tìm kiếm sâu hơn
Agent capabilitiesFunction calling, structured outputs, computer use, web/file search, hosted shell, Apply Patch, MCPCho phép quy trình đầu-cuối thay vì câu trả lời đơn lẻ
OpenAI Standard input$10 per million tokensKích thước đầu vào và tái sử dụng bộ nhớ đệm ảnh hưởng tổng chi
OpenAI cached input$1 per million tokensÁp dụng khi tiền tố prompt được dùng lại từ cache
OpenAI cache writes$12.50 per million tokensTính phí ở mức 1.25× so với đầu vào không cache
OpenAI Standard output$50 per million tokensĐầu ra dài có thể chi phối chi phí tác vụ
Requests above 272K input tokensInput and cache rates ×2; output rate ×1.5Mức giá cao hơn áp dụng cho toàn bộ yêu cầu

Giới hạn ngữ cảnh đo sức chứa, không đo khả năng ghi nhớ hữu dụng. Danh sách công cụ đo tính sẵn có, không đo khả năng thực thi thành công. Cần benchmark để kiểm chứng các thông số đó có chuyển hóa thành công việc hoàn thành hay không.

Các kết quả benchmark của GPT-6 Astra cho thấy điều gì?

Danh mục kết quả thể hiện một mẫu hình không đồng đều. Astra chỉ nhích nhẹ so với Sol trên một số bài kiểm tra học thuật và lý luận phần mềm, nhưng lại tăng hai chữ số ở công việc terminal, tự động hóa, di trú cơ sở dữ liệu, tương tác thị giác, truy hồi ngữ cảnh dài và toán học nâng cao.

Benchmark đã công bốGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Astra so với Sol
Terminal-Bench 4.057.9%37.3%55.8%+20.6 pp
DeepSWE v1.174.1%72.7%67.4%+1.4 pp
Database Migration Tasks63.9%42.7%57.8%+21.2 pp
OSWorld 2.072.6%65.7%+6.9 pp
ScreenSpot-Pro92.7%76.9%+15.8 pp
AutomationBench41.4%18.1%31.4%+23.3 pp
BenchCAD95.9%83.3%84.3%+12.6 pp
FrontierMath Tier 4 v297.6%83.0%87.8%+14.6 pp
GPQA Diamond96.0%94.6%93.7%+1.4 pp
MRCR v2, 512K–1M96.3%73.8%+22.5 pp
AA Intelligence Index v4.1.161.260.965.7+0.3
ARC-AGI-3, Provider Adapter99.9%7.8%+92.1 pp

Ba cụm nổi lên. Thứ nhất, các khoảng cách 1.4 điểm ở DeepSWE và GPQA chỉ ra mức dịch chuyển hạn chế trên các tác vụ nơi mô hình mạnh đã làm tốt. Thứ hai, mức tăng trên 20 điểm ở Terminal-Bench, AutomationBench, di trú cơ sở dữ liệu và truy hồi hàng triệu token cho thấy thay đổi thực thi lớn hơn nhiều. Thứ ba, ARC-AGI-3 là ngoại lệ mà cách diễn giải phụ thuộc vào harness.

Kết quả thử nghiệm độc lập

Artificial Analysis báo cáo Astra và Sol đều khoảng 61 trên Intelligence Index, đồng thời cho thấy mức tăng rõ rệt hơn trên Coding Agent Index. Điều này độc lập củng cố mẫu hình từ dữ liệu của OpenAI: cải thiện lớn nhất tập trung ở thực thi dạng tác nhân.

Ở mức nỗ lực tối đa trong harness Codex, Astra được cho là dùng khoảng một phần ba số token so với Sol trên Coding Agent Index. Mức dùng token trên Intelligence Index chỉ giảm khoảng 10%. Vì mức giá mỗi token của Astra cao hơn, hai hồ sơ hiệu suất này tạo ra kinh tế học khác nhau.

Đánh giá độc lậpKết quả quan sátDiễn giải cho sản xuất
Intelligence IndexÍt tách biệt khỏi SolLý luận chung có thể không biện minh mức giá cao
Coding Agent IndexCải thiện tác nhân rõ ràngÍt token có thể bù mức giá mỗi token cao
AA-OmniscienceTỉ lệ ảo tưởng giảm từ 92% xuống 51% ở nỗ lực tối đaTự kiềm chế tốt hơn có thể quan trọng với hệ nghiên cứu/truy hồi
Công việc tri thức dài hạnTiến bộ lẫn lộn giữa các tác vụCần đánh giá nội bộ tại chỗ

Không có benchmark độc lập nào chứng nhận tính đúng sự thật hoặc an toàn trong sản xuất. Các nhóm nên chấm điểm riêng câu trả lời đúng, sự không chắc chắn có cơ sở, tuyên bố không có bằng chứng và các lỗi không tuân theo ràng buộc nguồn.

Vì sao Astra phù hợp hơn với công việc tác nhân có tầm nhìn dài?

GPT-6 Astra bổ sung ba điều khiển được thiết kế cho công việc thay đổi trong khi chạy. Độ tin cậy chạy dài cũng phụ thuộc vào toàn bộ hệ thống ngữ cảnh: cửa sổ ngữ cảnh đặt sức chứa; nén kiểm soát cách cô đọng tài liệu cũ; suy luận được lưu giữ mang theo trạng thái mô hình liên quan; truy hồi giữ cho bằng chứng trước đó có thể tìm kiếm; và ứng dụng phải bảo tồn đầu ra công cụ quan trọng, kết quả kiểm thử, phương án thất bại và yêu cầu người dùng. Các cơ chế này nên được kiểm thử cùng với harness tác nhân.

  • Gọi công cụ bất đồng bộ: Astra có thể tiếp tục suy luận độc lập hoặc gọi công cụ khác trong khi ứng dụng đang thực thi một công cụ chạy lâu.
  • Điều khiển giữa lượt: ứng dụng có thể gửi một chỉnh sửa hoặc yêu cầu mới qua WebSocket mà không hủy bỏ phần công việc đã hoàn thành.
  • Điều chỉnh suy luận giữa cuộc hội thoại: một cập nhật cấu hình có thể tăng hoặc giảm nỗ lực suy luận trong khi vẫn giữ tiền tố prompt đã cache.

Nơi GPT-6 Astra thực sự cải thiện

Lập trình tác nhân: Công việc terminal là nâng cấp lớn hơn

Terminal-Bench 4.0 đánh giá liệu tác nhân có thể làm việc qua các tác vụ terminal khó, thay vì chỉ tạo ra một câu trả lời mã đơn lẻ. Astra đạt 57.9%, cao hơn Sol 20.6 điểm phần trăm và Fable 2.1 điểm. Đây là cải thiện đáng kể giữa các thế hệ cho OpenAI, nhưng lợi thế hẹp hơn nhiều so với một hệ tác nhân đầu bảng khác.

DeepSWE cho câu chuyện khác: 74.1% cho Astra và 72.7% cho Sol. Khoảng cách 1.4 điểm cảnh báo không nên khái quát từ một benchmark lập trình. Astra có vẻ tăng nhiều nhất khi lập trình đòi hỏi tương tác môi trường, lặp, lưu trạng thái và kiểm chứng.

Database Migration Tasks củng cố diễn giải đó. Kết quả 63.9% cao hơn Sol 21.2 điểm và Fable 6.1 điểm. Công việc di trú kết hợp hiểu mã, dùng công cụ, xếp chuỗi và phán đoán vận hành—loại quy trình tổng hợp nơi các cải thiện suy luận nhỏ có thể tích tụ thành mức tăng hoàn thành lớn hơn.

Với tác nhân lập trình, hãy đánh giá cả mô hình lẫn harness. Hướng dẫn kho, công cụ terminal, hành vi thử lại, bảo tồn ngữ cảnh và thực thi kiểm thử đều góp phần vào kết quả đo được.

Sử dụng máy tính: Tỉ lệ thành công và thời gian chạy đều quan trọng

Trên Agents’ Last Exam, GPT-6 Astra đạt 59.3%, so với 53.6% của GPT-5.6 Sol: tăng 5.7 điểm phần trăm. Điều này bổ sung một kết quả tác vụ tác nhân rộng hơn vào các điểm OSWorld 2.0 và ScreenSpot-Pro trong tổng quan benchmark phía trên.

Ngoài độ chính xác, so sánh thời gian chạy OSWorld thêm một chiều thực tế: OpenAI báo cáo khoảng 40 phút mỗi tác vụ cho Astra so với khoảng 75 phút cho Sol, tức giảm khoảng 47% thời gian trôi qua đồng thời tăng tỉ lệ thành công.

Một tác nhân thành công nhỉnh hơn và kết thúc nhanh hơn nhiều có thể mang lại cải thiện thông lượng lớn. Do đó, thử nghiệm mua sắm nên báo cáo tỉ lệ thành công, thời gian trôi qua, số lần gọi công cụ, số lần thử lại và can thiệp của con người—không chỉ độ chính xác.

Tự động hóa và công việc chuyên môn

AutomationBench tăng từ 18.1% lên 41.4%, mức tăng 23.3 điểm. Điểm tuyệt đối vẫn còn xa độ tự động đáng tin cậy, nhưng thay đổi hồ sơ lỗi có ý nghĩa hơn một bước nhích gần bão hòa. Trên BenchCAD, Astra đạt 95.9%, dẫn Sol 12.6 điểm và Fable 11.6 điểm.

Các kết quả này ủng hộ một tuyên bố cụ thể: Astra giỏi hơn trong chuyển chỉ dẫn thành chuỗi hành động được kiểm chứng. Chúng không chứng minh mức tăng ngang nhau cho mọi quy trình kinh doanh. Quy trình sản xuất có thể đưa vào bước xác thực, giao diện độc quyền, chính sách mơ hồ hoặc định dạng dữ liệu không có trong benchmark.

Khoa học

Khoa học là một trong những mức năng lực rõ rệt nhất của Astra. Trên FrontierMath Tier 4 v2, Astra đạt 97.6%, so với 83.0% của Sol và 87.8% của Fable. Mức dẫn 14.6 điểm trước Sol là đáng kể, dù benchmark bao phủ phân phối tác vụ chọn lọc chứ không phải toàn bộ quy trình khoa học.

An ninh mạng

An ninh mạng là mức tăng lớn thứ hai, với rủi ro cao hơn so với sự dịch chuyển bình thường trên bảng xếp hạng. Trên ExploitBench từ tháng 6 đến tháng 8 năm 2026, Astra đạt 39.0% so với 5.5% của Sol. OpenAI báo cáo bộ đánh giá mới hơn này nhắm vào các lỗ hổng từ ba tháng trước, nhằm giảm phơi nhiễm lịch sử. Trong đánh giá an ninh mạng của OpenAI, Astra thể hiện khả năng phát hiện và khai thác hai lỗ hổng zero-day chưa được biết đến trước đó trong thử nghiệm có kiểm soát. Điều này quan trọng vì đánh giá được thiết kế xoay quanh lỗ hổng mới công bố thay vì vấn đề bảo mật đã biết từ lâu, giảm khả năng hiệu suất benchmark chỉ do ví dụ đã ghi nhớ. Kết quả góp phần giúp Astra đạt ngưỡng năng lực an ninh mạng Critical của OpenAI và do đó thay đổi biện pháp bảo vệ yêu cầu cho triển khai. Ý nghĩa không phải là Astra có thể tự động tiến hành hoạt động an ninh mạng không hạn chế, mà là mức năng lực của nó thay đổi yêu cầu về biện pháp bảo vệ khi triển khai. Hệ thống có khả năng phát hiện và khai thác lỗ hổng mạnh hơn đòi hỏi kiểm soát truy cập chặt chẽ hơn, giám sát, sandbox và cơ chế rà soát của con người.

Nhiệm vụ chạy dài: Cửa sổ ngữ cảnh không phải toàn bộ câu chuyện

Cửa sổ ngữ cảnh 1,050,000 token của Astra mô tả sức chứa, không phải tính liên tục. Hiệu suất chạy dài còn phụ thuộc vào nén, trạng thái lưu giữ, khả năng tìm kiếm ngữ cảnh trước đó, trạng thái suy luận được giữ lại và bảo tồn đầu ra công cụ. Ở MRCR v2, Astra đạt 100.0% ở 256K–512K và 96.3% ở 512K–1M, trong khi Sol ghi 91.5% và 73.8%. Khoảng cách 22.5 điểm ở phạm vi dài nhất cho thấy truy hồi hữu dụng gần ngưỡng quan trọng hơn con số sức chứa được quảng bá.

MRCR vẫn là kiểm tra truy hồi tổng hợp, vì vậy đánh giá sản xuất nên bảo tồn bằng chứng mà tóm tắt thường bỏ sót: vì sao bản sửa trước thất bại, hành vi của một thành phần cụ thể, kết quả kiểm thử, yêu cầu lịch sử và chi tiết chôn trong đầu ra công cụ. Kho chứa và tư liệu nghiên cứu cũng nên được kiểm thử với tên trùng, tham chiếu chéo, chính sách cũ, nguồn mâu thuẫn và dải gây nhiễu dài. Điều này phân biệt sức chứa ngữ cảnh thô với hành vi bảo tồn và truy hồi ngữ cảnh mà một tác nhân tầm nhìn dài thực sự cần.

Bảo tồn ngữ cảnh: vì sao Astra khác với hệ thống ngữ cảnh dài truyền thống

Các quy trình ngữ cảnh dài truyền thống thường theo mẫu:

context → compaction → summary → continue

Cách tiếp cận này giảm dùng token, nhưng đem lại rủi ro quan trọng: thông tin trung gian quan trọng có thể biến mất khi tóm tắt.

Thông tin mất thường không phải câu trả lời cuối cùng, mà là chi tiết vận hành cần cho quyết định tương lai:

  • vì sao bản sửa trước thất bại;
  • thành phần nào thể hiện hành vi bất thường;
  • kết quả kiểm thử nào đã thay đổi hướng triển khai;
  • yêu cầu người dùng nào được thêm sau đó;
  • đầu ra công cụ nào chứa bằng chứng quan trọng.

GPT-6 Astra giải quyết hạn chế này bằng cách kết hợp cơ chế bảo tồn ngữ cảnh và truy hồi bên trong quy trình tác nhân chạy dài.

Thay vì chỉ dựa vào tóm tắt nén, hệ thống có thể giữ ghi chú quan trọng, truy hồi thông tin trước đó khi cần, và duy trì tính liên tục giữa nhiều tương tác công cụ.

Với tác nhân lập trình như Codex, điều này có nghĩa một tác vụ gỡ lỗi dài có thể giữ lại:

  • các thử nghiệm thất bại trước đó;
  • thay đổi trong kho;
  • đầu ra kiểm thử;
  • quyết định kiến trúc;
  • vấn đề chưa giải quyết.

Vì vậy, giá trị của cửa sổ ngữ cảnh 1M token của Astra không chỉ là lượng thông tin nó có thể nhận, mà còn là liệu hệ thống có thể bảo tồn và phục hồi thông tin đúng sau hàng giờ tương tác hay không.

Lý luận và diễn giải

ARC-AGI-3: Bộ khung là một phần của kết quả

ARC-AGI-3 cung cấp minh chứng rõ nhất rằng một benchmark tuyến đầu có thể đo một hệ thống chứ không phải mô hình đơn lẻ. ARC Prize báo cáo 62.7% với Standard harness ở nỗ lực tối đa và 99.9% với Provider Adapter ở nỗ lực cao.

Đánh giá ARC PrizeStandard HarnessProvider AdapterMức tăng nhờ Adapter
max62.7%98.6%+35.9 pp
xhigh59.3%98.4%+39.1 pp
high54.8%99.9%+45.1 pp
medium38.6%98.4%+59.8 pp
low17.5%98.0%+80.5 pp

Các điểm chuẩn GPT-6 Astra: Những con số thực sự nói lên điều gì

So sánh của ARC Prize về hiệu suất hành động của Astra giữa các harness đánh giá

Chính sách harness trung lập nhà cung cấp yêu cầu mô hình bảo tồn thông tin quan trọng trong trạng thái hiển thị. Provider Adapter giữ thêm trạng thái suy luận và sử dụng quản lý ngữ cảnh đặc thù nhà cung cấp. Trên các cặp trò chơi–lý luận được giải chung, ARC Prize báo cáo tốc độ thực thi nhanh hơn 3.66× và ít hơn 49% tổng token với adapter.

Kết quả 99.9% đo một hệ thống mô hình–adapter–nhà cung cấp cụ thể và không nên được xem như thước đo độc lập khỏi harness về trí tuệ thô của mô hình. Kiến trúc ngữ cảnh là một phần của hệ thống được benchmark.

Nỗ lực lý luận không tỷ lệ tuyến tính

Bảng ARC cũng cho thấy nỗ lực tối đa không phải lúc nào cũng cho điểm cao nhất. Nỗ lực cao đạt 99.9% với Provider Adapter, trong khi tối đa đạt 98.6%. Trong Standard harness, mức tối đa lại tốt nhất.

OpenAI lưu ý rằng các con số trong bảng phát hành thường dùng mức nỗ lực suy luận tốt quan sát được. Cách này ước lượng trần hiệu suất, nhưng không xác định cấu hình sản xuất tối ưu. Các đội nên thử nhiều mức nỗ lực và tính chất lượng biên thu được cho mỗi giây và đô la tăng thêm.

Toán học và lý luận học thuật

FrontierMath Tier 4 v2 tăng từ 83.0% lên 97.6%, mức tăng 14.6 điểm. Đây là cải thiện benchmark lớn, nhưng không phải bằng chứng rằng toán học tuyến đầu đã được giải quyết. Đánh giá bao phủ phân phối tác vụ chọn lọc và không đo mọi giai đoạn nghiên cứu toán học, gồm chọn vấn đề, kiểm chứng chứng minh hình thức, phát triển chương trình dài hạn hay phản biện đối kháng.

GPQA Diamond cho mẫu ngược lại: 96.0% cho Astra, 94.6% cho Sol, 93.7% cho Fable và 95.3% cho Gemini 3.8 Flash. Các mô hình tụ lại gần trần. Báo cáo chênh lệch 1.4 điểm giữa Astra–Sol là chính xác, nhưng gọi đó là cuộc cách mạng trí tuệ rộng sẽ thổi phồng bằng chứng.

Năng lực ở mức độ nghiêm trọng + biện pháp bảo vệ

Đánh giá an ninh mạngAstraSolMức tăng tuyệt đối
ExploitBench100.0%78.5%+21.5 pp
ExploitGym42.4%30.3%+12.1 pp
ExploitBench, June–August 202639.0%5.5%+33.5 pp
SRE-Bench88.0%55.9%+32.1 pp
SEC-Bench Pro85.4%79.1%+6.3 pp

OpenAI tạo ExploitBench (June–August 2026) từ các lỗ hổng được công bố trong ba tháng trước, giảm khả năng phơi nhiễm lịch sử thổi phồng kết quả. Astra đạt 39.0% trên bộ này so với 5.5% của Sol, và OpenAI báo cáo Astra đã tìm và khai thác hai lỗ hổng zero-day chưa biết trước đó. Các kết quả này góp phần giúp Astra trở thành mô hình đầu tiên được triển khai rộng rãi của OpenAI đạt ngưỡng năng lực an ninh mạng Critical, trực tiếp ảnh hưởng các biện pháp bảo vệ và chính sách truy cập.

Cách diễn giải điểm gần bão hòa

Điểm trên 90% cần ngôn ngữ cẩn trọng hơn so với kết quả trung bình. Tăng từ 50% lên 60% giải thêm mười tác vụ trên mỗi trăm. Tăng từ 95% lên 96% chỉ giải thêm một tác vụ trên mỗi trăm, dù nó giảm số lỗi còn lại từ năm xuống bốn—giảm 20% lỗi. Cả hai mô tả đều đúng về mặt toán học, nhưng chúng hỗ trợ tiêu đề rất khác nhau.

Cảnh báo ngược lại áp dụng cho benchmark điểm thấp. Tăng từ 18.1% lên 41.4% vẫn còn xa vận hành tự chủ đáng tin cậy, nhưng nó hơn gấp đôi số ca thành công và có thể chuyển hóa một quy trình giám sát. Điểm tuyệt đối quyết định hệ thống đã sẵn sàng hay chưa; kích thước cải thiện cho biết tốc độ thay đổi năng lực. Quyết định sản xuất cần cả hai.

So sánh đa chiều

Chiều so sánhAstraSolFableTín hiệu quyết định
Lý luận học thuật chungXuất sắc; thường gần bão hòaBám sátCạnh tranhKhoảng cách nhỏ hiếm khi quyết định triển khai
Thực thi terminalHàng đầuKhoảng cách lớn giữa thế hệĐối thủ sátKiểm thử toàn bộ harness lập trình
Sử dụng máy tínhTỉ lệ thành công cao và runtime thấpChậm hơn và kém chính xác hơnThiếu dữ liệu so sánh tương xứng trong bảng phát hànhĐo điểm thành công theo giờ
Truy hồi ngữ cảnh dàiMạnh gần 1M tokenSuy giảm đáng kể gần ngưỡngThiếu dữ liệu so sánh trực tiếpDùng bài kiểm thử truy hồi theo hình sản xuất
Điều khiển suy luậnlow tới maxDải nỗ lực khácTiếp cận tư duy thích ứngTinh chỉnh cấu hình, không chỉ tên mô hình
Năng lực an ninhRủi ro ở bậc cao hơn về chất lượngKết quả công bố thấp hơnKhông so sánh ở đâyBiện pháp bảo vệ và chính sách truy cập quan trọng
Kinh tế tokenMức giá cao; đôi lúc ít token hơnMức giá thấp hơnPhụ thuộc khối lượng công việcSo sánh chi phí cho mỗi tác vụ thành công

Kết quả phụ thuộc khối lượng công việc. Astra thuyết phục nhất khi tác vụ đòi hỏi tương tác bền bỉ với công cụ và môi trường, phục hồi sau thất bại hoặc truy hồi đáng tin cậy trên ngữ cảnh rất lớn. Sol có thể vẫn kinh tế hơn cho công việc giới hạn với ngữ cảnh vừa phải và ít lặp. Fable là đối thủ sát trên công việc terminal và dẫn một số đánh giá học thuật bên ngoài, vì vậy một benchmark cấp ứng dụng hữu ích hơn kết luận cấp nhà cung cấp.

Ai nên dùng GPT-6 Astra?

Trường hợp sử dụngKhuyến nghị
Phân loại đơn giảnKhông nhất thiết cần Astra
Tóm tắt đơn giảnKhông nhất thiết cần Astra
RAG tiêu chuẩnBenchmark chi phí so với hiệu suất trước
Tổng hợp & phân tích tài liệu dàiĐáng thử với Astra
Lập trình tác nhânRất nên thử nghiệm
Sử dụng máy tínhRất nên thử nghiệm
Tự động hóa nhiều bướcRất nên thử nghiệm
Nghiên cứu phức tạpĐáng thử
Tính toán khoa học / phần mềm chuyên biệtĐáng thử
An ninh mạngNăng lực mạnh, nhưng cần biện pháp an toàn phù hợp
Tác vụ đơn giản thông lượng caoMô hình chi phí thấp có thể hiệu quả hơn

Các cải thiện hiệu năng của GPT-6 Astra có xứng với mức giá cao hơn?

GPT-6 Astra đắt hơn đáng kể so với GPT-5.6 Sol, nhưng cải thiện benchmark không phân bố đều trên các khối lượng công việc. Vì vậy câu hỏi về giá không thể trả lời bằng so sánh mức giá token đơn thuần.

Kịch bảnMức cải thiện hiệu năngBiện minh chi phí
Hỏi–đáp đơn giảnCải thiện nhỏThường không đáng mức giá
Tác nhân lập trìnhCải thiện lớnCó thể biện minh mức giá
Phân tích ngữ cảnh dàiCải thiện đáng kểPhụ thuộc nhu cầu truy hồi
Tự động hóa máy tínhCải thiện mạnhThường đáng thử nghiệm
Lý luận chungCải thiện hạn chếSo sánh chi phí cẩn trọng

Ở mức OpenAI Standard, GPT-6 Astra có giá $10 mỗi triệu token đầu vào, $1 mỗi triệu token đầu vào dùng cache, $12.50 mỗi triệu token ghi cache, và $50 mỗi triệu token đầu ra. Đầu vào và đầu ra Standard tương ứng là 2.5× so với mức $4 và $20 của GPT-5.6 Sol. Khi một yêu cầu vượt quá 272K token đầu vào, mức giá đầu vào và cache của Astra tăng gấp đôi và mức giá đầu ra tăng 1.5× cho toàn bộ yêu cầu.

Phần chênh giá phù hợp rõ ràng nhất với công việc tác nhân. Astra tăng hơn 20 điểm phần trăm trên Terminal-Bench, AutomationBench, di trú cơ sở dữ liệu và MRCR dài nhất; thử nghiệm độc lập cũng báo cáo dùng khoảng một phần ba token so với Sol trên Coding Agent Index. Sự tương hợp yếu hơn ở lý luận rộng, nơi Intelligence Index gần như hòa và mức dùng token chỉ giảm khoảng 10%. Do đó, quyết định mua nên so sánh chi phí cho mỗi tác vụ thành công, bao gồm đầu ra, hoạt động cache, dùng công cụ, thời gian trôi qua, thử lại, lỗi và chỉnh sửa của con người.

Chi phí cho mỗi tác vụ thành công

Chi phí cho mỗi tác vụ thành công = (Chi phí đầu vào + Chi phí đầu ra + Chi phí công cụ + Chi phí thử lại + Chi phí rà soát của con người) / Số tác vụ thành công

Chi phí kinh doanh kỳ vọng

Chi phí kinh doanh kỳ vọng = Chi phí API + Chi phí công cụ + Chi phí thử lại + Chi phí rà soát của con người + Chi phí thất bại

Chỉ số quyết định nên là tổng chi phí chia cho số tác vụ thành công, đánh giá ở ngưỡng chất lượng chấp nhận được—không phải mức giá niêm yết mỗi triệu token.

Nhà phát triển nên benchmark Astra như thế nào

Bảng xếp hạng công khai nên xác định cái gì đáng thử nghiệm, không đưa ra quyết định triển khai cuối cùng. Xây dựng bộ tác vụ đại diện với ca thường, ca khó, ca thiếu ngữ cảnh, lỗi công cụ và chỉ dẫn đối kháng. Dùng cùng prompt sản xuất, quyền hạn, tệp nguồn, ngân sách thời gian và tiêu chí hoàn thành cho mọi mô hình.

Chiều đánh giáCách đoVì sao quan trọng
Thành công tác vụTiêu chí chấp nhận được vượt quaNgăn câu trả lời thuyết phục nhưng chưa hoàn chỉnh được tính là thành công
Độ tin cậyPhân phối thành công qua các lần chạy lặpPhơi bày chiến thắng đơn lẻ không ổn định
Thực thi công cụHành động thành công đã kiểm chứngPhân biệt gọi công cụ với kết quả đúng
Tính đúng sự thậtTuyên bố có bằng chứng hỗ trợĐo chất lượng bằng chứng và sự tự kiềm chế
Độ trễThời gian hoàn thành trung vị và đuôiNắm bắt thông lượng vận hành
Chi phíTổng chi phí cho mỗi tác vụ thành côngBao gồm thử lại và nỗ lực thất bại
Công sức con ngườiSố phút chỉnh sửa và rà soátThường chi phối chi phí triển khai thực tế
Khả năng điều khiểnPhục hồi sau khi yêu cầu thay đổiKiểm thử hành vi tác nhân chạy dài

API Astra trong CometAPI dùng ID mô hình gpt-6-astra. API đa mô hình giúp chạy cùng đánh giá trên Astra, Sol, Fable và Gemini mà không cần thiết kế lại benchmark xoay quanh bảng tiêu đề của một nhà cung cấp. Tuyến các tác vụ tác nhân đòi hỏi khắt khe tới mô hình xứng đáng với mức giá, và dùng mô hình chi phí thấp hơn ở nơi lợi thế đo được biến mất.

Kết luận

Tờ điểm benchmark của Astra ấn tượng, nhưng các điểm số ngoạn mục nhất không tự động là hữu dụng nhất. ARC-AGI-3 chứng minh tiềm năng của harness tác nhân đặc thù nhà cung cấp; điểm với Standard harness cho thấy hạ tầng đóng góp mạnh. GPQA và Intelligence Index độc lập cho thấy mức tăng lý luận bình thường có thể khiêm tốn. Công việc terminal, tự động hóa, sử dụng máy tính, truy hồi ngữ cảnh dài, quy trình khoa học và an ninh mạng mới là câu chuyện quan trọng hơn.

Bản phát hành nói ít về việc chatbot trở nên thông minh hơn theo tỷ lệ ở mọi câu hỏi, và nói nhiều hơn về việc trí tuệ tuyến đầu trở nên giỏi hơn trong hoàn thành công việc. Giá trị của nâng cấp đó có đáng trả tiền hay không phụ thuộc vào toàn bộ cấu hình hệ mô hình và kinh tế của các tác vụ sản xuất thành công.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 14, 2026
Cập nhật lần cuối Sep 14, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm