GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Nghiên cứu CometAPI

Gemini 4 đã đánh bại GPT-6 và Claude Fable 5.1 chưa? Giải thích các kết quả benchmark bị rò rỉ

Gemini 4 sẽ vượt trội hơn GPT-6 Astra của OpenAI và Claude Fable 5.1 của Anthropic trên các bài đánh giá chuẩn then chốt về agent và lập trình, với một số người quy các mức cải thiện này cho RSI.

CometAPI
AnnaĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 20, 2026 16 phút đọc
Gemini 4 đã đánh bại GPT-6 và Claude Fable 5.1 chưa? Giải thích các kết quả benchmark bị rò rỉ
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Các điểm chuẩn bị rò rỉ và thử nghiệm lén trên Arena.ai vào giữa tháng 9 năm 2026 cho thấy Gemini 4 Pro (chưa phát hành) của Google đang giữ vị trí dẫn đầu thế hệ mới, vượt GPT-6 Astra và Claude Fable 5.1 ở các hạng mục kỹ thuật phần mềm, tác vụ tác tử, công việc tri thức, lập luận và các điểm chuẩn đa phương thức.

Những điểm chính rút ra

  • Gemini 4 Pro dẫn đầu trong các đánh giá bị rò rỉ trên DeepSWE v1.1 (88,7%), GDPval-AA v2 (Elo 2064), Terminal-bench 2.1 (95,3%), OSWorld-2.0 (86,8%) và nhiều bộ điểm chuẩn tác tử/lập luận khác.
  • Giá niêm yết thấp hơn GPT-6 Astra ($12/$60) và Claude Fable 5.1 ($10/$50) trong khi vẫn tương đương hoặc vượt các cửa sổ ngữ cảnh hạng 1M của họ.
  • Thử nghiệm lén trên Arena.ai dưới tên giữ chỗ (ví dụ: gemini-3.8-flash) cho ra các bản demo mã SVG, Three.js và tác tử nổi bật.
  • Tin đồn về RSI (recursive self-improvement – tự cải thiện đệ quy) lan truyền nhưng chưa có bằng chứng công khai về cải thiện mô hình tự động vòng kín đối với chính Gemini 4.
  • Google đã xác nhận đầu tư lớn vào một mô hình nền tảng Gemini 4 lớn hơn; thời điểm ra mắt công khai vẫn chưa chính thức.
  • Các nền tảng như CometAPI đã tổng hợp Gemini, GPT-6 Astra, Claude Fable/Opus và hàng trăm mô hình khác sau một endpoint tương thích OpenAI với mức giá cạnh tranh—lý tưởng để benchmark thế hệ mới ngay khi ra mắt.

Chúng ta biết gì về Gemini 4 ? (Rò rỉ, nguồn và ngữ cảnh đã xác thực)

Tính đến ngày 20 tháng 9 năm 2026, Gemini 4 Pro chưa có thông báo chính thức từ Google, chưa có model card hoặc endpoint API công khai. Mọi thứ ngoài các phát biểu trước đó của Google về việc đầu tư vào một “mô hình nền tảng Gemini 4 lớn hơn” (thu nhập quý 7/2026) đều đến từ các rò rỉ cộng đồng, bài kiểm tra mù trên Arena.ai và các bảng điểm chuẩn đang lan truyền.

Nguồn và tuyên bố chính gồm:

  • Người rò rỉ Pankaj Kumar và các bài đăng tiếp theo (khoảng đầu đến giữa tháng 9) nhắc tới một checkpoint Pro nội bộ với kỳ vọng phát hành công khai vào tháng 10 và khả năng có biến thể Flash-Lite sớm hơn.
  • Nhiều nhà phát triển báo cáo đã kéo được một mô hình năng lực cao gán nhãn “gemini-3.8-flash” (hoặc tên giữ chỗ tương tự) trên Arena.ai. Đầu ra gồm tạo SVG phức tạp (ví dụ: bồ nông chạy xe đạp, bướm cơ khí trong Three.js), tạo JSON dài không lặp và hành vi tác tử mạnh. Một số người dùng cho biết chi tiết backend như ngữ cảnh nhiều triệu token, trần output 256k, bộ nhớ xuyên phiên và khả năng công cụ/Internet gốc.
  • Một bảng so sánh lan truyền rộng rãi liệt kê Gemini 4 Pro so với Gemini 4 Flash, Gemini 4 Flash-Lite, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 và GPT-5.6 Sol.
  • Google chưa xác nhận các thử nghiệm trên Arena hay bảng này. Mẫu hình lịch sử cho thấy công ty thường chạy đánh giá lén trên nền tảng công khai vài tuần trước khi ra mắt chính thức.

Gemini 4 đã đánh bại GPT-6 và Claude Fable 5.1 chưa? Giải thích các kết quả benchmark bị rò rỉ

Cửa sổ ngữ cảnh

Bảng rò rỉ cho thấy tối đa 2M token input cho dòng Gemini 4—gấp đôi 1M của GPT-6 Astra và cao hơn nhiều so với 200k của dòng Claude Fable/Opus 5 (một số biến thể Claude từng cung cấp cửa sổ hiệu dụng lớn hơn thông qua cơ chế khác). Một số đồn đoán ghost-routing nêu trần 10M; điều này vẫn chưa được xác minh.

Giá của Gemini 4 (Số liệu rò rỉ)

Bảng lan truyền liệt kê:

  • Gemini 4 Pro: $2,25 input / $11,25 output trên mỗi 1M token (không caching).
  • Gemini 4 Flash: $0,75 / $3,75.
  • Gemini 4 Flash-Lite: $0,35 / $1,75.

Các con số này thấp hơn đáng kể so với mức $12/$60 của GPT-6 Astra và $10/$50 của Claude Fable 5.1 (Fable 5.1 có chiết khấu cache-read mạnh có thể giảm chi phí hiệu dụng cho tải tác tử). Giá chính thức hiện tại của Gemini 3.x Pro nằm khoảng $2–$4 input / $12–$18 output tùy độ dài ngữ cảnh, nên số rò rỉ cho Pro là khả dĩ như một điều chỉnh thế hệ mới.

Giá công khai thực tế chỉ được biết khi ra mắt. Lịch sử cho thấy Google dùng mức token cạnh tranh và bậc miễn phí để thúc đẩy sử dụng.

Hiệu năng của Gemini 4 Pro: Phân tích sâu điểm chuẩn rò rỉ

Bảng lan truyền đặt Gemini 4 Pro lên đầu hầu hết danh mục. Những con số này là không chính thức và chưa được Google hay phòng thí nghiệm độc lập xác minh tại thời điểm viết. Nên xem chúng như tín hiệu định hướng thay vì xếp hạng dứt khoát.

Kỹ thuật phần mềm & mã hóa agentic

  • DeepSWE v1.1 (kỹ thuật phần mềm tầm xa): 88,7% (so với GPT-6 Astra 86,9%, Claude Fable 5.1 69,1%, Claude Opus 5 75,0%).
  • Terminal-bench 2.1 (mã hóa tác tử trên terminal): 95,3% (so với Astra 94,1%, Fable 92,8%).
  • Terminal-bench 4.0 (năng lực tác tử tổng quát): 69,7% (khoảng cách lớn nhất so với Flash và đối thủ).

Công việc tri thức & tác vụ chuyên nghiệp

  • GDPval-AA v2 (Elo, công việc tri thức): 2064 (mô hình duy nhất trên 2000; Astra 1994, Fable 1853).
  • Vals Finance Agent v2: 74,2%.
  • Harvey’s Legal Agent Benchmark (quy trình pháp lý phức tạp, tỷ lệ vượt qua toàn bộ): 18,7%.

Lập luận, đa phương thức & chuyên biệt

  • CharXiv Reasoning (tổng hợp thông tin từ biểu đồ phức tạp, không dùng công cụ): 94,7%.
  • LVBench (hiểu video dài): 95,8% agentic / 95,0% tĩnh.
  • HLE-Verified (lập luận chuyên gia đa ngành): 72,1%.
  • OSWorld-2.0 (sử dụng máy tính theo hướng tác tử, điểm một phần, bật công cụ theo lô): 86,8%.
  • BioMysteryBench & LABBench2 (quy trình tin sinh học và nghiên cứu sinh học): dẫn đầu ở cả tập con giải được bởi người và tập khó.

Nếu đúng theo hướng, các kết quả này cho thấy sức mạnh đặc biệt ở tác vụ tầm xa, nhiều bước, có sử dụng công cụ—đúng khu vực GPT-6 Astra và Claude Fable 5.1 được định vị là dẫn đầu sau khi phát hành đầu tháng 9.

Các thử nghiệm định tính trên Arena củng cố bức tranh: các tạo phẩm SVG và Three.js phức tạp từ mô hình lén được đánh giá vượt trội hoặc rất cạnh tranh so với Astra trong so sánh song song cộng đồng.

Gemini 4 sẽ hoạt động như thế nào?

Gemini 4 (Pro) chưa phát hành, nên mọi mô tả “cách hoạt động” đều dựa trên phát biểu chính thức của Google, chi tiết rò rỉ hạn chế về checkpoint nội bộ sớm, quỹ đạo dòng Gemini 3.x và suy luận kỹ thuật hợp lý. Không điều gì dưới đây nên coi là thông số đã xác nhận.

Cách tiếp cận huấn luyện lõi và quy mô

Google mô tả Gemini 4 là “đợt tiền huấn luyện tham vọng nhất từ trước đến nay”, xây dựng trên một mô hình nền tảng lớn hơn đáng kể so với các thế hệ trước. Mục tiêu rõ ràng là duy trì cạnh tranh ở tuyến đầu, đặc biệt trong mã hóa và tác tử tự động.

Điều này ngụ ý:

  • Số tham số lớn hơn hoặc dung lượng hiệu dụng cao hơn (qua mixture-of-experts, độ thưa tốt hơn hoặc tăng mật độ).
  • Đầu tư tính toán nặng hơn trong tiền huấn luyện.
  • Tiếp tục nhấn mạnh dữ liệu huấn luyện đa phương thức (văn bản, hình ảnh, video, audio, mã, quỹ đạo sử dụng công cụ).

Mô hình dự kiến đóng vai trò nền tảng năng lực cao mới, từ đó các biến thể Flash nhanh hơn sẽ được dẫn xuất sau.

Suy luận và phong cách lập luận

Mô tả rò rỉ về một checkpoint sớm “argon” đề cập chế độ “nỗ lực suy nghĩ cao” mất khoảng 2,4 phút cho một lần sinh và hỗ trợ giới hạn output cao hơn rất nhiều (báo cáo trần 256k token so với khoảng ~64k trước đó).

Điều này gợi ý:

  • Các đường suy luận tùy chọn tốn compute (na ná các chế độ extended-thinking hay “max effort” ở mô hình cạnh tranh).
  • Khả năng dành nhiều tính toán nội bộ hơn cho bài toán khó trước khi trả lời.
  • Hỗ trợ tốt hơn cho output dài, mạch lạc như toàn bộ codebase, kế hoạch nhiều bước hoặc báo cáo dài.

Người dùng nhiều khả năng có thể điều khiển đánh đổi giữa tốc độ/chi phí và độ sâu lập luận, tương tự các Gemini Flash hiện có với mức low/medium/high thinking.

Trọng tâm năng lực chính

Dựa trên phát biểu công khai của Sundar Pichai và quỹ đạo phát triển:

  1. Coding và kỹ thuật phần mềm Hiệu năng tầm xa mạnh hơn: refactor đa tệp, debug xuyên repository, vòng tự sửa, tỷ lệ hoàn thành cao hơn ở tác vụ phần mềm thực tế.
  2. Hành vi tự chủ/tác tử Khả năng lập kế hoạch, dùng công cụ, quan sát kết quả trung gian, phục hồi lỗi và tiếp tục mục tiêu qua nhiều bước được cải thiện. Xây trên các tính năng sử dụng máy tính và tác tử đã có ở Gemini 3.5/3.8 Flash.
  3. Độ tin cậy ngữ cảnh dài Báo cáo cộng đồng nhắc mục tiêu khoảng 1,5 triệu token (hoặc hơn). Mục tiêu thực tế không chỉ là cửa sổ lớn hơn mà còn truy hồi tốt hơn và ít suy giảm khi làm việc với tài liệu rất dài, codebase hoặc dấu vết tác tử nhiều giờ.
  4. Hiểu và sinh đa phương thức Xử lý nguyên bản văn bản + hình ảnh + video + audio, với kỳ vọng tăng ở lập luận không gian, hiểu video và tương tác giọng nói/tác tử thời gian thực (xây trên Gemini 3.8 Live tháng 9/2026).
  5. Sử dụng công cụ và output có cấu trúc Gọi hàm vững vàng hơn, thực thi mã, bám theo tìm kiếm và output kiểu JSON/XML có cấu trúc tin cậy để tích hợp vào ứng dụng và tác tử.

Khác gì so với Gemini 3.x

  • Quy mô: Mô hình nền tảng lớn hơn rõ rệt thay vì tinh chỉnh gia tăng.
  • Dung lượng output: Trần token cao hơn rò rỉ cho phép sinh dài hơn trong một lần.
  • Độ sâu lập luận: Chế độ nỗ lực cao rõ rệt hơn cho bài toán khó.
  • Trọng tâm tác tử: Nhấn mạnh hơn vào công việc tự chủ nhiều bước kéo dài thay vì lượt đơn hoặc nhiệm vụ ngắn.
  • Định vị: Nhắm tới vai trò Pro-tier tuyến đầu mới, trong khi dòng Flash tiếp tục lặp nhanh cho tốc độ và chi phí.

Mối quan hệ với Recursive Self-Improvement (RSI)

Các lãnh đạo Google công khai liên kết chi tiêu vốn AI lớn của công ty với mục tiêu dài hạn là tự cải thiện đệ quy—hệ thống có thể cải thiện đáng kể chính nó hoặc quy trình tạo ra thế hệ tiếp theo. Nghiên cứu liên quan (như bài Dream-RSI) cho thấy tác tử cải thiện chiến lược khám phá của chính chúng mà không thay đổi trọng số mô hình.

Gemini 4 Pro có vượt trội hơn GPT-6 và Claude Fable 5.1 không?

Danh mụcGemini 4 ProGPT-6 AstraClaude Fable 5.1Ghi chú
Giá input / output$2,25 / $11,25$12,00 / $60,00$10,00 / $50,00Gemini 4 Pro rẻ hơn Astra ~5×
Cửa sổ ngữ cảnh2M1M200kLợi thế đáng kể cho Gemini
DeepSWE v1.188,7%86,9%69,1%Dẫn đầu coding
GDPval-AA v2 (Elo)206419941853Dẫn đầu công việc tri thức
Terminal-bench 4.069,7%66,4%57,9%Năng lực tác tử tổng quát
OSWorld-2.086,8%84,5%77,9%Sử dụng máy tính
HLE-Verified72,1%67,3%62,1%Lập luận chuyên gia
LVBench (video)95,8% / 95,0%93,8%90,4%Thế mạnh đa phương thức
Nghiên cứu Bio / LABCao nhấtMạnhCạnh tranhQuy trình khoa học

Gemini 4 Pro đứng đầu mọi hàng chính trong bảng, thường với biên đáng kể, trong khi mức giá được cho là thấp hơn nhiều so với GPT-6 Astra hay Claude Fable 5.1.

Lưu ý quan trọng

  • Bảng này không do Google phát hành chính thức. Tính đến 20 tháng 9 năm 2026, Google chưa công bố model card, endpoint API, giá hay điểm chuẩn xác nhận cho Gemini 4 Pro. Các con số đến từ nguồn cộng đồng/Arena sightings/rò rỉ checkpoint nội bộ (liên quan codename “argon”).
  • Một số bảng lan truyền trước đó sau này bị gắn cờ là dự đoán hoặc sao chép một phần. Hãy xem mọi tỷ lệ phần trăm và giá là chưa xác minh cho tới khi Google xác nhận.
  • Cửa sổ ngữ cảnh của Claude Fable 5.1 ở đây là 200k, thấp hơn con số 1M thường được tài liệu chính thức của Anthropic nêu. Điều này có thể phản ánh cấu hình đánh giá cụ thể hoặc lỗi trong bảng rò rỉ.
  • GPT-6 Astra và Claude Fable 5.1 hiện là các mô hình tuyến đầu công khai đầy đủ và được đánh giá độc lập. Artificial Analysis và các bộ theo dõi bên thứ ba khác vẫn cho thấy chúng sát nút tổng thể (với thế mạnh khác nhau).

Thực tế hiện tại (20 tháng 9, 2026)

Mô hìnhTrạng tháiPhù hợp nhất choMức giá
Gemini 4 ProChưa phát hành (được cho mạnh)Ngữ cảnh dài, coding, tác tử, đa phương thức, chi phíRất cạnh tranh (được cho)
GPT-6 AstraĐã phát hànhToán, sử dụng máy tính, terminal, tự động hóa, an ninh mạngCao cấp
Claude Fable 5.1Đã phát hànhTác tử tầm xa, lập luận, chất lượng coding, hiệu quả cacheCao cấp
Gemini 4 Flash / Flash-LiteAnh em được cho là tồn tạiTải công việc nhạy tốc độ + chi phíCực thấp

Tóm tắt nhanh

  • Dẫn đầu trên diện rộng: Gemini 4 Pro xếp #1 ở mọi danh mục liệt kê, thường với biên rõ rệt.
  • Thế mạnh cụ thể: Coding/tác tử tầm xa (DeepSWE, Terminal-bench), công việc tri thức, đa phương thức (video + biểu đồ) và lĩnh vực chuyên biệt (tài chính, pháp lý, sinh học, sử dụng máy tính).
  • Định vị giá: Khoảng 1/5 giá của GPT-6 Astra và Claude Fable 5.1 ở cả input và output, trong khi điểm số cao hơn.

Astra nhấn mạnh sử dụng máy tính, ngưỡng an ninh mạng và khám phá khoa học; Fable 5.1 nhấn mạnh công việc tri thức dài hạn và coding với biện pháp bảo vệ tinh luyện và chi phí cache-read thấp hơn. Hồ sơ rò rỉ của Gemini 4 Pro có vẻ mạnh nhất ở kỹ nghệ phần mềm theo hướng tác tử và lập luận đa phương thức rộng.

Nhà phát triển nên chuẩn bị thế nào: Khuyến nghị từ CometAPI

Trong khi chờ quyền truy cập chính thức Gemini 4 Pro, các đội ngũ hưởng lợi từ một cổng hợp nhất vốn đã hỗ trợ tuyến đầu hiện tại (dòng Gemini 3.x, GPT-6 Astra, Claude Fable 5.1 / Opus 5 và 500+ mô hình khác). CometAPI cung cấp đúng điều đó: một endpoint tương thích OpenAI, một khóa API, thanh toán theo mức dùng thường thấp hơn 20–40% so với nhà cung cấp trực tiếp và khả năng chuyển đổi mô hình chỉ bằng thay đổi một tham số.

Quy trình thực hành:

  1. Dựng thử các pipeline tác tử trên Gemini Flash/Pro hiện tại, GPT-6 Astra và Claude Fable 5.1 qua CometAPI.
  2. Benchmark cùng tập prompt trên các mô hình để thiết lập baseline.
  3. Khi Gemini 4 Pro (và biến thể Flash) xuất hiện trong danh mục CometAPI—lịch sử cho thấy nền tảng thêm các mô hình Google mới rất nhanh—hãy đổi model ID và chạy lại đánh giá với thay đổi mã tối thiểu.
  4. Dùng bảng điều khiển chi phí để theo dõi tiêu thụ token giữa các nhà cung cấp và định tuyến lưu lượng lớn hoặc nhạy độ trễ tới mô hình kinh tế nhất đủ năng lực.

Cách này loại bỏ việc quản lý nhiều khóa, giảm rủi ro khóa chặt nhà cung cấp và giúp đội ngũ sẵn sàng áp dụng Gemini 4 Pro ngay ngày đầu công khai.

Gemini 4 Pro, nếu các rò rỉ đúng hướng, là nỗ lực mạnh nhất của Google tới nay để giành lại tuyến đầu ở kỹ nghệ phần mềm theo hướng tác tử và lập luận đa phương thức ngữ cảnh dài. Sự kết hợp giữa hiệu năng được cho là cao, ngữ cảnh lớn và định giá tích cực sẽ khiến nó trở thành lựa chọn mặc định cho nhiều tải sản xuất. Cho tới khi ra mắt chính thức và có đánh giá độc lập, con đường thận trọng là liên tục benchmark trên các mô hình tuyến đầu hiện có—dễ dàng thực hiện qua các nền tảng đã hợp nhất truy cập. Hãy chờ thông báo chính thức; vài tuần tới có thể sẽ làm rõ mức độ “hype” chuyển hóa thành thực tiễn sản xuất.

Câu hỏi thường gặp

Gemini 4 Pro đã phát hành chưa?

Chưa. Theo danh mục mới nhất và phát biểu của Google (giữa-đến-cuối tháng 9/2026), mô hình chưa được phát hành công khai hay liệt kê với model ID chính thức.

Ngày phát hành dự kiến của Gemini 4 Pro là khi nào?

Nguồn rò rỉ chỉ tháng 10/2026 (với một số đồn đoán cuối tháng 9). Google chưa đưa ngày chính thức. Hãy coi như một khoảng thời gian chờ xác nhận qua danh mục API hoặc bài blog.

Google có đạt RSI với Gemini 4 Pro không?

Bằng chứng công khai cho thấy sử dụng vòng lặp tác tử nâng cao để tinh chỉnh mô hình và nghiên cứu cải thiện đệ quy ở cấp chiến lược (ví dụ: Dream-RSI). Các tuyên bố về RSI đầy đủ tạo ra mô hình chưa được xác minh độc lập.

So với GPT-6 Astra và Claude Fable 5.1 trên điểm chuẩn thì sao?

Biểu đồ cộng đồng rò rỉ cho thấy dẫn trước ở nhiều bộ tác tử/coding. Điểm số chính thức độc lập cho một Gemini 4 Pro đã phát hành hiện chưa tồn tại. Dữ liệu công khai hiện thời ủng hộ đánh giá các mô hình đang sống (Astra và Fable 5.1) trên tác vụ của bạn.

Tôi có nên chờ Gemini 4 Pro rồi mới xây dựng không?

Không. Hãy triển khai với các mô hình mạnh nhất hiện có (truy cập qua CometAPI hoặc API trực tiếp), giữ sẵn tập đánh giá và áp dụng mô hình mới nếu/bao giờ kiểm thử độc lập và nội bộ biện minh cho việc chuyển đổi.

Tôi có thể truy cập các mô hình frontier hiện tại ở đâu một cách dễ dàng?

Nhà cung cấp hợp nhất như CometAPI cung cấp truy cập tương thích OpenAI tới lớp GPT-6 Astra, Claude Fable 5.1, dòng Gemini hiện tại và các mô hình khác với thanh toán và chuyển đổi đơn giản. Kiểm tra danh sách mô hình live và tài liệu để biết ID và giá mới nhất.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 20, 2026
Cập nhật lần cuối Sep 20, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm