GPT-Realtime-2 là mô hình giọng nói thời gian thực mạnh nhất của chúng tôi. Nó hỗ trợ các tương tác giọng nói sang giọng nói với mức độ lập luận có thể cấu hình, khả năng tuân thủ hướng dẫn tốt hơn và khả năng sử dụng công cụ đáng tin cậy hơn cho các quy trình làm việc phức tạp của tác nhân giọng nói.

Bắt đầu với GPT-5.6 Sol cho suy luận phức tạp và lập trình, chọn GPT-5.6 Terra để cân bằng giữa năng lực và chi phí, hoặc sử dụng GPT-5.6 Luna cho khối lượng công việc lớn, nhạy cảm với chi phí.

GPT Image 2 là mô hình tạo sinh hình ảnh tối tân của openai, cho phép tạo sinh và chỉnh sửa hình ảnh nhanh, chất lượng cao. Nó hỗ trợ các kích thước hình ảnh linh hoạt và đầu vào hình ảnh có độ trung thực cao.

GPT-5.5 Pro kết hợp trí tuệ tối tân, độ chính xác và hiệu quả để giải quyết những thách thức phức tạp. Từ phát triển phần mềm và phân tích dữ liệu đến nghiên cứu và hỗ trợ ra quyết định, GPT-5.5 Pro mang lại hỗ trợ ở cấp độ chuyên gia một cách nhanh chóng và nhất quán.
.jpeg&w=3840&q=75)
Model 5.5 là một mô hình AI thế hệ tiếp theo được thiết kế để có khả năng suy luận mạnh mẽ hơn, phản hồi nhanh hơn và độ chính xác được cải thiện trên nhiều loại tác vụ khác nhau. Nó vượt trội trong việc hiểu các hướng dẫn phức tạp, tạo ra nội dung chất lượng cao và hỗ trợ lập trình, phân tích và giải quyết vấn đề.

GPT-5.4 Nano là một mô hình AI siêu nhẹ được xây dựng để đạt tốc độ và hiệu suất tối đa. Nó được tối ưu cho các tác vụ đơn giản, tương tác thời gian thực và triển khai quy mô lớn, nơi độ trễ thấp và mức tiêu thụ tài nguyên tối thiểu là điều thiết yếu.

GPT-5.4 Mini là một mô hình AI gọn nhẹ và hiệu quả, được tối ưu hóa cho tốc độ và năng suất hằng ngày. Nó cung cấp khả năng hội thoại đáng tin cậy, tạo nội dung và hỗ trợ tác vụ, đồng thời duy trì độ trễ thấp và mức sử dụng tài nguyên thấp.

GPT-5.4 Pro là một mô hình AI hiệu suất cao được thiết kế cho các ứng dụng chuyên nghiệp và doanh nghiệp. Nó cung cấp khả năng suy luận mạnh mẽ, độ chính xác đáng tin cậy và khả năng thực thi hiệu quả trên các tác vụ như sáng tạo nội dung, lập trình, nghiên cứu và phân tích dữ liệu.

GPT Image 2 ALL là một mô hình tạo sinh hình ảnh toàn diện, được thiết kế để xử lý nhiều loại tác vụ thị giác sáng tạo và chuyên nghiệp. Nó kết hợp khả năng tạo hình ảnh chất lượng cao, khả năng hiểu prompt nâng cao và hỗ trợ phong cách linh hoạt để mang lại kết quả vượt trội trong nhiều kịch bản sử dụng đa dạng.

GPT-5.5 xuất sắc trong việc viết mã, nghiên cứu trực tuyến, phân tích dữ liệu và thao tác giữa nhiều công cụ. Mô hình không chỉ nâng cao mức độ tự chủ khi xử lý các tác vụ phức tạp đa bước mà còn cải thiện đáng kể năng lực suy luận và hiệu suất thực thi, đồng thời vẫn duy trì độ trễ tương đương với phiên bản tiền nhiệm, qua đó đánh dấu một bước tiến quan trọng hướng tới tự động hóa công việc văn phòng bằng AI.

Sora 2 Pro là mô hình tạo sinh đa phương tiện tiên tiến và mạnh mẽ nhất của chúng tôi, có khả năng tạo video với âm thanh được đồng bộ hóa. Nó có thể tạo các đoạn video chi tiết, sinh động từ ngôn ngữ tự nhiên hoặc hình ảnh.

Mô hình tạo video siêu mạnh mẽ, kèm hiệu ứng âm thanh, hỗ trợ định dạng chat.

GPT-5.4 là mô hình tiên tiến nhất cho công việc chuyên môn phức tạp. Reasoning.effort hỗ trợ: none (default), low, medium, high và xhigh.

Mô hình GPT-5.3 Instant được sử dụng trong ChatGPT

Mô hình giọng nói tốt nhất cho đầu vào âm thanh, đầu ra âm thanh với Chat Completions.

Mô hình giọng nói tốt nhất cho đầu vào âm thanh, đầu ra âm thanh.

GPT-5.3-Codex được tối ưu hóa cho các tác vụ lập trình theo mô hình agent trong Codex hoặc các môi trường tương tự. GPT-5.3-Codex hỗ trợ các thiết lập mức nỗ lực suy luận low, medium, high và xhigh.

GPT-Image-1.5 là mô hình hình ảnh của OpenAI trong GPT Image family . Đây là một mô hình GPT đa phương thức gốc, được thiết kế để tạo hình ảnh từ lời nhắc bằng văn bản và thực hiện các chỉnh sửa hình ảnh đầu vào với độ trung thực cao, đồng thời tuân thủ chặt chẽ hướng dẫn của người dùng.

gpt-5.2-pro là thành viên hướng tới môi trường sản xuất có năng lực cao nhất trong dòng GPT-5.2 của OpenAI, được cung cấp qua Responses API cho các khối lượng công việc đòi hỏi độ trung thực tối đa, suy luận nhiều bước, sử dụng công cụ rộng rãi và các hạn mức ngữ cảnh/thông lượng lớn nhất mà OpenAI cung cấp.
GPT-5.1 Chat là mô hình ngôn ngữ hội thoại được tinh chỉnh theo chỉ dẫn cho các mục đích chung về trò chuyện, suy luận và viết. Nó hỗ trợ đối thoại nhiều lượt, tóm tắt, soạn thảo, hỏi-đáp dựa trên cơ sở tri thức, và hỗ trợ viết mã nhẹ cho các trợ lý trong ứng dụng, tự động hóa hỗ trợ, và trợ lý đồng hành cho quy trình làm việc. Các điểm nổi bật kỹ thuật bao gồm căn chỉnh tối ưu cho hội thoại, đầu ra có thể kiểm soát và có cấu trúc, cùng các lộ trình tích hợp để gọi công cụ và quy trình truy xuất khi khả dụng.
GPT-5.1 là một mô hình ngôn ngữ mục đích chung được tinh chỉnh theo hướng dẫn, tập trung vào việc tạo văn bản và suy luận trên các quy trình làm việc của sản phẩm. Mô hình hỗ trợ đối thoại đa lượt, định dạng đầu ra có cấu trúc, và các tác vụ hướng mã như soạn thảo, tái cấu trúc và giải thích. Các trường hợp sử dụng điển hình bao gồm trợ lý trò chuyện, Hỏi đáp tăng cường truy hồi, chuyển đổi dữ liệu, và tự động hóa kiểu tác tử với công cụ hoặc API khi được hỗ trợ. Những điểm nổi bật về kỹ thuật bao gồm chế độ lấy văn bản làm trung tâm, khả năng tuân theo hướng dẫn, đầu ra theo kiểu JSON, và khả năng tương thích với việc gọi hàm trong các khung điều phối phổ biến.
Phiên bản tối ưu hóa chi phí của GPT Image 1. Đây là một mô hình ngôn ngữ đa phương thức gốc, nhận cả văn bản và hình ảnh làm đầu vào và tạo đầu ra là hình ảnh.
GPT-5 là mô hình viết mã mạnh mẽ nhất của OpenAI cho đến nay. Nó cho thấy những cải tiến đáng kể trong việc tạo giao diện front-end phức tạp và gỡ lỗi trong các codebase lớn. Nó có thể biến ý tưởng thành hiện thực với kết quả trực quan và giàu tính thẩm mỹ, tạo ra các trang web, ứng dụng và trò chơi đẹp, đáp ứng tốt với cảm quan thẩm mỹ tinh tế, tất cả chỉ từ một lời nhắc duy nhất. Những người thử nghiệm sớm cũng ghi nhận các lựa chọn thiết kế của nó, với sự hiểu biết sâu hơn về các yếu tố như khoảng cách, kiểu chữ và khoảng trắng.
GPT-5 Nano là một mô hình trí tuệ nhân tạo do OpenAI cung cấp.
GPT-5 mini là thành viên trong gia đình GPT-5 của OpenAI, được tối ưu hóa về chi phí và độ trễ, nhằm mang lại phần lớn các năng lực đa phương thức và khả năng làm theo hướng dẫn của GPT-5 với chi phí thấp hơn đáng kể cho việc sử dụng ở quy mô sản xuất lớn. Sản phẩm hướng tới các môi trường mà thông lượng, mức định giá theo mỗi token có thể dự đoán trước và phản hồi nhanh là những ràng buộc chính, đồng thời vẫn cung cấp các khả năng tổng quát mạnh mẽ.
sắp ra mắt
gpt-4o-image tạo ra hình ảnh làm đầu ra, tùy chọn sử dụng hình ảnh làm đầu vào

GPT-5.2 là bộ mô hình đa biến thể (Instant, Thinking, Pro) được thiết kế nhằm mang lại khả năng hiểu ngữ cảnh dài tốt hơn, khả năng lập trình và sử dụng công cụ mạnh hơn, và hiệu năng cao hơn đáng kể trên các chuẩn đánh giá “knowledge-work” ở mức chuyên nghiệp.
OpenAI o3‑pro là biến thể “pro” của mô hình suy luận o3, được thiết kế để suy nghĩ lâu hơn và cung cấp các phản hồi đáng tin cậy nhất bằng cách áp dụng học tăng cường chuỗi tư duy riêng tư và thiết lập các chuẩn mực tối tân mới trên các lĩnh vực như khoa học, lập trình và kinh doanh—đồng thời tự động tích hợp các công cụ như tìm kiếm web, phân tích tệp, thực thi Python và suy luận thị giác ngay trong API.

OpenAI Text-to-Speech

Chuyển giọng nói thành văn bản, tạo bản dịch
GPT-4o mini TTS là một mô hình chuyển văn bản thành giọng nói dựa trên mạng nơ-ron, được thiết kế để tạo giọng nói tự nhiên với độ trễ thấp cho các ứng dụng hướng tới người dùng. Nó chuyển văn bản thành giọng nói tự nhiên với các giọng đọc có thể lựa chọn, đầu ra đa định dạng và khả năng tổng hợp theo luồng để mang lại trải nghiệm phản hồi nhanh. Các trường hợp sử dụng điển hình bao gồm trợ lý giọng nói, IVR và luồng liên hệ, tính năng đọc to thông tin sản phẩm và thuyết minh nội dung truyền thông. Các điểm nổi bật về kỹ thuật bao gồm truyền phát theo luồng dựa trên API và xuất ra các định dạng âm thanh phổ biến như MP3 và WAV.
GPT-4o Transcribe là một mô hình chuyển âm thanh thành văn bản dành cho nhận dạng giọng nói đa ngôn ngữ với độ trễ thấp. Mô hình hỗ trợ truyền phát thời gian thực và chuyển biên theo lô từ các định dạng âm thanh phổ biến, kèm dấu câu và phân đoạn câu. Các trường hợp sử dụng điển hình bao gồm phụ đề trực tiếp, đầu vào cho trợ lý giọng nói, ghi chú cuộc họp, và chuyển biên nội dung truyền thông hoặc ghi âm cuộc gọi. Các điểm nổi bật kỹ thuật bao gồm hỗ trợ dạng thức âm thanh, xử lý nội dung dài, và API phù hợp cho các quy trình tương tác và phía máy chủ.
GPT-4o mini Search Preview là một mô hình đa phương thức nhỏ gọn thuộc dòng GPT-4o, được tối ưu cho các tương tác định hướng tìm kiếm và quy trình truy xuất. Mô hình này diễn giải và tái diễn đạt truy vấn, tổng hợp câu trả lời súc tích, và có thể kiểm chứng câu trả lời thông qua tìm kiếm bên ngoài khi được tích hợp qua cơ chế gọi công cụ/hàm. Các trường hợp sử dụng điển hình bao gồm trợ lý tìm kiếm trong sản phẩm, hỏi đáp trên cơ sở tri thức, khám phá sản phẩm trong thương mại điện tử, và hiểu truy vấn phục vụ xếp hạng và định tuyến. Các điểm nổi bật kỹ thuật bao gồm đầu vào văn bản và hình ảnh, tuân thủ hướng dẫn, định dạng đầu ra có cấu trúc, và tích hợp sử dụng công cụ cho các pipeline RAG.
GPT-4o mini Audio Preview là mô hình đa phương thức nhỏ gọn để xây dựng các ứng dụng hội thoại bằng âm thanh. Mô hình hỗ trợ nhập và xuất giọng nói song song với văn bản, cho phép nhận dạng giọng nói, tổng hợp giọng nói và đối thoại kết hợp văn bản–âm thanh, kèm khả năng gọi công cụ/hàm cho các hành động có cấu trúc. Các trường hợp sử dụng điển hình gồm trợ lý giọng nói, phiên âm theo luồng kèm tóm tắt, quy trình IVR và call-bot, cũng như các trợ lý trong ứng dụng có hỗ trợ âm thanh. Các điểm nổi bật kỹ thuật bao gồm I/O âm thanh, phản hồi theo luồng, khả năng làm theo chỉ dẫn và tích hợp qua các API trò chuyện và công cụ.
GPT-4o mini Realtime Preview là một mô hình đa phương thức thời gian thực dành cho các trải nghiệm giọng nói và thị giác mang tính tương tác. Mô hình xử lý giọng nói, văn bản và hình ảnh với đầu vào và đầu ra dạng luồng, cùng khả năng gọi công cụ/hàm để thực hiện các hành động có cơ sở. Các trường hợp sử dụng điển hình bao gồm trợ lý giọng nói, xử lý cuộc gọi trực tiếp, tạo phụ đề thời gian thực và hỏi đáp về nội dung thị giác từ camera hoặc màn hình. Các điểm nổi bật về kỹ thuật gồm âm thanh hai chiều, khả năng hiểu thị giác, phản hồi dạng luồng và đầu ra có cấu trúc thông qua các hàm.

GPT-4o mini Audio là một mô hình đa phương thức dành cho các tương tác bằng giọng nói và văn bản. Nó thực hiện nhận dạng giọng nói, dịch và chuyển văn bản thành giọng nói, tuân theo chỉ dẫn, và có thể gọi các công cụ để thực hiện các hành động có cấu trúc với phản hồi theo luồng. Các trường hợp sử dụng điển hình bao gồm trợ lý giọng nói thời gian thực, phụ đề và dịch trực tiếp, tóm tắt cuộc gọi, và các ứng dụng điều khiển bằng giọng nói. Các điểm nổi bật về kỹ thuật bao gồm đầu vào và đầu ra âm thanh, phản hồi theo luồng, gọi hàm, và xuất JSON có cấu trúc.
An Ada-based text embedding model optimized for various NLP tasks.
A small text embedding model for efficient processing.
A large text embedding model for a wide range of natural language processing tasks.
Một mô hình AI tiên tiến để tạo ra hình ảnh từ các mô tả bằng văn bản.
New version of DALL-E for image generation.
O4-mini là một mô hình trí tuệ nhân tạo do OpenAI cung cấp.
O3-mini là một mô hình trí tuệ nhân tạo do OpenAI cung cấp.
O3 là một mô hình trí tuệ nhân tạo do OpenAI cung cấp.
O1-pro is an artificial intelligence model provided by OpenAI.
O1 is an artificial intelligence model provided by OpenAI.
gpt-oss-20b là một mô hình trí tuệ nhân tạo do cloudflare-workers-ai cung cấp.
gpt-oss-120b là một mô hình trí tuệ nhân tạo do cloudflare-workers-ai cung cấp.
GPT-4o mini là một mô hình trí tuệ nhân tạo do OpenAI cung cấp.
GPT-4o là mô hình đa phương thức tiên tiến nhất của OpenAI, nhanh hơn và rẻ hơn GPT-4 Turbo, với khả năng thị giác mạnh hơn. Mô hình này có ngữ cảnh 128K và mốc kiến thức đến tháng 10 năm 2023. Các mô hình thuộc dòng 1106 trở lên hỗ trợ tool_calls và function_call. Mô hình này hỗ trợ độ dài ngữ cảnh tối đa 128,000 token.
GPT-4.1 nano là một mô hình trí tuệ nhân tạo do OpenAI cung cấp. gpt-4.1-nano: Có cửa sổ ngữ cảnh lớn hơn—hỗ trợ tới 1 triệu token ngữ cảnh và tận dụng ngữ cảnh đó tốt hơn nhờ khả năng hiểu ngữ cảnh dài được cải thiện. Có mốc kiến thức được cập nhật là tháng 6 năm 2024. Mô hình này hỗ trợ độ dài ngữ cảnh tối đa là 1,047,576 token.
GPT-4.1 mini là một mô hình trí tuệ nhân tạo do OpenAI cung cấp. gpt-4.1-mini: Một bước nhảy vọt đáng kể về hiệu năng của mô hình nhỏ, thậm chí vượt qua GPT-4o trong nhiều bài đánh giá điểm chuẩn. Nó đạt hoặc vượt GPT-4o trong các đánh giá trí tuệ, đồng thời giảm độ trễ gần một nửa và chi phí tới 83%. Mô hình này hỗ trợ độ dài ngữ cảnh tối đa là 1,047,576 token.
GPT-4.1 là một mô hình trí tuệ nhân tạo do OpenAI cung cấp. gpt-4.1-nano: Có cửa sổ ngữ cảnh lớn hơn—hỗ trợ tới 1 triệu token ngữ cảnh và có khả năng tận dụng tốt hơn ngữ cảnh đó nhờ khả năng hiểu ngữ cảnh dài được cải thiện. Có mốc kiến thức được cập nhật đến tháng 6 năm 2024. Mô hình này hỗ trợ độ dài ngữ cảnh tối đa 1,047,576 token.
coming soon