Câu hỏi thường gặp về chế độ nhanh

Cập nhật: 06/10/2026 • Biên dịch & Hướng dẫn kỹ thuật bởi vMixGPT

Các câu hỏi thường gặp về chế độ Nhanh và hạng dịch vụ Siêu nhanh.

Chúng tôi cung cấp chế độ Nhanh cho khách hàng API muốn truy cập hiệu suất nhanh hơn và ổn định hơn trên một số mô hình nhất định. Dưới đây là câu trả lời cho các câu hỏi thường gặp về cách thức hoạt động, giá cả, khả dụng của mô hình, giới hạn tốc độ, độ tin cậy, chính sách và điều kiện đủ điều kiện.

Lưu ý: Xử lý ưu tiên đã được đổi tên thành Chế độ nhanh vào ngày 30 tháng 7 năm 2026. Bạn có thể sử dụng service_tier: priority hoặc service_tier: fast trong các yêu cầu API của mình.

Tìm hiểu thêmở đây.

Chế độ Nhanh có khả dụng ở tất cả các khu vực không?

Khả năng sử dụng chế độ Nhanh phụ thuộc vào các luật và quy định áp dụng tại từng khu vực pháp lý. Vui lòng liên hệ Giám đốc Tài khoản của bạn nếu bạn có thắc mắc về khả năng sử dụng ở khu vực của bạn.

Cách nó hoạt động

Khách hàng có thể chuyển hướng lưu lượng truy cập sang chế độ Nhanh cho từng yêu cầu bằng cách sử dụng tham số service_tier hiện có, với tùy chọnservice_tier = "nhanh".

Các token được phục vụ bởi chế độ Nhanh sẽ được tính phí theo từng token, với mức giá cao hơn so với mức chi phí xử lý Chuẩn.

Ngoài việc được cấu hình ở cấp độ yêu cầu, bạn cũng có thể mặc định một dự án sang chế độ Nhanh trong Cài đặt Dự án > Mức Dịch vụ Mặc định: Nhanh. Bạn vẫn có thể ghi đè theo từng yêu cầu. Chọn Nhanh trong cài đặt dự án của bạn tương đương với chọn Ưu tiên.

Điều này tương tác như thế nào với Cấp độ Quy mô?

Mức Thang sẽ vẫn tách biệt với chế độ Nhanh. Các yêu cầu gửi đến chế độ Nhanh sẽ được tính phí riêng và sẽ không được tính vào các gói TPM Mức Thang mà bạn đã mua.

Tôi có thể tự động gửi lưu lượng tràn của Mức Cân đến chế độ Nhanh không?

Không. Lưu lượng gửi đến Bậc Thang sẽ không tự động tràn sang chế độ Nhanh.

Chế độ Nhanh được tính phí như thế nào?

Các token được phục vụ bởi chế độ Nhanh sẽ được tính phí theo từng token, với mức giá cao hơn so với mức chi phí xử lý Chuẩn.

Cam kết hàng năm của tôi có gắn với một chế độ xử lý cụ thể không?

Không. Tất cả các chế độ xử lý đều tính vào cam kết chi tiêu hàng năm của doanh nghiệp của bạn.

Tôi còn được giảm giá trên các token đầu vào được lưu trong bộ nhớ đệm không?

Vâng! Các đầu vào được lưu trong bộ nhớ đệm nhận cùng mức giảm giá 50-75% như trong xử lý Tiêu chuẩn.

Làm thế nào để tôi xem mức sử dụng và chi tiêu chế độ Nhanh của mình?

Để xem các token được xử lý bởi chế độ Nhanh (trước đây gọi là Xử lý Ưu tiên), hãy vào bảng điều khiển Sử dụng, chọn Hoàn thành Chat hoặc Phản hồi, và Nhóm theo Cấp dịch vụ.

Để xem chi phí chế độ Nhanh, hãy vào bảng điều khiển Sử dụng, và chọn Nhóm theo Mục Dòng.

Trên bảng điều khiển Sử dụng, các yêu cầu sử dụng priority hoặc fast làm service_tier sẽ tiếp tục xuất hiện dưới dạng priority. Điều này sẽ được cập nhật cho các mô hình trong tương lai.

Mô hình

Chế độ Nhanh có sẵn cho ngữ cảnh dài, các mô hình được tinh chỉnh, nhúng, v.v. không?

Hiện tại thì không. Chúng tôi sẽ đánh giá trong tương lai liệu có nên cung cấp chế độ Nhanh trên các sản phẩm khác ngoài các mẫu mới nhất của chúng tôi hay không.

Các phương thức khác hoạt động với chế độ Nhanh như thế nào?

Chế độ nhanh hỗ trợ cùng các khả năng đa phương thức có sẵn trên Chuẩn. Cụ thể, hình ảnh có thể được sử dụng làm đầu vào cho xử lý Ưu tiên và được xử lý với độ trễ nhanh giống nhau.

Các mẫu trong tương lai có được hỗ trợ không?

Chúng tôi dự định cung cấp chế độ Nhanh trên các mô hình GPT mới, nhưng chúng tôi không đảm bảo rằng mọi mô hình đều sẽ được hỗ trợ.

Giới hạn tần suất

Các giới hạn tốc độ là gì?

Tiêu thụ xử lý ưu tiên được coi giống như lưu lượng API tiêu chuẩn đối với giới hạn tốc độ.

Giới hạn tốc độ tăng giảm là gì?

Chế độ Nhanh có các giới hạn tốc độ tăng dần để đảm bảo hiệu suất cao ổn định cho tất cả khách hàng, đồng thời vẫn cung cấp giá linh hoạt theo nhu cầu. Nếu (a) hiệu suất của chế độ Nhanh giảm và (b) lưu lượng của khách hàng tăng quá nhanh, thì trong những trường hợp hiếm hoi, một số yêu cầu có thể bị hạ cấp xuống xử lý Tiêu chuẩn thay vào đó.

Giới hạn tốc độ tăng chế độ Nhanh hiện tại được định nghĩa trong tài liệu chính của chúng tôi tại đây.

Các phương pháp tốt nhất để duy trì trong giới hạn tốc độ tăng của bạn

Tăng dần lượng truy cập khi thay đổi các mô hình. Ví dụ, nếu ứng dụng của bạn đang chuyển từ một bản chụp trước đó sang một bản mới, hãy sử dụng cờ tính năng để chuyển lưu lượng truy cập trong vài giờ thay vì tất cả cùng một lúc.

Tránh chạy các tác vụ xử lý dữ liệu lớn hoặc công việc không đồng bộ ở chế độ Nhanh. Những công việc này có thể làm tăng lưu lượng rất nhanh, và thường không cần hiệu suất cải thiện của chế độ Nhanh.

Nếu bạn thường xuyên gặp giới hạn tốc độ tăng, hãy cân nhắc mua hạn mức cấp độ Scale thay vào đó.

Giới hạn tốc độ tăng có được chia sẻ giữa các dự án hoặc tổ chức của tôi không?

Vâng, tất cả lưu lượng của bạn đều góp phần vào cùng một giới hạn tốc độ tăng.

Chính sách

Điều gì sẽ xảy ra nếu Chế độ Nhanh không đạt được mục tiêu độ trễ?

Vui lòng liên hệ với AD của bạn nếu có bất kỳ câu hỏi hoặc thắc mắc nào. SLA chế độ nhanh sẽ được xử lý giống như SLA cấp độ Scale; sẽ cung cấp tín dụng dịch vụ nếu chúng tôi không đáp ứng các SLA đó cho khách hàng theo hợp đồng Doanh nghiệp trong khoảng thời gian nhất định.

Chế độ Nhanh có tương thích với Lưu trữ Dữ liệu không?

Vâng.

Chế độ Nhanh có tương thích với ZDR và BAA không?

Vâng.

Siêu nhanh cho GPT-6 Astra

Ultrafast là một cấp dịch vụ riêng biệt cho các khối lượng công việc cần phản hồi GPT-6 Astra có độ trễ thấp hơn, chẳng hạn như các ứng dụng tương tác và luồng công việc lập trình.

Hướng dẫn về giá chế độ nhanh, giới hạn tốc độ và chính sách áp dụng cho các yêu cầu sử dụngservice_tier="nhanh". Các yêu cầu siêu nhanh sử dụng riêngservice_tier="siêu nhanh"tầng.

Làm thế nào để tôi gửi một yêu cầu Ultrafast?

Đối với một tổ chức có truy cập Siêu nhanh, hãy sử dụng API Phản hồi với:

  • Mô hình:gpt-6-astra

  • Cấp độ dịch vụ:cực nhanh

  • Tiêu đề yêu cầu:Cấp-Độ-Dịch-Vụ-OpenAI: siêu-nhanh

Tiêu đề yêu cầu là bắt buộc ngoài cài đặt cấp dịch vụ.

Đối với các ứng dụng thực hiện các cuộc gọi công cụ,Chế độ WebSocketcho phép bạn tái sử dụng kết nối qua nhiều lượt và giảm chi phí kết nối.

Tôi có thể sử dụng cùng một tiêu đề yêu cầu cho các cấp dịch vụ khác không?

Trong suốt giai đoạn alpha siêu nhanh, theCấp-độ-Dịch-vụ-OpenAIchỉ chấp nhận tiêu đềcực nhanh. Gửi một giá trị khác, bao gồmmặc định,nhanh, hoặccăng, trả về lỗi HTTP 400. Bỏ qua tiêu đề này khi sử dụng một cấp bậc khác.

Tôi có thể sử dụng Ultrafast trong Work hoặc Codex không?

Ultrafast cũng có sẵn trong Work và Codex cho các kế hoạch và không gian làm việc đủ điều kiện. Điều kiện và cách sử dụng gói ChatGPT khác với quyền truy cập API.

XemChatGPT Công việc và Codexvề chi tiết về khả năng sẵn có và cách sử dụng.

Chính sách hỗ trợ doanh nghiệp
LIÊN HỆ TƯ VẤN CÁC DỊCH VỤ AI
Hỗ trợ tư vấn, đào tạo và chuyển giao AI cho cá nhân, doanh nghiệp và tổ chức.
Nguồn tài liệu tham khảo: Bài viết được chuyển ngữ và tổng hợp từ tài liệu hỗ trợ chính thức của OpenAI Help Center (ChatGPT): https://help.openai.com/en/articles/11647665-fast-mode-faq ↗
Bản quyền nội dung gốc thuộc về OpenAI. Bản dịch tiếng Việt phục vụ mục đích học tập và tra cứu cộng đồng trên vMixGPT.
Chat Zalo Chat Zalo
Gọi ngay Chat