Hiểu và đếm token

Cập nhật: 06/10/2026 • Biên dịch & Hướng dẫn kỹ thuật bởi vMixGPT

Tìm hiểu cách các token đầu vào, đầu ra, lưu trong bộ nhớ đệm và suy luận ảnh hưởng đến việc sử dụng API, giới hạn mô hình và chi phí.

Tổng quan

Token là các đơn vị mà các mô hình của OpenAI sử dụng để xử lý văn bản. Một token có thể đại diện cho một ký tự, một phần của từ, một từ hoàn chỉnh, hoặc dấu câu. Khoảng trắng cũng ảnh hưởng đến cách văn bản được chia thành các token.

Số lượng token không giống với số lượng từ. Cùng một đoạn văn bản có thể tạo ra số lượng token khác nhau tùy thuộc vào mô hình, mã hóa của nó và ngôn ngữ.

Hiểu cách văn bản trở thành các token

Khi bạn gửi tin nhắn văn bản đến một mô hình:

  1. Văn bản được chia thành các token.

  2. Mô hình xử lý những token đó.

  3. Mô hình tạo ra các token đầu ra. Chúng có thể bao gồm văn bản mà bạn nhận được và, đối với các mô hình lý luận, các token lý luận nội bộ mà không được hiển thị dưới dạng văn bản câu trả lời.

Sử dụng ước lượng sơ bộ cho văn bản tiếng Anh

Những ước lượng này có thể giúp bạn đánh giá kích thước của văn bản tiếng Anh:

  • 1 token xấp xỉ 4 ký tự.

  • 1 token khoảng bằng ba phần tư một từ.

  • 100 token khoảng 75 từ.

Đây là các ước tính, không phải số đếm chính xác. Độ dài câu và đoạn văn thay đổi, và các ngôn ngữ khác có thể có mối quan hệ khác nhau giữa ký tự, từ và token.

Tính đến khoảng trắng và chữ hoa

Một từ có thể được chia thành các token khác nhau tùy thuộc vào cách viết, việc viết hoa và văn bản xung quanh nó.

Ví dụ, red, Red, và red không chứa văn bản giống hệt: ví dụ cuối cùng có một khoảng trắng ở đầu. Một bộ mã hóa có thể đại diện cho chúng khác nhau.

Các ID token cũng phụ thuộc vào mã hóa. Đừng cho rằng một ID token ví dụ áp dụng cho mọi mô hình.

Phân biệt các token đầu vào và đầu ra

Thể loại Những gì nó mô tả
Các token đầu vào Các token được cung cấp cho mô hình trong một yêu cầu. Chúng cũng được gọi là token gợi ý.
Các token đầu ra Các token được tạo ra bởi mô hình. hoàn thiện hội thoại (Chat Completions) gọi những token này là completion tokens.
Các token đầu vào đã được lưu trong bộ nhớ đệm Các token nhập được tái sử dụng thông qua lưu trữ đệm lệnh. Giá của chúng có thể khác với các token nhập không được lưu trữ đệm.
Các token lý luận Các token mà một mô hình suy luận sử dụng nội bộ trước khi đưa ra câu trả lời hiển thị của nó.

Các token lập luận không hiển thị dưới dạng văn bản câu trả lời, nhưng chúng được tính vào mức sử dụng đầu ra và bị tính phí như các token đầu ra.

Một câu trả lời hiển thị ngắn có thể sử dụng nhiều token hơn so với những gì văn bản hiển thị gợi ý.

Đếm token trước khi gửi yêu cầu

Đếm văn bản thuần

Sử dụngBộ phân tách từđể xem văn bản được chia thành các token như thế nào.

Để phân tách văn bản thuần theo chương trình, hãy sử dụngtiktoken. Chọn mã hóa cho mô hình mục tiêu của bạn, chẳng hạn như với tiktoken.encoding_for_model(model).

Số lượng token văn bản thuần không nhất thiết bao gồm tất cả các token trong một yêu cầu API. Cấu trúc tin nhắn, công cụ, sơ đồ, hình ảnh và tệp có thể ảnh hưởng đến tổng số đầu vào.

Đếm một đầu vào Phản hồi hoàn chỉnh

Để có một đầu vào API Phản hồi đầy đủ, hãy sử dụngAPI đếm token đầu vào.

Nó chấp nhận các định dạng đầu vào của Phản hồi, bao gồm tin nhắn, hình ảnh, tệp, công cụ và cuộc trò chuyện. Số lượng của nó bao gồm các token định dạng được sử dụng cho cấu trúc yêu cầu, chẳng hạn như vai trò và ranh giới của tin nhắn.

Số lượng đầu vào không dự đoán được bao nhiêu token đầu ra mà mô hình sẽ tạo ra.

Kiểm tra việc sử dụng token thực tế

Sau khi có một yêu cầu, kiểm tra thông tin sử dụng của nó. Tên trường khác nhau tùy theo điểm cuối:

  • hoàn thiện hội thoại (Chat Completions) báo cáo prompt_tokens, completion_tokens và total_tokens.

  • Phản hồi báo cáo input_tokens, output_tokens và total_tokens.

Bạn cũng có thể xem lại hoạt động theo thời gian trong Bảng điều khiển Sử dụng. Để biết hướng dẫn, bao gồm cả việc sử dụng phát trực tuyến, hãy xem:Xem xét việc sử dụng và chi phí API.

Ở trong giới hạn của mô hình

Kiểm tra tài liệu của mô hình của bạn để biết cửa sổ ngữ cảnh và đầu ra tối đa của nó. Những giới hạn này có thể khác nhau giữa các mô hình.

Cửa sổ ngữ cảnh giới hạn số lượng token mà mô hình có thể xử lý trong một yêu cầu. Các mô hình cũng có giới hạn đầu ra. Đối với các mô hình suy luận, hãy để chỗ cho các token suy luận cũng như câu trả lời hiển thị.

Nếu dữ liệu nhập của bạn quá lớn, bạn có thể:

  • Rút ngắn hoặc diễn đạt lại câu lệnh.

  • Loại bỏ bối cảnh không cần thiết hoặc bị lặp lại.

  • Chia các đầu vào lớn thành các phần nhỏ hơn.

  • Tóm tắt hoặc xử lý trước văn bản trước khi gửi.

Sử dụng cài đặt output-token được hỗ trợ bởi điểm cuối và mô hình của bạn. hoàn thiện hội thoại (Chat Completions) sử dụng max_completion_tokens; Responses sử dụng max_output_tokens.

Các giới hạn kích thước yêu cầu này tách biệt với giới hạn tốc độ API và giới hạn sử dụng hoặc chi tiêu hàng tháng. Xem xéttài liệu mô hìnhcho mô hình mà bạn sử dụng.

Hiểu giá token

Đối với định giá API dựa trên token, mức giá phụ thuộc vào mô hình và loại token. Token đầu vào, token đầu vào được lưu trong bộ nhớ đệm và token đầu ra có thể có mức giá khác nhau. Các khả năng API khác có thể sử dụng các đơn vị tính phí khác nhau.

Kiểm traTrang giá APIcho các mức hiện tại.

Khi so sánh các mô hình, hãy xem xét tổng số token và chi phí cần thiết để hoàn thành nhiệm vụ của bạn. Giá thấp hơn cho một triệu token không nhất thiết tạo ra tổng chi phí thấp hơn: các mô hình có thể phân tích cùng một văn bản khác nhau và tạo ra lượng đầu ra hoặc suy luận khác nhau.

Kiểm tra các nhiệm vụ tiêu biểu thay vì chỉ so sánh độ dài phản hồi hiển thị.

Tài khoản cho nhiều hoàn thành

Khi một điểm cuối và mô hình hỗ trợ tạo nhiều kết quả hoàn thành, các kết quả bổ sung đó cũng sử dụng token.

Đối với Hoàn thành Chat, việc đặt n lớn hơn 1 sẽ tạo ra nhiều lựa chọn. Bạn sẽ bị tính phí cho các token được tạo ra trên các lựa chọn đó.

Đối với API Completions cũ, best_of có thể tạo ra các ứng viên mà không phải tất cả đều được trả về. Ví dụ, best_of = 3 có thể tạo ra tối đa 3 × max_tokens token hoàn thành trên các ứng viên.

Các tham số này là cụ thể cho từng điểm cuối. Đừng cho rằng n hoặc best_of được hỗ trợ bởi API hoặc mô hình khác.

Chính sách hỗ trợ doanh nghiệp
LIÊN HỆ TƯ VẤN CÁC DỊCH VỤ AI
Hỗ trợ tư vấn, đào tạo và chuyển giao AI cho cá nhân, doanh nghiệp và tổ chức.
Nguồn tài liệu tham khảo: Bài viết được chuyển ngữ và tổng hợp từ tài liệu hỗ trợ chính thức của OpenAI Help Center (ChatGPT): https://help.openai.com/en/articles/4936856-understanding-and-counting-tokens ↗
Bản quyền nội dung gốc thuộc về OpenAI. Bản dịch tiếng Việt phục vụ mục đích học tập và tra cứu cộng đồng trên vMixGPT.
Chat Zalo Chat Zalo
Gọi ngay Chat