LIÊN HỆ HOTLINE/ZALO: 0981.243.678
Tối ưu hóa tải lên tệp trong ChatGPT Enterprise
Hiểu cách các tính năng của ChatGPT Enterprise xử lý tập tin dựa trên loại, số lượng và kích thước của chúng. Cải thiện kết quả đầu ra dựa trên yêu cầu của tập tin.
ChatGPT Doanh Nghiệphiện hỗ trợ đọc và hiểu các hình ảnh (hình ảnh, biểu đồ, sơ đồ, v.v.) được nhúng trongPDFcác tệp được bao gồm trong lời nhắc. Người dùng có thể tải lên một tệp PDF, và ChatGPT có thể diễn giải văn bảnvàbất kỳ yếu tố hình ảnh nào trong tệp đó.
Để biết chi tiết, xemHỏi đáp về Truy xuất Hình ảnh với PDF.
ChatGPT Enterprise cho phép bạn tải lên tệp theo nhiều cách:
-
Trực tiếp từ máy tính của bạn
-
Như mộtTệp Dự Án
-
Từ mộtHành động GPT
Hướng dẫn này giải thích cách các tính năng của ChatGPT Enterprise xử lý tệp dựa trên loại, số lượng và kích thước của chúng, đồng thời thảo luận về các chiến lược cải thiện kết quả dựa trên yêu cầu của tệp.
Tóm tắt
ChatGPT Enterprise xử lý các loại tệp khác nhau theo cách rất khác nhau: trích xuất văn bản từ các tài liệu văn bản như PDF, PowerPoint và Word, phân tích dữ liệu có cấu trúc từ bảng tính bằng mã Python, và mô tả các tệp hình ảnh thông qua GPT-Vision. Hiểu loại tệp nào kích hoạt quy trình nào là chìa khóa để có được kết quả như mong đợi.
Đối với các tài liệu dựa trên văn bản, ChatGPT Enterprise bao gồm càng nhiều văn bản liên quan càng tốt ngay bên cạnh lệnh nhắc và sử dụng hệ thống tìm kiếm để truy cập thông tin bổ sung. Điều này hoạt động tốt để trả lời các câu hỏi cụ thể. Tuy nhiên, phương pháp này có thể gặp khó khăn với các nhiệm vụ phức tạp như tóm tắt các tài liệu rất lớn hoặc so sánh nhiều tệp lớn. Hãy tiếp tục đọc để hiểu các chiến lược cải thiện kết quả của bạn.
Xử lý tệp dựa trên loại
ChatGPT Enterprise xử lý các tệp theo ba cách chính: trích xuất văn bản, phân tích mã và diễn giải hình ảnh.loại tệpxác định quy trình làm việc mà ChatGPT Enterprise sẽ theo.
| Truy xuất dựa trên văn bản | Trình thông dịch mã | Xử lý ảnh | Truy xuất hình ảnh | |
|---|---|---|---|---|
| Ví dụ về loại tệp | pptx, docx, txt, md, json, xml, pdf* * PDF đã tải lên dưới dạng Kiến thức GPT |
csv, xls, xlsx* *Lưu ý: Trình thông dịch mã có thể hoạt động trên bất kỳ loại tệp nào, nhưng ChatGPT Enterprise thường mặc định sử dụng CI cho bảng tính |
jpg, png | pdf* * PDF được bao gồm trong các yêu cầu của người dùng |
| Hành vi | Trích xuất văn bản từ tệp – một số văn bản được dán (“nhét”) trực tiếp vào cửa sổ ngữ cảnh; một số văn bản được lưu trữ để tìm kiếm | Trình thông dịch mã chuyển tệp cho Python để xử lý | Hình ảnh được các mô hình đa phương thức giải thích một cách tự nhiên, tùy thuộc vào | Một hệ lai giữa truy xuất văn bản và xử lý hình ảnh. Văn bản được trích xuất kỹ thuật số, và nội dung hình ảnh được diễn giải một cách tự nhiên bởi các mô hình đa phương tiện. |
Đối với các tệp chỉ chứa văn bản, tệp hình ảnh hoặc các tệp dữ liệu được cấu trúc rõ ràng (ví dụ: một bảng Excel các giao dịch), những phân chia này đại diện cho hành vi tốt nhất có thể.
Có một số lĩnh vực mơ hồ ít rõ ràng hơn, ví dụ:
-
Hình ảnh nhúng trong các tệp khác ngoài PDF sẽ không được xử lý. Để bao gồm chúng, hãy chuyển đổi tệp sang PDF trước khi tải lên.
-
ChatGPT Enterprise sẽ luôn sử dụng Trình thông dịch Mã (Code Interpreter) để tương tác với bảng tính, ngay cả khi tài liệu chứa một lượng lớn văn bản. Ví dụ, nếu bạn yêu cầu ChatGPT Enterprise dịch một tệp CSV với 10 dòng văn bản, nó sẽ cố gắng dịch tệp bằng thư viện Python, điều này kém chính xác hơn so với việc cho phép mô hình tạo bản dịch trực tiếp. Để giảm bớt điều này, hãy thử xuất bảng tính sang định dạng văn bản (ví dụ PDF).
-
Tương tự, nếu bạn tải lên một bảng giao dịch có cấu trúc được chứa trong tệp JSON, ChatGPT Enterprise sẽ diễn giải tệp này dưới dạng văn bản thuần. Nếu bạn muốn phân tích dữ liệu có trong tệp JSON, hãy chỉ dẫn mô hình sử dụng Trình thông dịch mã trong lời nhắc của bạn.
Xử lý tập tin dựa trên kích thước
ChatGPT Enterprise sử dụng các mô hình với cửa sổ ngữ cảnh tối đa là 128k token (khoảng 200 trang văn bản). Tuy nhiên, không phải tất cả các token đều được sử dụng để kết hợp văn bản từ các tệp đã tải lên. Số lượng token “nhồi” khác nhau tùy theo loại hình sử dụng.
ChatGPT Enterprise “nhồi” một lượng văn bản nhất định, và phần văn bản còn lại được gửi vào một chỉ mục tìm kiếm riêng tư (một “vector store”, là một loại cơ sở dữ liệu được thiết kế để lưu trữ và truy xuất hiệu quả một lượng lớn văn bản). Khi bạn đặt câu hỏi, ChatGPT Enterprise sẽ đưa vào văn bản đã bao gồm cùng với các đoạn liên quan được truy xuất từ chỉ mục tìm kiếm riêng tư.
Nếu bạn tải lên một tài liệu, ChatGPT Enterprise sẽ bao gồm văn bản từ đầu cho đến khi đạt đến giới hạn của nó. Nếu bạn tải lên nhiều tài liệu, ChatGPT Enterprise sẽ bao gồm một phần hoặc toàn bộ của từng tài liệu. Tất cả văn bản từ các tài liệu cũng được gửi đến một chỉ mục tìm kiếm riêng tư.
Nhồi nhét ngữ cảnh cho các tài liệu văn bản
Tính năng này đang được phát triển tích cực. Do đó, các chi tiết sau đây có thể thay đổi mà không cần thông báo trước.
ChatGPT Enterprise có thể xử lý lên đến110 nghìn tokentừ các tài liệu đã tải lên trong cửa sổ ngữ cảnh. Nếu bạn tải lên một hoặc nhiều tài liệu với tổng số token nhỏ hơn 110 nghìn, toàn bộ nội dung sẽ được bao gồm.
Đối với một tài liệu đơn lẻ vượt quá 110.000 token, chỉ 110.000 token đầu tiên sẽ được bao gồm, bắt đầu từ đầu. Phần còn lại sẽ chỉ được gửi đến chỉ mục tìm kiếm riêng tư.
Nếu nhiều tài liệu được tải lên và tổng số token của chúng vượt quá 110.000, ChatGPT Enterprise sử dụng một quy trình hai bước để cân bằng việc đại diện tài liệu:
-
Trích xuất tối đa 55.000 token, được phân chiađềutrong số các tài liệu đã tải lên.
-
Đối với các tài liệu không được thể hiện đầy đủ trong bước đầu tiên, phân bổ 55 nghìn token còn lạitỉ lệdựa trên các token còn lại trong mỗi tài liệu.
-
Bất kỳ token còn lại nào chỉ được gửi đến chỉ mục tìm kiếm riêng tư.
Bạn có thể ước lượng số lượng token trong một tài liệu văn bản bằng cách sao chép văn bản của tài liệu vàoBộ phân tích từ OpenAI.
Nhồi nhét ngữ cảnh cho PDF đa phương tiện
Khi người dùng tải lên các tệp PDF chứa cả văn bản và hình ảnh,Truy xuất hình ảnhcho phép ChatGPT xử lý các hình ảnh này một cách tự nhiên cùng với văn bản được trích xuất kỹ thuật số. Các bước sau đây bổ sung cho các quy trình xử lý ngữ cảnh tiêu chuẩn của chúng tôi đối với các tệp PDF đa phương tiện:
-
Trích xuất và Nhúng Hình ảnh: Hình ảnh được trích xuất và nhúng cùng với văn bản kỹ thuật số liên quan của chúng.
-
Tăng quy mô thông minh: Hình ảnh được tự động điều chỉnh kích thước để duy trì sự cân bằng giữa chất lượng thông tin và việc sử dụng hiệu quả cửa sổ ngữ cảnh có sẵn.
Khi các tệp PDF tải lên vượt quá giới hạn 110k token, cả hình ảnh và văn bản đều được nhúng vào chỉ mục tìm kiếm riêng. Các embedding văn bản tham chiếu đến các hình ảnh liên quan, cho phép ChatGPT truy xuất các cặp văn bản-hình ảnh phù hợp dựa trên các truy vấn của người dùng. Các hình ảnh được truy xuất sau đó được xử lý bằng khả năng đa phương tiện gốc của ChatGPT.
Ước lượng chính xác nhu cầu token cho các tệp PDF đa phương tiện là một thách thức. Kiểm tra cho thấy khoảng 350 trang gồm văn bản và hình ảnh sẽ sử dụng tối đa cửa sổ ngữ cảnh 110 nghìn token.
Các chiến lược tìm kiếm dựa trên loại mô hình
Cả các mô hình dòng GPT và dòng o đều hỗ trợ tải tệp lên và sử dụng cùng một logic nhồi nhét ngữ cảnh và nhúng tìm kiếm. Tất cả các mô hình thực hiện tìm kiếm lai đối với một chỉ mục tìm kiếm riêng, kết hợp các phương pháp từ khóa và ngữ nghĩa. Trong một tìm kiếm lai, mô hình tạo ra một cụm từ tìm kiếm dựa trên lời nhắc của người dùng, và chỉ mục tìm kiếm riêng sẽ truy xuất văn bản và hình ảnh liên quan tương ứng.
Tuy nhiên, các mô hình này khác nhau ở cách chúng tìm kiếm qua các tài liệu lớn vượt quá cửa sổ ngữ cảnh:
Các mô hình dòng GPT
-
Tìm kiếm đơn cho mỗi lời nhắc:Các mô hình dòng GPT thực hiện một lần tìm kiếm cho mỗi lời nhắc của người dùng.
-
Các trường hợp sử dụng hiệu quả:Lý tưởng để trả lời các câu hỏi đơn giản có trong tài liệu chi tiết.
Ví dụ về các truy vấn:
-
Chính sách nhân sự về nghỉ hưu sớm là gì?
-
Cái gì có nghĩa làxử_lý_đơn_hànghàm làm?
các mẫu o-series
-
Nhiều tìm kiếm cho mỗi lời nhắc:Có thể thực hiện nhiều tìm kiếm (thường là 2-3) trên mỗi yêu cầu của người dùng, mỗi tìm kiếm với một cụm từ tìm kiếm riêng biệt. Các tìm kiếm được thực hiện tuần tự, và mô hình có thể cập nhật phương pháp tiếp cận của mình dựa trên thông tin thu thập được trong các tìm kiếm trước đó.
-
Các trường hợp sử dụng hiệu quả:Phù hợp hơn cho các câu hỏi phức tạp đòi hỏi nhiều tìm kiếm có mục tiêu trên tài liệu rộng lớn.
Ví dụ về các truy vấn:
-
Chính sách nhân sự về nghỉ hưu sớm, nghỉ phép cho cha mẹ và chuyển công tác ra nước ngoài là gì?
-
Giải thích cái màxử_lý_đơn_hànghàm thực hiện gì, liệt kê tất cả các phương thức được gọi bởi hàm này, và mô tả ngắn gọn từng phương thức được gọi.
Mặc dù có ưu điểm, các mẫu o-series có thể gặp khó khăn khi một truy vấn yêu cầu nhiều hơn ba lần tìm kiếm.
Mẹo cải thiện kết quả tìm kiếm tệp
-
Hãy thử sử dụng một mô hình o-series cho các câu hỏi phức tạp cần nhiều lần tìm kiếm.
-
Hãy nhớ rằng các phản hồi có thể khác nhau tùy thuộc vào loại, số lượng và kích thước của các tài liệu bạn tải lên.
-
Nhìn chung, tải ít tài liệu hơn nhưng tập trung sẽ dẫn đến độ chính xác cao hơn.
-
Chuyển các chủ đề nhiều câu hỏi thành các câu hỏi đơn:
-
Nếu bạn cần biết chính sách nhân sự của từng bang, hãy hỏi từng bang một.
-
Nếu bạn cần tóm tắt nhiều tài liệu, hãy yêu cầu từng tài liệu một. Nếu tài liệu đó dài hàng trăm trang, hãy cân nhắc chia nó thành những phần nhỏ hơn.
-
Bạn có thể yêu cầu ChatGPT Enterprise viết một “bản tóm tắt của các bản tóm tắt” nếu bạn cung cấp cho nó nhiều bản tóm tắt thay vì toàn bộ các tài liệu.
-
-
Nếu bạn có một tệp CSV của RFP (mỗi dòng là một câu hỏi khác nhau), hãy hỏi những câu hỏi đó từng cái một thay vì chỉ tải tệp CSV và yêu cầu một phản hồi duy nhất.
-
-
Tìm cách kiểm tra các phản hồi của mô hình. Ví dụ hướng dẫn GPT được đưa ra dưới đây:
# Bối cảnh
Bạn là một chuyên gia về việc hiểu các tài liệu. Người dùng sẽ đính kèm một tài liệu và đặt câu hỏi. Họ cần có khả năng liên kết câu trả lời của bạn trở lại chính xác phần văn bản mà bạn đã lấy câu trả lời từ đó.
# Hướng dẫn
1. Trả lời câu hỏi của người dùng dựa trên tài liệu đính kèm của họ sử dụng đúng định dạng được cung cấp bên dưới
# Định dạng
- Câu hỏi: { lặp lại câu hỏi của người dùng }
- Trả lời: { cung cấp câu trả lời cho câu hỏi của người dùng }
Nguồn:
- - Số mục: { cung cấp số mục nơi bạn lấy câu trả lời }
- - Tiêu đề mục: { cung cấp tiêu đề mục mà bạn đã lấy câu trả lời từ đó }
- - Văn bản chính xác: { cung cấp văn bản chính xác mà bạn đã lấy câu trả lời từ đó }
# Quy tắc
- Đưa ra câu trả lời rõ ràng và ngắn gọn
- Chỉ cung cấp thông tin được đưa trong tài liệu
- Nếu bạn không thể tìm thấy câu trả lời trong tài liệu, chỉ cần trả lời "Không tìm thấy thông tin."

Liên hệ qua Zalo