LIÊN HỆ HOTLINE/ZALO: 0981.243.678
Cách ChatGPT và các mô hình nền tảng của chúng tôi được phát triển
Tìm hiểu thêm về cách chúng tôi phát triển các mô hình của mình và áp dụng chúng trong các sản phẩm như ChatGPT
Các mô hình nền tảng của OpenAI, bao gồm các mô hình cung cấp sức mạnh cho ChatGPT, được phát triển sử dụng ba nguồn thông tin chính: (1) thông tin có sẵn công khai trên internet, (2) thông tin mà chúng tôi hợp tác với các bên thứ ba để truy cập, và (3) thông tin mà người dùng, các huấn luyện viên con người và các nhà nghiên cứu của chúng tôi cung cấp hoặc tạo ra.
Phát triển các mô hình nền tảng như những mô hình được sử dụng trong ChatGPT bao gồm nhiều giai đoạn, bao gồm chuẩn bị dữ liệu huấn luyện, huấn luyện trước và huấn luyện sau, cũng như đánh giá và cải thiện liên tục sau khi triển khai. Các loại thông tin khác nhau có thể được sử dụng ở các giai đoạn này cho các mục đích khác nhau, bao gồm cải thiện hiệu suất, độ tin cậy và an toàn của mô hình.
Bài viết này cung cấp một cái nhìn tổng quan về thông tin mà chúng tôi sử dụng để giúp phát triển các mô hình này, cách chúng tôi thu thập và sử dụng thông tin đó theo quy định của luật bảo mật, và các biện pháp bảo vệ mà chúng tôi áp dụng trong suốt quá trình đào tạo. Để hiểu cách chúng tôi thu thập và sử dụng thông tin từ người dùng dịch vụ của mình, bao gồm cách từ chối việc các cuộc trò chuyện với ChatGPT được sử dụng để cải thiện mô hình của chúng tôi, vui lòng xemChính sách bảo mậtvàbài viết trung tâm trợ giúp này.
ChatGPT là gì và nó hoạt động như thế nào?
ChatGPT là một dịch vụ dựa trên trí tuệ nhân tạo mà bạn có thể truy cập qua internet hoặc ứng dụng. Bạn có thể sử dụng ChatGPT cho nhiều loại công việc khác nhau, bao gồm tổ chức và tóm tắt thông tin, hỗ trợ dịch thuật, hỗ trợ lập trình, nghiên cứu và phân tích, hoàn thành các tác vụ nhiều bước trên các công cụ, phân tích hoặc tạo hình ảnh, truyền cảm hứng sáng tạo và ý tưởng, cũng như các hoạt động hàng ngày khác. ChatGPT được thiết kế để hiểu và phản hồi các câu hỏi và hướng dẫn của người dùng bằng cách học các mẫu từ một lượng lớn thông tin, bao gồm văn bản, hình ảnh, âm thanh và video.
Trong quá trình huấn luyện, mô hình phân tích các mối quan hệ trong dữ liệu này—chẳng hạn như cách các từ thường xuất hiện cùng nhau trong ngữ cảnh—và sử dụng sự hiểu biết đó để dự đoán từ có khả năng xuất hiện tiếp theo khi tạo phản hồi, từng từ một. Văn bản có thể được chuyển đổi thành các đơn vị nhỏ hơn, đôi khi được gọi là “thẻ” có thể đại diện cho toàn bộ từ, một phần của từ, hoặc dấu câu. Token là những khối xây dựng của văn bản mà mô hình xử lý. Tương tự, các mô hình tạo ra các dạng nội dung khác, như hình ảnh, học các mẫu về cách các điểm ảnh liên quan với nhau và với các chú thích liên quan trong dữ liệu huấn luyện.
Ví dụ, trong quá trình học của mô hình (được gọi là “huấn luyện”), mô hình có thể được giao nhiệm vụ hoàn thành một câu như: “Thay vì rẽ trái, cô ấy đã rẽ ___.” Ban đầu trong quá trình huấn luyện, các phản hồi của nó chủ yếu là ngẫu nhiên. Tuy nhiên, khi mô hình xử lý và học từ một khối lượng lớn văn bản, nó trở nên giỏi hơn trong việc nhận ra các mẫu và dự đoán từ tiếp theo có khả năng xuất hiện nhất. Quá trình này được lặp lại trên hàng triệu câu để tinh chỉnh hiểu biết của nó và cải thiện độ chính xác.
Bởi vì có nhiều cách hợp lý để hoàn thành một câu—chẳng hạn như “Thay vì rẽ trái, cô ấy rẽ phải,” “xoay vòng,” hoặc “quay lại”—nên có một yếu tố ngẫu nhiên vốn có trong cách mô hình phản hồi. Do đó, cùng một câu hỏi có thể đưa ra các câu trả lời khác nhau qua các truy vấn khác nhau.
Các mô hình học máy bao gồm các tập hợp lớn các con số, được gọi là “trọng số” hoặc “tham số,” cùng với mã lệnh để giải thích và sử dụng các con số đó. Những mô hình này không lưu trữ hay giữ lại các bản sao của dữ liệu mà chúng được huấn luyện. Thay vào đó, khi một mô hình học, giá trị của các tham số của nó được điều chỉnh nhẹ để phản ánh các mô hình mà nó đã nhận diện. Trong ví dụ trước, mô hình đã cải thiện khả năng từ việc dự đoán các từ ngẫu nhiên sang dự đoán chính xác hơn — không phải bằng cách lưu trữ các câu huấn luyện, mà bằng cách cập nhật các tham số nội bộ của mình. Mô hình không giữ lại các bản sao của các câu, hình ảnh hoặc âm thanh mà nó xử lý trong quá trình huấn luyện. ChatGPT không “sao chép và dán” từ dữ liệu huấn luyện của nó — giống như cách một giáo viên, sau khi nghiên cứu kỹ lưỡng, có thể giải thích các khái niệm bằng cách hiểu các mối quan hệ giữa các ý tưởng mà không cần ghi nhớ hay tạo lại nguyên văn các tài liệu gốc. Khi tạo phản hồi cho yêu cầu của người dùng, mô hình sử dụng các trọng số đã học này để dự đoán và tạo ra nội dung mới.
Loại thông tin nào được sử dụng để dạy ChatGPT?
Đối với nội dung internet công khai, chúng tôi chỉ sử dụng thông tin mà có thể truy cập tự do và công khai trên internet. Điều này có thể bao gồm các trang web công khai, diễn đàn công cộng, blog công khai, bài đăng công khai và các nội dung trực tuyến công khai khác. Ví dụ, nếu bạn tham gia vào một diễn đàn thảo luận trực tuyến công khai hoặc đăng một blog hoặc bài viết công khai khác, chúng tôi có thể sử dụng nội dung có thể truy cập công khai đó cho mục đích huấn luyện mô hình. Tuy nhiên, chúng tôi thực hiện các bước để giảm xử lý thông tin cá nhân trong quá trình huấn luyện.Khi thu thập nội dung trên internet có sẵn công khai, chúng tôi không cố ý thu thập dữ liệu từ các nguồn được biết là nằm sau tường phí hoặc từ web tối. Ngoài ra, chúng tôi áp dụng các bộ lọc để loại bỏ tài liệu mà chúng tôi không muốn mô hình của mình học từ đó, chẳng hạn như ngôn từ thù ghét, nội dung người lớn, các trang web tổng hợp thông tin cá nhân và thư rác. Các thông tin còn lại sau đó được sử dụng để huấn luyện các mô hình của chúng tôi.
Chủ sở hữu trang web có thể quản lý việc liệu nội dung có sẵn công khai từ các trang của họ có thể được truy cập để sử dụng trong đào tạo hay không bằng cách sử dụng các công cụ web tiêu chuẩn như robots.txt để không cho phép GPTBot, có thể thu thập nội dung có sẵn công khai để giúp đào tạo các mô hình của chúng tôi. Chúng tôi cung cấphướng dẫnđể giúp các chủ sở hữu trang web quản lý cách mà các trang web và nội dung của họ tương tác với các hệ thống AI của chúng tôi.
Chúng tôi cũng sử dụng thông tin từ các đối tác bên thứ ba để giúp đào tạo và cải thiện các mô hình của mình. Điều này có thể bao gồm thông tin trong các bộ dữ liệu mà chúng tôi truy cập thông qua các thỏa thuận với bên thứ ba, cũng như thông tin được cung cấp hoặc tạo ra bởi các nhân viên đào tạo và nhà nghiên cứu con người khi được phép theo chính sách và thỏa thuận của chúng tôi. Điều này giúp cải thiện chất lượng, tính an toàn và hiệu suất của các mô hình. Các nguồn này có thể bao gồm văn bản, hình ảnh, âm thanh, video hoặc các loại dữ liệu khác, tùy thuộc vào bộ dữ liệu.
Chúng tôi cũng ngày càng sử dụng dữ liệu tổng hợp trong một số quy trình đào tạo. Ví dụ, chúng tôi có thể sử dụng thông tin và các mô hình của mình để tạo ra các gợi ý tổng hợp, ví dụ đa ngôn ngữ, hoặc các tài liệu đào tạo khác. Dữ liệu tổng hợp có thể giúp cải thiện hiệu suất của mô hình, bao gồm bằng cách bổ sung dữ liệu đào tạo ở những khu vực mà dữ liệu còn hạn chế hoặc không cân bằng, và có thể hỗ trợ các phương pháp tăng cường quyền riêng tư trong phát triển mô hình.
Thông tin cá nhân có được sử dụng để dạy ChatGPT không?
Một phần đáng kể của nội dung trực tuyến liên quan đến thông tin về con người, vì vậy dữ liệu huấn luyện của chúng tôi có thể vô tình bao gồm thông tin cá nhân. Tuy nhiên, chúng tôi thực hiện các bước để giảm việc xử lý thông tin cá nhân trong quá trình huấn luyện của mình.
Chúng tôi sử dụng dữ liệu đào tạo để phát triển các khả năng của mô hình—như dự đoán, lý luận và giải quyết vấn đề—chứ không phải để xây dựng hồ sơ cá nhân, liên hệ với họ, hay cá nhân hóa quảng cáo đối với họ.
Trong một số trường hợp, các mô hình có thể học từ thông tin cá nhân để hiểu cách các yếu tố như tên và địa chỉ hoạt động trong ngôn ngữ, hoặc để nhận diện các nhân vật công chúng và các thực thể nổi tiếng. Điều này giúp mô hình tạo ra các phản hồi chính xác hơn và phù hợp với ngữ cảnh.
Thông tin cá nhân được bảo vệ như thế nào trong quá trình đào tạo?
Chúng tôi thực hiện các bước tích cực để hạn chế việc xử lý thông tin cá nhân trong quá trình đào tạo. Ví dụ, chúng tôi loại trừ các nguồn đã biết tập hợp một lượng lớn dữ liệu cá nhân, áp dụng bộ lọc để giảm thông tin cá nhân trong quá trình đào tạo, và thực hiện các bước để xác định và loại bỏ nội dung trùng lặp nhằm giảm nguy cơ lặp lại dữ liệu đào tạo. Ngoài ra, chúng tôi đào tạo các mô hình của mình để tránh phản hồi các yêu cầu về thông tin riêng tư hoặc nhạy cảm về các cá nhân.
Chúng ta giữ thông tin trong bao lâu
Chúng tôi giữ thông tin trong dữ liệu đào tạo chỉ trong thời gian hợp lý cần thiết cho các mục đích được mô tả trong bài viết này và của chúng tôiChính sách bảo mật, bao gồm việc phát triển và cải thiện các mô hình của chúng tôi và cho các mục đích nghiên cứu khoa học liên quan. Việc lưu giữ thông tin được xem xét định kỳ để đảm bảo tính cần thiết liên tục, và thay đổi tùy thuộc vào loại thông tin và cách thức sử dụng. Khi xác định thời hạn lưu giữ, chúng tôi xem xét các yếu tố như mục đích xử lý thông tin, khối lượng, tính chất và mức độ nhạy cảm của thông tin, nguy cơ tiềm ẩn từ việc sử dụng hoặc tiết lộ trái phép và bất kỳ nghĩa vụ pháp lý nào mà chúng tôi phải tuân thủ.
Việc phát triển ChatGPT tuân thủ các luật về quyền riêng tư như thế nào?
Chúng tôi sử dụng thông tin đào tạo một cách hợp pháp. Các mô hình nền tảng của chúng tôi cung cấp sức mạnh cho nhiều ứng dụng có lợi—bao gồm các công cụ hỗ trợ tiếp cận, hỗ trợ khách hàng, phát triển phần mềm, giáo dục cá nhân hóa và nghiên cứu khoa học. Những khả năng này phụ thuộc vào dữ liệu đào tạo quy mô lớn, bao gồm thông tin công khai và thông tin từ các đối tác bên thứ ba. Chúng tôi áp dụng các biện pháp bảo vệ trong suốt quá trình đào tạo, bao gồm các bước được thiết kế để giảm việc xử lý thông tin cá nhân trong quá trình đào tạo và để giảm thiểu rủi ro, như được mô tả trong bài viết này. Chúng tôi dựa trên các lợi ích hợp pháp theo các luật về quyền riêng tư như GDPR để thu thập và sử dụng thông tin cá nhân có trong thông tin đào tạo, bao gồm để đào tạo và cải thiện các mô hình của chúng tôi cho người dùng và xã hội rộng hơn, phù hợp với sứ mệnh đảm bảo rằng trí tuệ nhân tạo tổng quát mang lại lợi ích cho mọi người, như được giải thích chi tiết hơn trongChính sách bảo mật. Chúng tôi đã hoàn thành một đánh giá tác động bảo vệ dữ liệu để giúp đảm bảo rằng chúng tôi đang thu thập và sử dụng thông tin này một cách hợp pháp và có trách nhiệm.
Khi thông tin có thể được chia sẻ hoặc chuyển giao
Chúng tôi không “bán” thông tin cá nhân, và chỉ tiết lộ thông tin cá nhân trong dữ liệu đào tạo trong những trường hợp hạn chế được mô tả trong Chính sách Quyền riêng tư của chúng tôi. Ví dụ, chúng tôi có thể chia sẻ thông tin với các công ty liên kết, nhà cung cấp và nhà cung cấp dịch vụ hỗ trợ việc phát triển, thử nghiệm và cải thiện các mô hình của chúng tôi. Chúng tôi cũng có thể tiết lộ thông tin với niềm tin tốt rằng hành động đó là cần thiết để tuân thủ nghĩa vụ pháp lý hoặc để bảo vệ quyền lợi, an toàn và an ninh của chúng tôi và của người dùng, nhân viên hoặc công chúng, như được mô tả trongChính sách bảo mật.
Vì hạ tầng của chúng tôi mang tính toàn cầu, thông tin cá nhân trong dữ liệu đào tạo có thể được xử lý ở các quốc gia ngoài EEA, Thụy Sĩ hoặc Vương quốc Anh (bao gồm cả Hoa Kỳ). Khi điều này xảy ra, chúng tôi áp dụng các biện pháp bảo vệ thích hợp, chẳng hạn như các quyết định về sự đầy đủ hoặc các điều khoản hợp đồng tiêu chuẩn, như đã được mô tả trong tài liệu của chúng tôiChính sách bảo mật.
Quyền của bạn và cách thực hiện chúng
Chúng tôi phản hồi các yêu cầu phản đối và các yêu cầu về quyền tương tự. Nhờ việc học ngôn ngữ, các phản hồi của ChatGPT đôi khi có thể bao gồm thông tin cá nhân về các cá nhân mà thông tin cá nhân của họ xuất hiện nhiều lần trên Internet công cộng (ví dụ, các nhân vật công chúng). Các cá nhân ở một số khu vực pháp lý có thể phản đối việc xử lý thông tin cá nhân của họ bởi các mô hình của chúng tôi hoặc thực hiện các yêu cầu quyền dữ liệu khác thông qua chúng tôiCổng thông tin bảo mật. Bạn cũng có thể thực hiện các quyền này bằng cách liên hệ vớiquyền riêng tư@openai.com.
Để giúp chúng tôi đánh giá và phản hồi yêu cầu của bạn, vui lòng cung cấp đủ thông tin để chúng tôi hiểu yêu cầu của bạn liên quan đến thông tin cá nhân nào, chẳng hạn như tên của bạn, các URL liên quan, ví dụ cụ thể về kết quả mô hình, hoặc các chi tiết khác giúp xác định vấn đề. Trong một số trường hợp, chúng tôi có thể yêu cầu bạn xác minh danh tính hoặc xác nhận rằng thông tin đó liên quan đến bạn trước khi chúng tôi có thể thực hiện hành động. Thông tin chi tiết hơn về cách gửi các yêu cầu này, bao gồm các phương pháp tốt nhất và cách các yêu cầu được xem xét, có sẵn trong tài liệu của chúng tôi.Bài viết Trung tâm Trợ giúpvề việc xóa dữ liệu cá nhân khỏi ChatGPT. Chúng tôi xem xét các yêu cầu theo các luật bảo mật hiện hành và phản hồi trong thời hạn pháp lý áp dụng.
Xin lưu ý rằng, theo luật về quyền riêng tư, một số quyền có thể không tuyệt đối. Ví dụ, chúng tôi có thể không thể thực hiện một yêu cầu nếu không thể xác minh thông tin liên quan, nếu yêu cầu không liên quan đến thông tin cá nhân được OpenAI xử lý, nếu có một trường hợp miễn trừ áp dụng, hoặc nếu chúng tôi có một lý do hợp pháp khác để làm như vậy. Các yêu cầu được đánh giá theo từng trường hợp cụ thể và có thể liên quan đến việc cân nhắc quyền riêng tư so với các yếu tố quan trọng khác, chẳng hạn như quyền tự do ngôn luận và lợi ích công cộng.
Tuy nhiên, chúng tôi nỗ lực ưu tiên việc bảo vệ thông tin cá nhân và tuân thủ tất cả các luật bảo mật áp dụng. Nếu bạn cảm thấy chúng tôi chưa giải quyết đầy đủ vấn đề, bạn có quyền gửi khiếu nại tới cơ quan giám sát địa phương của mình.
Để biết thêm thông tin về các quy trình của OpenAI liên quan đến thông tin cá nhân mà chúng tôi thu thập từ bạn hoặc về bạn khi bạn sử dụng trang web, ứng dụng và dịch vụ của chúng tôi, vui lòng xemChính sách bảo mật.

Liên hệ qua Zalo