LIÊN HỆ HOTLINE/ZALO: 0981.243.678

Cách tiếp cận của OpenAI đối với quy định về nguồn gốc văn bản tại EU
OpenAI công bố lộ trình gắn watermark văn bản theo Đạo luật AI của EU, thúc đẩy minh bạch nguồn gốc nội dung tạo bởi mô hình AI một cách có trách nhiệm.
OpenAI vừa công bố cách tiếp cận đối với công nghệ gắn watermark văn bản (text watermarking) nhằm đáp ứng các quy định của Đạo luật AI của Liên minh châu Âu (EU AI Act), đồng thời thúc đẩy tính minh bạch trong giới hạn kỹ thuật của công nghệ ở thời điểm này.
Việc xác thực nguồn gốc nội dung (content provenance) giúp người dùng nắm bắt thông tin xuất xứ, cách thức nội dung được tạo lập hoặc chỉnh sửa, cũng như phát hiện các dấu hiệu gắn liền với các mô hình của OpenAI. Trước đây, OpenAI đã cung cấp công khai các công cụ nhận diện hình ảnh và âm thanh do mô hình AI tạo ra. Thông báo mới nhất này tập trung vào giải pháp gắn watermark cho văn bản và lộ trình tích hợp vào chiến lược phát triển rộng lớn hơn của công ty.
Đạo luật AI của EU (EU AI Act) quy định các nhà cung cấp AI tạo sinh (generative AI) phải bảo đảm văn bản do hệ thống tạo ra có thể nhận diện được theo định dạng máy có thể đọc được (machine-readable). Do công nghệ gắn watermark và phát hiện văn bản AI vẫn đang ở giai đoạn sơ khởi với nhiều giới hạn đáng kể, cách tiếp cận theo từng giai đoạn của OpenAI vừa nhằm tuân thủ quy định pháp lý, vừa phản ánh đúng thực tế kỹ thuật, tập trung vào việc minh bạch hóa những gì công nghệ này có thể và không thể xác định:
- Kích hoạt tùy chọn cho khách hàng API toàn cầu: Khách hàng sử dụng giao diện lập trình ứng dụng (API) trên toàn cầu có thể chủ động kích hoạt (opt-in) tính năng gắn watermark văn bản cho một số mô hình được chọn. Tính năng này vẫn mặc định ở trạng thái tắt trong API.
- Triển khai watermark ẩn tại EU: Trong vài tuần tới, OpenAI sẽ bổ sung watermark vô hình vào kết quả văn bản đủ điều kiện tạo ra bởi ChatGPT và Codex dành riêng cho người dùng tại Liên minh châu Âu.
- Mở cổng đăng ký bộ phát hiện watermark (text watermark detector): Quyền truy cập ban đầu sẽ được cấp có giới hạn cho các nhà nghiên cứu và tổ chức chuyên gia đã qua kiểm duyệt nhằm đánh giá và cải thiện độ tin cậy của công nghệ.
Quy trình trên chỉ áp dụng riêng cho nguồn gốc văn bản (text provenance). Các công cụ xác minh âm thanh và hình ảnh của OpenAI—bao gồm trang web kiểm tra openai.com/verify và Content Provenance API—vẫn tiếp tục được mở công khai cho mọi tổ chức có nhu cầu xác định tệp hình ảnh hoặc âm thanh có bắt nguồn từ hệ thống của OpenAI hay không.
Cơ chế hoạt động và hiệu năng của công nghệ gắn watermark
Công nghệ gắn watermark văn bản mang tên textGrain của OpenAI hoạt động bằng cách chèn một tín hiệu thống kê vô hình (invisible statistical signal) vào các lựa chọn từ ngữ của mô hình. Bộ phát hiện (detector) sẽ tìm kiếm tín hiệu này để đánh giá đoạn văn có chứa watermark của OpenAI hay không. Chi tiết kỹ thuật về textGrain được trình bày trong báo cáo kỹ thuật (technical report) và sẽ tiếp tục được cập nhật. OpenAI cũng dự kiến phát hành công nghệ này dưới dạng mã nguồn mở (open source) để cộng đồng cùng phát triển.
Trong các thử nghiệm nội bộ, textGrain đạt hiệu năng tương đương hoặc vượt trội so với các phương pháp khác, bao gồm cả SynthID cho văn bản. Dẫu vậy, hiệu năng ấn tượng trong môi trường lý tưởng không đồng nghĩa với khả năng phát hiện hoàn toàn chuẩn xác trong sử dụng thực tế thường nhật.
Các bộ phát hiện watermark thường gặp phải hai dạng sai số kỹ thuật: báo nhầm văn bản có watermark trong khi thực tế không có—tức dương tính giả (false positive), hoặc bỏ sót watermark có tồn tại—tức âm tính giả (false negative). Những thách thức thực tế bao gồm:
- Đoạn văn ngắn hoặc bị gò bó từ ngữ gây khó khăn cho việc phát hiện: Khi thiết lập tỷ lệ dương tính giả mục tiêu ở mức 1%, bộ phát hiện nhận diện được khoảng 80% watermark trong các đoạn văn dài 200 mã token (token), so với khoảng 95% ở các đoạn dài 400 token đối với nội dung như tâm lý học. Tuy nhiên, tỷ lệ phát hiện giảm mạnh đối với các chủ đề gò bó từ vựng như toán học, nơi mô hình có rất ít sự linh hoạt trong việc chọn từ.

- Chỉnh sửa văn bản làm suy giảm tín hiệu watermark: Khi đánh giá trên các đoạn văn dài 400 token, việc thay thế 10% số từ bằng từ đồng nghĩa đã kéo tỷ lệ phát hiện từ khoảng 92% xuống còn 66%. Nếu thay thế 25% số từ, con số này sụt giảm mạnh xuống chỉ còn 17%.

Chính những hạn chế kỹ thuật trên là lý do OpenAI quyết định chỉ cấp quyền truy cập bộ phát hiện ban đầu cho các nhà nghiên cứu và tổ chức chuyên gia được phê duyệt, nhằm cùng đánh giá độ tin cậy và tìm ra các trường hợp ứng dụng có trách nhiệm.
Tác động của việc gắn watermark tới chất lượng đầu ra
Trên các bài đo hiệu năng chuẩn (benchmarks) được sử dụng để đánh giá Astra—mô hình tiên tiến hàng đầu (frontier model) mới nhất của OpenAI—kết quả cho thấy không có sự chênh lệch hiệu năng đáng kể giữa văn bản có gắn watermark và không gắn watermark trên các thang đo gồm Artificial Analysis Intelligence Index, Terminal-Bench Science 0.1 và HealthBench Professional.

Những giới hạn của watermark văn bản
Watermark văn bản chỉ cung cấp một tín hiệu giới hạn về vai trò của hệ thống AI đối với đoạn văn bản. Người dùng cần hiểu rõ những kết luận không thể rút ra từ kết quả phát hiện:
- Không đo lường mức độ đóng góp của con người: Dấu watermark có thể chỉ ra hệ thống OpenAI đã tạo ra hoặc xử lý một phần văn bản, nhưng không thể xác định con người đã tham gia biên tập, đánh giá hay sáng tạo bao nhiêu phần trong đó.
- Không xác lập quyền sở hữu hay trách nhiệm pháp lý: Watermark không quyết định ai sở hữu văn bản, liệu việc sử dụng có hợp pháp hay không, có bắt buộc phải công khai nguồn gốc hay không, hoặc ai là người chịu trách nhiệm cuối cùng.
- Không định danh người dùng: Công nghệ này không liên kết bất kỳ cá nhân, tổ chức, tài khoản, câu lệnh (prompt) hay cuộc hội thoại cụ thể nào với văn bản.
- Không kiểm chứng tính chính xác: Dấu watermark không cho biết đoạn văn bản là đúng sự thật, gây hiểu lầm, có hại hay có được đặt trong đúng ngữ cảnh hay không.
- Việc không phát hiện thấy watermark không đồng nghĩa văn bản do con người viết: Văn bản do công cụ của OpenAI tạo ra có thể quá ngắn, đã qua chỉnh sửa hoặc dịch thuật khiến việc phát hiện mất độ chính xác. Ngoài ra, văn bản có thể được tạo từ mô hình chưa hỗ trợ, tạo trước thời điểm áp dụng watermark, hoặc được sinh ra bởi công cụ của bên thứ ba.
Kế hoạch triển khai cụ thể
- Triển khai từng bước tại EU: Trong vài tuần tới, tính năng gắn watermark văn bản sẽ được áp dụng cho người dùng ChatGPT và Codex đủ điều kiện trên tất cả các gói dịch vụ, nhưng chỉ giới hạn tại thị trường EU. Việc không áp dụng mặc định trên quy mô toàn cầu giúp OpenAI có thêm không gian học hỏi từ thực tế và phản hồi của người dùng.
- Cung cấp tùy chọn linh hoạt cho khách hàng API: Khách hàng API toàn cầu có thể chủ động bật tính năng này cho các mô hình phù hợp với nghĩa vụ minh bạch và trải nghiệm người dùng của riêng họ. OpenAI cũng đang hợp tác với các đối tác đám mây để hỗ trợ tính năng trên các dịch vụ đối tác.
- Cấp quyền truy cập công cụ phát hiện cho giới chuyên gia: Các tổ chức chuyên môn và nhà nghiên cứu được duyệt có thể gửi hồ sơ đăng ký. Phù hợp với Bộ quy tắc Thực hành (Code of Practice), quyền truy cập sẽ được xét duyệt theo từng trường hợp nhằm hỗ trợ đánh giá và hoàn thiện giải pháp xác thực nguồn gốc văn bản mà không để lộ danh tính hay câu lệnh của người dùng.
Chiến lược mở rộng về xác thực nguồn gốc nội dung
Do không có một giải pháp đơn lẻ nào đủ toàn diện, OpenAI áp dụng mô hình bảo vệ đa tầng kết hợp giữa tiêu chuẩn mở (open standards), kỹ thuật gắn watermark bền vững và các công cụ xác minh trực tiếp.
OpenAI đã tích hợp chuẩn Chứng thực Nội dung (Content Credentials) tuân thủ liên minh C2PA vào các hình ảnh được hỗ trợ, đồng thời nhúng watermark vô hình SynthID vào tệp hình ảnh và âm thanh. Các kỹ thuật này bổ trợ lẫn nhau: Content Credentials ghi nhận lịch sử và nguồn gốc tệp, trong khi watermark ẩn lưu giữ tín hiệu ngay cả khi siêu dữ liệu (metadata) bị loại bỏ.
Xác thực nguồn gốc đóng vai trò quan trọng trong việc hỗ trợ người dùng và các nền tảng nhận diện nội dung gây hiểu lầm do AI tạo ra, đặc biệt là các nội dung giả mạo sâu (deepfakes). OpenAI kết hợp những tín hiệu này với chính sách an toàn, hệ thống phát hiện lạm dụng, điều tra vi phạm và hợp tác cùng các cơ quan tiêu chuẩn, nền tảng số và xã hội dân sự.
Việc mở rộng xác thực nguồn gốc sang dạng văn bản đòi hỏi phải tính đến đặc tính dễ bị viết lại, dịch thuật hoặc biên tập. OpenAI cam kết tiếp tục nghiên cứu nâng cao khả năng chống chịu của watermark trước các thao tác chỉnh sửa, tìm phương thức phân biệt rõ ràng giữa sự hỗ trợ của AI và quyền tác giả của AI, đồng thời mở rộng quyền tiếp cận công cụ phát hiện khi các tiêu chuẩn và bằng chứng thực tế được củng cố vững chắc.
Nguồn: OpenAI News

Liên hệ qua Zalo