LIÊN HỆ HOTLINE/ZALO: 0981.243.678
Hướng dẫn cho nhà quảng cáo về việc cho phép các trình thu thập dữ liệu web của OpenAI
Tìm hiểu cách làm cho các trang đích quảng cáo của bạn có thể truy cập được bởi OpenAI và khắc phục các sự cố truy cập phổ biến.
Tại sao OpenAI lại sử dụng trình thu thập dữ liệu web?
Chúng tôi sử dụngtrình thu thập dữ liệuđể xác thực độ an toàn của các trang web được gửi làm quảng cáo trên ChatGPT. Khi bạn gửi một quảng cáo, OpenAI có thể truy cập trang đích để đảm bảo nó tuân thủ các chính sách của chúng tôi. Chúng tôi cũng có thể sử dụng nội dung từ trang đích để xác định khi nào quảng cáo phù hợp nhất để hiển thị cho người dùng.
Bạn nên cho phép trình thu thập dữ liệu OpenAI nào?
Bạn phải cho phép OAI-AdsBot. Chúng tôi khuyên bạn nên cho phép cả OAI-AdsBot và OAI-SearchBot.
Đối với các nguồn dữ liệu sản phẩm, cũng cho phép OAI-SearchBot thu thập các URL hình ảnh sản phẩm. Kiểm tra tường lửa, CDN và các quy tắc bảo vệ bot trên máy chủ lưu trữ hình ảnh; phản hồi 403 có thể chặn việc xử lý nguồn dữ liệu.
Các trình thu thập dữ liệu của OpenAI không thể thu thập trang web của tôi. Tôi nên làm gì?
Hầu hết các trang web có nhiều lớp bảo vệ trước khi một trình thu thập dữ liệu có thể truy cập thành công một trang web. Hãy làm việc với nhóm kỹ thuật hoặc bảo mật của bạn để xác nhận rằng các trình thu thập dữ liệu của OpenAI có thể vượt qua từng lớp bảo vệ sau.
1. robots.txt
Tệp robots.txt cho trình quét biết liệu chúng có được phép truy cập vào một số phần nhất định của trang web của bạn hay không. Các trình quét của OpenAI tuân thủ các quy tắc này. Nếu việc truy cập bị cấm trong robots.txt, việc quét sẽ dừng ngay lập tức.
Xem lại cấu hình robots.txt của bạn và xác nhận rằng các trình thu thập dữ liệu của OpenAI được phép truy cập rõ ràng vào các trang và đường dẫn liên quan. Ví dụ: User-agent: OAI-SearchBot Allow: / User-agent: OAI-AdsBot Allow: /
2. Bảo vệ web và giảm thiểu bot
Nhiều trang web sử dụng các dịch vụ như Cloudflare, Akamai hoặc các nhà cung cấp bảo vệ web khác để phòng chống các cuộc tấn công DDoS, lấy dữ liệu trái phép và lưu lượng truy cập không được phép. Những hệ thống này có thể nhầm lẫn block các trình thu thập dữ liệu hợp pháp, thường trả về lỗi 403 Forbidden. Vì các trình thu thập dữ liệu của OpenAI có thể giống với các mẫu lưu lượng tự động, chúng có thể bị từ chối trừ khi được đưa vào danh sách cho phép cụ thể.
Xem lại cấu hình bảo vệ web hoặc tường lửa của bạn và cho phép lưu lượng truy cập của trình thu thập dữ liệu OpenAI khi có thể, lý tưởng nhất là dựa trên các user agent của trình thu thập dữ liệu của chúng tôi. Nhóm kỹ thuật hoặc hạ tầng của bạn cũng nên kiểm tra bất kỳ quy tắc giảm thiểu bot tự động nào có thể đang kích hoạt các kết quả dương tính giả.
3. Xác minh con người và logic chống bot
Một số trang web triển khai các kiểm tra ở cấp ứng dụng bổ sung để xác minh rằng người truy cập là con người, chẳng hạn như CAPTCHA, thách thức JavaScript, phân tích hành vi hoặc xác thực phiên. Vì trình thu thập dữ liệu của OpenAI là các hệ thống tự động, những kiểm tra này có thể chặn truy cập ngay cả khi trình thu thập dữ liệu vượt qua các lớp kiểm tra trước đó.
Xem xét bất kỳ logic xác minh con người hoặc chống tự động hóa nào được triển khai trong ứng dụng của bạn và đảm bảo rằng các trình thu thập dữ liệu của OpenAI được miễn trừ khi thích hợp, lý tưởng nhất là bằng cách đưa các tác nhân người dùng của trình thu thập dữ liệu của chúng tôi vào danh sách cho phép.
Một ghi chú về các dải IP ổn định
Một số hệ thống bảo mật yêu cầu lưu lượng trình thu thập dữ liệu phải xuất phát từ các dải IP ổn định, được công bố công khai trước khi lưu lượng có thể được đưa vào danh sách cho phép một cách đáng tin cậy. Bởi vì cơ sở hạ tầng trình thu thập dữ liệu có thể thay đổi theo thời gian, nhóm kỹ sư của bạn nên tránh chỉ dựa vào các quan sát IP ngắn hạn từ các nhật ký. Thay vào đó, hãy xác thực lưu lượng thông qua sự kết hợp của nhận diện user-agent, các chương trình bot đã được xác minh nếu được hỗ trợ, danh sách cho phép tường lửa, hành vi robots.txt và các hệ thống xác minh bot ở cấp nhà cung cấp.
Nếu bạn phải cho phép một danh sách ổn định các dải IP, tham khảohttps://openai.com/searchbot.jsonvàhttps://openai.com/adsbot.json.
Một ghi chú về giới hạn tốc độ
Tải lên hàng loạt lớn hoặc sự gia tăng đột ngột lưu lượng trình thu thập dữ liệu đôi khi có thể kích hoạt hệ thống giới hạn tần suất tự động hoặc bảo vệ bot.
Nếu bạn nghi ngờ việc giới hạn tần suất đang xảy ra, hãy yêu cầu nhóm kỹ sư của bạn xem lại các mã phản hồi HTTP, đặc biệt là 429 Quá Nhiều Yêu Cầu, nhật ký tường lửa hoặc CDN, các sự kiện giảm thiểu bot, các quy tắc hạn chế yêu cầu, và phân tích lưu lượng xung quanh thời điểm trình thu thập dữ liệu cố gắng truy cập. Điều này có thể giúp xác định liệu các yêu cầu có đang bị làm chậm hoặc chặn một cách có chủ ý bởi các biện pháp bảo vệ hạ tầng hay không.
Bạn cũng có thể cân nhắctải quảng cáo lên trong một khoảng thời gian dài hơntheo từng mẻ nhỏ.
Một ghi chú về Cloudflare
OAI-AdsBot đã được xác minh chính thức và được Cloudflare đưa vào danh sách cho phép.
Crawler và trang đích FAQ
Trình thu thập dữ liệu nào được yêu cầu để xem xét quảng cáo?
OAI-AdsBot được yêu cầu cho việc xác thực và xem xét trang đích quảng cáo ChatGPT. OAI-SearchBot được khuyến nghị vì nó có thể giúp OpenAI hiểu nội dung web công khai, nhưng OAI-AdsBot là trình thu thập dữ liệu mà các nhà quảng cáo nên ưu tiên cho việc chuẩn bị quảng cáo.
Có thể hỗ trợ bỏ qua xác thực trình thu thập dữ liệu một cách thủ công không?
Không dựa vào việc vượt qua thủ công. Hãy làm cho trang đích có thể thu thập dữ liệu được bởi OAI-AdsBot bằng cách sửa robots.txt, WAF, CDN, các biện pháp chống bot, xác thực và các giới hạn tốc độ. Quảng cáo có thể cần được tải lại hoặc gửi lại để xem xét sau khi trang đích trở nên có thể truy cập.
Nhóm kỹ sư của tôi nên kiểm tra điều gì trước tiên?
Kiểm tra xem trang đích có trả về phản hồi HTTP thành công cho OAI-AdsBot hay không, liệu robots.txt có cho phép đường dẫn liên quan hay không, và liệu WAF, CDN, cơ chế ngăn chặn bot, thử thách JavaScript, CAPTCHA, xác thực, hoặc quy tắc địa lý có chặn truy cập tự động hay không.
Liệu các liên kết cửa hàng ứng dụng, liên kết sâu, hay các điểm đến không phải web có được hỗ trợ làm trang đích không?
Sử dụng trang đích web có thể truy cập trực tiếp bất cứ khi nào có thể. Các liên kết cửa hàng ứng dụng, liên kết sâu, tài liệu hoặc các điểm đến yêu cầu ứng dụng, đăng nhập, truy cập theo khu vực cụ thể hoặc chuyển hướng không được hỗ trợ có thể không cung cấp đủ nội dung có thể thu thập để xác thực hoặc xem xét.
Khi nào tôi nên tải lại hoặc yêu cầu xem xét lại?
Sau khi sửa quyền truy cập của trình thu thập dữ liệu, hãy tải lại hoặc gửi lại các quảng cáo bị ảnh hưởng nếu trạng thái không tự cập nhật. Đối với các quảng cáo được tải lên số lượng lớn, các lô nhỏ hơn có thể giảm các kích hoạt giới hạn tốc độ hoặc bảo vệ bot trong khi nhóm của bạn xác nhận bản sửa lỗi.

Liên hệ qua Zalo