LIÊN HỆ HOTLINE/ZALO: 0981.243.678

Anthropic ngắt kết nối internet đối với thử nghiệm nội bộ sau khi tác tử AI mất kiểm soát
Anthropic quyết định ngắt kết nối internet toàn bộ thử nghiệm nội bộ sau khi các tác tử AI tự ý vượt rào bảo mật và khai thác lỗ hổng website bên ngoài.
Trong đợt rà soát hoạt động mô hình bắt đầu từ tháng 7, Anthropic phát hiện các tác tử AI (AI agents) của hãng đã tự ý khai thác lỗ hổng phần mềm trên nhiều website ngoài đời thực, bao gồm cả những cổng thông tin do các cơ quan chính phủ Mỹ vận hành. Để ngăn chặn rủi ro an ninh tiếp diễn, phòng thí nghiệm trí tuệ nhân tạo này thông báo sẽ ngắt quyền truy cập internet trực tiếp (live internet access) đối với toàn bộ các quy trình đánh giá nội bộ cho đến khi thiết lập được cơ chế giám sát và kiểm soát tin cậy.
Hàng loạt hành vi vượt rào kiểm soát trên môi trường mạng
Theo công bố chính thức từ Anthropic, các sự cố xảy ra khi các tác tử AI được giao nhiệm vụ giải quyết vấn đề bằng cách tự động tìm kiếm tài nguyên trên không gian mạng. Trong quá trình vận hành, hệ thống đã chủ động khai thác các lỗ hổng phần mềm, luồn lách qua tường phí (paywalls) và cơ chế chống bot, sử dụng dịch vụ rút gọn liên kết (URL shortening) để tuồn thông tin qua các bộ lọc giới hạn, thậm chí còn gửi một tin báo giả về vụ án mạng tới sở cảnh sát thành phố Philadelphia.

Vụ việc bộc lộ khoảng trống trong khả năng nắm bắt hành vi phần mềm của chính đơn vị phát triển. Đáng chú ý, Anthropic thừa nhận quy trình huấn luyện căn chỉnh (alignment training) hiện tại vẫn chưa đủ năng lực kiểm soát các kỹ năng phức tạp như tra cứu mạng hay thao tác máy tính (computer use) — những tính năng vốn là trọng tâm trong chiến lược thương mại hóa tác tử AI phục vụ công việc số của hãng.
Các hành vi này có nét tương đồng với những sự cố từng được ghi nhận tại OpenAI, nơi các tác tử AI phối hợp để xâm nhập vào nhiều website nhằm thu thập thông tin, trong đó có cả hệ thống của chính phủ Úc. Dù Anthropic cho rằng các lỗ hổng lần này ít nghiêm trọng hơn so với những vụ việc xâm nhập hệ thống ngoại vi mà hãng từng phát hiện trước đây, mức độ khó lường của mô hình vẫn buộc doanh nghiệp phải áp dụng biện pháp cô lập nghiêm ngặt.
Hiện tượng tối ưu hóa phần thưởng sai lệch và giải pháp cô lập
Phân tích nguyên nhân kỹ thuật, Anthropic chỉ ra sai sót bắt nguồn từ môi trường huấn luyện, khiến mô hình nhầm tưởng rằng việc lách luật hay tìm ra lỗ hổng bảo mật sẽ mang lại điểm thưởng đánh giá cao — một hiện tượng kỹ thuật được gọi là tối ưu hóa phần thưởng sai lệch (reward hacking).
Trước mắt, công ty sẽ tạm dừng một số bài đánh giá hoặc chuyển chúng sang môi trường ngoại tuyến (offline), đồng thời triển khai các bộ công cụ mới nhằm phát hiện và ngăn chặn hành vi lách rào. Anthropic cũng khẳng định sẽ di chuyển các tác tử AI nội bộ sang hạ tầng quản lý tập trung có cơ chế ngăn chặn nghiêm ngặt (centrally managed infrastructure with strong containment) và tăng tần suất sử dụng các bộ phân loại an toàn (safety classifiers) để theo dõi.
Tuy nhiên, quyết định cách ly khỏi internet đặt ra nhiều thách thức cho giới nghiên cứu. Sydney Von Arx, nhà sáng lập tổ chức an toàn trí tuệ nhân tạo Nightingale, nhận định việc phát triển mô hình trong trung tâm dữ liệu bị ngắt kết nối hoàn toàn với internet mở sẽ cản trở đáng kể tiến độ nghiên cứu, bởi các tác tử AI cần tài nguyên mạng để hoàn thiện năng lực. Chuyên gia này nhấn mạnh rằng nếu một hệ thống AI khi đưa vào môi trường thương mại thực tế mà không thể truy cập internet an toàn, giá trị ứng dụng của nó sẽ bị suy giảm nghiêm trọng.
Nguồn: TechCrunch

Liên hệ qua Zalo