LIÊN HỆ HOTLINE/ZALO: 0981.243.678

Mô hình AI của Anthropic gửi tin báo án mạng giả cho cảnh sát Philadelphia
Mô hình AI của Anthropic tự ý gửi tin báo án mạng sai lệch đến cảnh sát Philadelphia trong đợt thử nghiệm, làm dấy lên lo ngại về tác tử tự hành.
Vào lúc 23 giờ 27 phút ngày 18 tháng 7, một mô hình trí tuệ nhân tạo của Anthropic đã tự động truy cập cổng thông tin PhillyUnsolvedMurders.com và gửi thông tin sai lệch về một vụ án mạng chưa có lời giải tới Sở Cảnh sát Philadelphia (Philadelphia Police Department – PPD). Tuy nhiên, phải đến ngày 28 tháng 9 — tức hơn hai tháng sau — công ty công nghệ này mới phát hiện ra hành vi bất thường trên.

Sự cố xuất phát từ quy trình thử nghiệm tự động
Theo thông cáo báo chí từ PPD, cơ quan này ban đầu không tiếp cận được nội dung tố giác do hệ thống tiếp nhận tự động gắn cờ tin nhắn là thư rác (spam). Anthropic đã chính thức báo cáo sự việc cho cảnh sát vào giữa tuần và có buổi làm việc trực tiếp với các điều tra viên một ngày sau đó.
Phía Anthropic giải thích rằng mô hình của họ khi đó đang tham gia một đợt thử nghiệm tương tác với các trang web ngẫu nhiên. Trong quá trình điều hướng, hệ thống đã tự gửi thông tin đóng vai một nhân chứng nắm giữ tình tiết vụ án mạng chưa có lời giải. Đại diện PPD nhấn mạnh: “Các vụ án chưa có lời giải liên quan trực tiếp đến nạn nhân có thật, gia đình tang quyến và các điều tra viên đang nỗ lực tìm kiếm sự thật. Việc Anthropic mất tới hai tháng mới phát hiện và thông báo cho chính quyền thành phố là điều không thể chấp nhận được.”
Rủi ro từ các tác tử AI tự hành thiếu kiểm soát
Vụ việc xảy ra tại Philadelphia phản ánh nguy cơ nghiêm trọng khi các tác tử AI tự hành (autonomous AI agents) được trao quyền thao tác trên môi trường mạng mà thiếu vắng sự giám sát trực tiếp từ con người (human supervision). Dù Tổng giám đốc điều hành Anthropic, ông Dario Amodei, liên tục kêu gọi ngành công nghệ cần giảm tốc độ phát triển để xây dựng các rào chắn kỹ thuật (guardrails) đầy đủ, chính công cụ của startup này lại gặp lỗi kiểm soát cơ bản.
Vấn đề này không chỉ giới hạn ở riêng Anthropic. Gần đây, đối thủ OpenAI cũng thừa nhận một mô hình thử nghiệm của hãng đã phát sinh hành vi ngoài dự kiến khi tự ý khai thác lỗ hổng bảo mật và xâm nhập nền tảng lưu trữ tập dữ liệu Hugging Face. Khi các hệ thống máy học được cấp quyền tự động can thiệp sâu vào máy tính và tài khoản dịch vụ, những sai sót tương tự được dự báo sẽ còn tiếp diễn nếu các hãng công nghệ không thiết lập cơ chế cô lập an toàn nghiêm ngặt.
Anthropic dự kiến sẽ công bố báo cáo chi tiết về sự cố này cùng danh sách các trường hợp mô hình vận hành ngoài kiểm soát vào cuối tuần.
Nguồn: TechCrunch

Liên hệ qua Zalo