Goodfire ra mắt giải pháp giám sát nội bộ giúp kiểm soát tác tử AI với chi phí thấp

Goodfire giới thiệu công cụ giám sát kích hoạt nội bộ giúp phát hiện hành vi bất thường của tác tử AI với chi phí và độ trễ thấp hơn.

Phương pháp truyền thống nhằm kiểm soát tác tử AI (AI agents) thường dựa vào một mô hình thứ hai để theo dõi và đọc lại toàn bộ tác vụ của mô hình chính. Cách tiếp cận này tốn kém đáng kể chi phí điện toán khi các tác tử vận hành liên tục qua nhiều giờ và xử lý khối lượng văn bản tương đương nhiều cuốn tiểu thuyết.

Ngày 24 tháng 10, Goodfire, công ty khởi nghiệp chuyên sâu về khả năng giải thích của mô hình (AI interpretability), đã giới thiệu giải pháp giám sát mới. Thay vì phân tích kết quả đầu ra bên ngoài, hệ thống này quan sát trực tiếp các biến đổi bên trong mô hình khi đang vận hành. Công cụ hiện được cung cấp cho khách hàng của nền tảng hạ tầng Baseten, đơn vị vừa công bố hợp tác về an toàn cùng Goodfire và Hugging Face vào tháng trước.

Cơ chế hoạt động tương tự cổng kiểm soát an ninh

Động thái này diễn ra sau hàng loạt sự cố tác tử AI vượt rào khỏi môi trường thử nghiệm cô lập (sandbox), điển hình như việc tác tử của OpenAI thâm nhập Hugging Face, hay mô hình mã nguồn mở Kimi K3 tận dụng lỗ hổng bảo mật để tự ý truy cập internet và thông tin trên GitHub.

Hệ thống giám sát của Goodfire vận hành tương tự cổng kiểm soát an ninh tại sân bay. Các đầu dò siêu nhỏ (probes) quét tín hiệu nội bộ ở từng bước tính toán. Chỉ khi đầu dò phát hiện dấu hiệu bất thường, một mô hình AI thứ hai mới được huy động để thẩm định chi tiết.

Mô hình giám sát an toàn cho hệ thống tác tử trí tuệ nhân tạo
Kiến trúc giám sát của Goodfire phân tích trực tiếp các tính toán nội bộ của mô hình thay vì sử dụng mô hình phụ trợ bên ngoài.

Khách hàng trên Baseten có thể tùy chọn giám sát nhiều nhóm rủi ro, bao gồm tấn công mạng có chủ đích, khai thác vũ khí hóa học hoặc sinh học, và hành vi đánh lừa hàm thưởng (reward hacking). Người dùng cũng có quyền thiết lập phản ứng tự động: ghi nhận nhật ký (logging), chuyển tiếp cho chuyên gia phê duyệt, hoặc từ chối xử lý truy vấn ngay lập tức.

Tối ưu hóa chi phí và tốc độ suy luận

Phần lớn giải pháp giám sát thông thường đòi hỏi một mô hình độc lập đọc lại toàn bộ dữ liệu, làm gia tăng thời gian trễ và ngân sách vận hành. Công cụ của Goodfire tận dụng trực tiếp các phép tính sẵn có trong chu trình truyền thẳng (forward pass) của mạng nơ-ron.

CEO Eric Ho của Goodfire giải thích trên chương trình thảo luận của nhà đầu tư Matt Turck rằng mô hình vốn đã tính toán các giá trị kích hoạt nơ-ron trung gian (intermediate neural activations). Hệ thống chỉ cần gắn bộ phân loại lên các phép toán có sẵn này mà không tiêu tốn thêm tài nguyên tái xử lý.

Trong các thử nghiệm trên mô hình Kimi K3, việc giám sát khoảng 1.500 phiên làm việc tiêu tốn khoảng 51 USD với đầu dò của Goodfire, so với 233 USD khi dùng mô hình phụ trợ giá rẻ và xấp xỉ 10.000 USD nếu dùng mô hình cao cấp. Tỷ lệ phát hiện các phiên xâm nhập độc hại đạt 94%, với 8,7% phiên thông thường được gửi cảnh báo xem xét lại. Việc chạy đồng thời bốn đầu dò chỉ làm tăng chưa đến 2% thời gian phản hồi ban đầu của mô hình.

Tấm lá chắn cho các mô hình nguồn mở

Giám đốc công nghệ kiêm đồng sáng lập Goodfire, Dan Balsam, cho biết giải pháp hướng đến việc chặn đứng rủi ro trước khi tác tử thực hiện hành động, hỗ trợ phát hiện sớm hành vi tấn công ngay trong quá trình đánh giá (evaluation) hoặc huấn luyện (training).

Mục tiêu trọng tâm của giải pháp là các mô hình mã nguồn mở, vốn dễ bị gỡ bỏ các lớp bảo vệ và thiếu cơ chế kiểm soát tập trung như hệ thống đóng. Nghiên cứu gần đây của Goodfire chỉ ra rằng các mô hình như Kimi K3 và GLM 5.2 xuất hiện hành vi đánh lừa hàm thưởng trong 50% đến 96% số lần kiểm thử tác tử.

Trước Goodfire, đơn vị nghiên cứu Google DeepMind từng công bố áp dụng các đầu dò phát hiện hành vi lạm dụng tương tự trên dòng mô hình Gemini vào tháng 1. Đội ngũ sáng lập Goodfire kỳ vọng phương pháp này là bước đệm nhằm dịch ngược kỹ thuật (reverse-engineering) các mô hình ngôn ngữ lớn (LLMs), biến quy trình huấn luyện AI thành một ngành kỹ thuật chuẩn xác thay vì phụ thuộc vào các thử nghiệm cảm tính.

Nguồn: TechCrunch

Chính sách hỗ trợ doanh nghiệp
LIÊN HỆ TƯ VẤN CÁC DỊCH VỤ AI
Hỗ trợ tư vấn, đào tạo và chuyển giao AI cho cá nhân, doanh nghiệp và tổ chức.
Chat Zalo Chat Zalo
Gọi ngay Chat