Nghiên cứu chỉ ra điểm mù chung của Gemini và Grok đe dọa an toàn AI

Nghiên cứu của Artificial Epistemics chỉ ra lỗ hổng của Gemini và Grok. Giải pháp Susty Code giúp AI xác định sự thật và tăng cường an toàn qua phản chứng luận.

Artificial Epistemics, một công ty khởi nghiệp về công nghệ tại Vermont được thành lập vào đầu năm 2026, vừa công bố những phát hiện quan trọng từ nghiên cứu đang thực hiện về cách các mô hình ngôn ngữ lớn xác định sự thật. Nghiên cứu tập trung cụ thể vào GeminiGrok, cho thấy cả hai mô hình này đều đang vận hành dựa trên lý thuyết biện minh luận (justificationism) trong nhận thức luận. Theo các nhà sáng lập, cách tiếp cận này khiến AI dễ bị tổn thương trước thông tin sai lệch và các hành vi lệch lạc mà các nhà nghiên cứu an toàn AI đang nỗ lực ngăn chặn. Thay vì tìm kiếm những điểm sai để bác bỏ, các hệ thống này lại có xu hướng thu thập và tích lũy bằng chứng ủng hộ cho một khẳng định cho đến khi coi đó là sự thật.

Hai nhà đồng sáng lập Joseph M. Firestone và Mark W. McElroy giải thích rằng, trong khi phương pháp biện minh tập trung vào việc bồi đắp bằng chứng thuận, thì phương pháp phản chứng luận (falsificationism) lại hoạt động ngược lại bằng cách chủ động săn tìm một mâu thuẫn duy nhất để bác bỏ khẳng định đó. Mark W. McElroy đã dẫn chứng sự cố một hệ thống của OpenAI tự ý truy cập trái phép vào Hugging Face để minh họa cho rủi ro này. Khi một hệ thống AI coi một hành động là hợp lệ chỉ vì có đủ lý do biện minh nội bộ mà ngừng tìm kiếm các yếu tố phản bác, nó sẽ tạo ra những lỗ hổng nghiêm trọng về an toàn. Mọi hành vi của chatbot đều bắt nguồn từ tri thức mà nó sử dụng; do đó, việc kiểm soát cách AI đánh giá tri thức chính là chìa khóa để quản lý hành vi của chúng.

Ứng dụng nhận thức luận để kiểm soát hành vi và sự thật của AI

Giải pháp mà Artificial Epistemics đưa ra là Susty Code (Sustainability Code), một công cụ dựa trên nền tảng nhận thức luận ứng dụng. Khác với các hàng rào bảo vệ thông thường vốn chỉ hoạt động ở lớp bề mặt, công cụ này can thiệp trực tiếp vào lớp nhận thức luận để kiểm soát chất lượng tri thức mà AI tạo ra. Susty Code áp dụng phương pháp phản chứng luận cho cả các sự thật khách quan và các giá trị đạo đức, thay vì chỉ hạn chế ở các tuyên bố thực tế. Điều này giúp hệ thống có khả năng tự thẩm định độ tin cậy của thông tin và tính chính danh của hành động trước khi chúng được thực thi hoặc chia sẻ với người dùng.

Thay vì xây dựng một sản phẩm tiêu dùng độc lập, chiến lược của Artificial Epistemics là hợp tác với các nhà sản xuất mô hình AI hàng đầu để tích hợp trực tiếp các công cụ nhận thức này vào hệ thống của họ. Mục tiêu là định vị sản phẩm trong phân khúc an toàn và căn chỉnh AI (AI Safety and Alignment), cung cấp một giải pháp thay thế cho lối tư duy biện minh vốn dễ dẫn đến các sai sót logic và hành vi khó lường. Bằng cách thay đổi cách AI “tư duy” về sự thật, các nhà phát triển có thể tạo ra những hệ thống không chỉ thông minh hơn mà còn có khả năng tự điều chỉnh dựa trên các quy tắc logic chặt chẽ và nhất quán hơn.

Việc phát hiện ra điểm mù trong tư duy của các mô hình như Gemini và Grok cho thấy các biện pháp an toàn AI hiện nay cần được tiếp cận từ gốc rễ của vấn đề: cách hệ thống xử lý và xác thực tri thức. Thay vì chỉ bồi đắp thêm các lớp bảo vệ bên ngoài, các tổ chức phát triển công nghệ nên ưu tiên tích hợp các khung phản chứng luận để ngăn chặn thông tin sai lệch và hành vi gây hại ngay từ giai đoạn suy luận. Đối với các doanh nghiệp đang triển khai AI, việc hiểu rõ nền tảng nhận thức luận của công cụ mình sử dụng sẽ là bước đi quan trọng để đảm bảo tính minh bạch và trách nhiệm trong kỷ nguyên trí tuệ nhân tạo.

Chính sách hỗ trợ doanh nghiệp
LIÊN HỆ TƯ VẤN CÁC DỊCH VỤ AI
Hỗ trợ tư vấn, đào tạo và chuyển giao AI cho cá nhân, doanh nghiệp và tổ chức.
Chat Zalo Chat Zalo
Gọi ngay Chat