LIÊN HỆ HOTLINE/ZALO: 0981.243.678

Phòng lab AI Thượng Hải ra mắt mô hình dự đoán khái niệm, không chỉ từ
Shanghai AI lab ra mắt cách huấn luyện LLM mới: Dự đoán khái niệm thay vì token giúp giảm thiểu ảo giác AI và tối ưu hóa tư duy logic trong không gian ẩn.
Việc các mô hình ngôn ngữ lớn (LLM) hiện nay đôi khi đưa ra những câu trả lời nghe có vẻ thuyết phục nhưng hoàn toàn sai lệch bắt nguồn từ cơ chế dự đoán token kế tiếp (next-token prediction). Phương pháp này vận hành dựa trên xác suất thống kê của các từ ngữ thay vì thực sự hiểu nội dung đang truyền tải. Để khắc phục hạn chế này, các nhà nghiên cứu tại Shanghai AI lab đã giới thiệu một hướng đi mới: huấn luyện mô hình để dự đoán các khái niệm (concepts) trong không gian ẩn (latent space). Thay vì bị giới hạn bởi việc lựa chọn từ ngữ phù hợp về mặt cú pháp, mô hình tập trung vào việc nắm bắt ý tưởng cốt lõi và logic của vấn đề trước khi chuyển đổi chúng thành văn bản. Sự chuyển dịch này giúp hệ thống duy trì được tính nhất quán trong các lập luận phức tạp, giảm thiểu tình trạng ảo giác (hallucination) thường gặp. Bằng cách ưu tiên ý nghĩa hơn là hình thức câu chữ, công nghệ này mở ra khả năng xử lý thông tin đa phương thức hiệu quả hơn, nơi hình ảnh, âm thanh và văn bản được kết nối thông qua một biểu diễn khái niệm thống nhất.
Cơ chế dự báo khái niệm và sự khác biệt so với mô hình ngôn ngữ truyền thống
Các mô hình truyền thống như GPT-4 hay Llama hoạt động bằng cách phân tách văn bản thành các đơn vị nhỏ gọi là token. Quá trình học tập tập trung vào việc tối ưu hóa khả năng chọn ra token có xác suất xuất hiện cao nhất sau một chuỗi ký tự cho trước. Ngược lại, kiến trúc mới từ Shanghai AI lab áp dụng phương pháp học biểu diễn khái niệm, nơi mô hình được dạy cách ánh xạ các dữ liệu đầu vào thành các điểm trong không gian vector đa chiều đại diện cho ý nghĩa thực tế. Khi đối mặt với một yêu cầu phức tạp, hệ thống sẽ xác định lộ trình khái niệm cần thiết để giải quyết vấn đề, sau đó mới sử dụng các bộ giải mã để diễn đạt lộ trình đó thành ngôn ngữ tự nhiên.
Cách tiếp cận này mang lại lợi thế vượt trội trong việc xử lý các tác vụ đòi hỏi tư duy logic và lập kế hoạch dài hạn. Thay vì bị phân tâm bởi các biến thể bề mặt của ngôn ngữ, mô hình giữ được sự tập trung vào mục tiêu ngữ nghĩa. Điều này đặc biệt quan trọng trong các ứng dụng chuyên sâu như lập trình phần mềm hoặc phân tích dữ liệu khoa học, nơi một sai lệch nhỏ về từ ngữ có thể dẫn đến sai sót nghiêm trọng về bản chất. Việc dự đoán khái niệm giúp mô hình “hiểu” được cấu trúc của vấn đề một cách hệ thống, tương tự như cách bộ não con người hình thành ý tưởng trước khi phát ngôn.
Sự ra đời của mô hình dự đoán khái niệm từ Shanghai AI lab đánh dấu một bước tiến quan trọng trong việc thu hẹp khoảng cách giữa xác suất thống kê và trí tuệ thực thụ. Để tận dụng tối đa những tiến bộ này, các doanh nghiệp và nhà phát triển cần chủ động cập nhật các kiến trúc mô hình mới nhất và ưu tiên các giải pháp tập trung vào chất lượng dữ liệu ngữ nghĩa. Việc chuyển đổi từ tư duy “dự đoán từ” sang “hiểu khái niệm” không chỉ nâng cao độ chính xác của AI mà còn tạo nền tảng vững chắc cho các hệ thống trí tuệ nhân tạo tổng quát (AGI) trong tương lai gần.

Liên hệ qua Zalo