Kết quả bất ngờ khi thả cho AI tự "táy máy"

(Dân trí) - Thay vì huấn luyện AI chỉ bằng cách ghi nhớ dữ liệu, các nhà khoa học đã thử bổ sung cơ chế "tò mò" để robot tự khám phá môi trường.

Robot mô phỏng sử dụng cơ chế học dựa trên động lực nội tại có thể rút ngắn khoảng một nửa thời gian học ngôn ngữ so với phương pháp truyền thống (Ảnh: Sohu).
Kết quả cho thấy tốc độ học ngôn ngữ được cải thiện đáng kể, đồng thời xuất hiện những hành vi ngoài dự kiến.
Một nghiên cứu của Viện Khoa học và Công nghệ Okinawa (OIST, Nhật Bản) đề xuất cách tiếp cận mới trong huấn luyện trí tuệ nhân tạo (AI), thay vì chỉ dựa vào việc dự đoán từ hoặc ghi nhớ lượng dữ liệu khổng lồ như các mô hình ngôn ngữ lớn (LLM).
Nhóm nghiên cứu xây dựng một hệ thống AI có cơ chế khám phá dựa trên "động lực nội tại", cho phép robot mô phỏng chủ động tìm hiểu các tình huống mới thay vì chỉ thực hiện những gì đã được lập trình.
Để thực hiện điều này, các nhà khoa học sử dụng mô hình Mạng thần kinh tái quy biến đổi lấy cảm hứng từ mã hóa dự đoán (Predictive Coding-inspired Variational Recurrent Neural Network- PV-RNN), kết hợp với thuật toán học tăng cường.
Hệ thống sẽ nhận "phần thưởng" khi giảm được sự không chắc chắn trong quá trình khám phá môi trường, qua đó khuyến khích AI tiếp tục học hỏi.
Theo kết quả nghiên cứu, các robot mô phỏng sử dụng cơ chế này chỉ mất khoảng một nửa thời gian để học ngôn ngữ so với phương pháp huấn luyện thông thường.
Trong quá trình huấn luyện, nhóm nghiên cứu cũng ghi nhận một số hành vi ngoài kịch bản. Sau khi hoàn thành nhiệm vụ, robot vẫn tiếp tục tương tác với môi trường, chẳng hạn đẩy hoặc làm dịch chuyển các vật thể để quan sát kết quả.
"Theo dõi các hành vi khám phá tự phát xuất hiện trong quá trình huấn luyện là điều khiến chúng tôi đặc biệt chú ý", Theodore Tinker, tác giả chính của nghiên cứu, cho biết.
Nghiên cứu cũng cho thấy hiệu quả của cơ chế này phụ thuộc đáng kể vào mức độ đa dạng của dữ liệu huấn luyện.
Khi robot được tiếp xúc với 48 tổ hợp ngôn ngữ, khả năng hiểu các mệnh lệnh mới chỉ đạt khoảng 25%. Tuy nhiên, khi số lượng tổ hợp tăng lên 180, tỷ lệ khái quát hóa đạt khoảng 85%.
Một hiện tượng đáng chú ý khác là robot tái hiện "đường cong học tập hình chữ U", vốn từng được quan sát trong quá trình trẻ em tiếp thu ngôn ngữ. Ban đầu, hệ thống ghi nhớ tốt các trường hợp riêng lẻ, sau đó kết quả tạm thời giảm khi bắt đầu hình thành quy tắc chung, trước khi tiếp tục cải thiện và đạt khả năng khái quát hóa cao hơn.
Theo nhóm nghiên cứu, kiến trúc PV-RNN còn có ưu điểm là cho phép theo dõi trạng thái nội tại của mô hình trong quá trình học, giúp các nhà khoa học hiểu rõ hơn cách AI đưa ra quyết định.
Điều này có thể hỗ trợ phát triển các hệ thống AI linh hoạt hơn, đồng thời cung cấp thêm dữ liệu để nghiên cứu cơ chế con người tiếp thu ngôn ngữ.