AI cho robot hình người được huấn luyện từ một triệu giờ video

Được Dyna Robotics (Mỹ) công bố ngày 11/8, DYNA-2 được huấn luyện hoàn toàn dựa trên video góc nhìn cá nhân của con người, thay vì dữ liệu hành động của robot như đang được các hãng robot hình người áp dụng. Một triệu giờ cảnh quay tương đương 171,1 năm trải nghiệm tỉnh táo liên tục của mỗi người (giả định đã trừ đi thời gian ngủ 8 tiếng/ngày).
Phương pháp huấn luyện dữ liệu của Dyna Robotics cho phép robot học kỹ năng vật lý, chẳng hạn cách con người tương tác với các vật thể và môi trường xung quanh, thông qua video thực tế. Trong đó, DYNA-2 trang bị kiến trúc mô phỏng thế giới kết hợp dự đoán khung hình và hành động tiếp theo, bằng cách sử dụng video của con người để "phát triển sự hiểu biết", như cách môi trường vật lý thay đổi, cách các vật thể phản ứng với chuyển động.

Cách làm này được đánh giá giúp giảm sự phụ thuộc vào dữ liệu điều khiển từ xa thu thập thủ công, qua đó cung cấp cách thức đào tạo robot hiệu quả hơn, kể cả khi mở rộng. Ngoài hiệu quả với robot, nó còn cho phép robot "chuyển giao" sang cỗ máy khác.
Với nhiệm vụ trong sản xuất chính xác cao, Dyna Robotics cho biết DYNA-2 giúp nâng tỷ lệ thành công từ 20% lên 80-90% chỉ bằng cách tăng quy mô huấn luyện mới. Chẳng hạn, một robot hình người chỉ cần 13 phút dữ liệu để cánh tay vặn mở nắp chai.
Mô hình cũng chứng minh khả năng chuyển giao giữa các cánh tay robot cố định, nguyên mẫu robot hình người và bàn tay robot. Theo nhà phát triển, trên 15 nhiệm vụ chuẩn, robot chạy DYNA-2 luôn cho kết quả tốt hơn. Dyna Robotics đã so sánh nền tảng mới với mẫu DYNA-1 trước đó, vốn sử dụng kiến trúc thị giác - ngôn ngữ - hành động thường thấy. Kết quả, DYNA-2 đáp ứng 87% yêu cầu, gần gấp đôi mức 46% của DYNA-1.
Khả năng tự thích nghi cũng là điểm nhấn trên DYNA-2. Trong các thử nghiệm liên quan đến hoạt động thường nhật như thái thức ăn và dọn dẹp không gian làm việc, DYNA-2 có thể tự thích ứng với môi trường xung quanh, trong khi mô hình cũ phải làm thủ công. Với nhiệm vụ có hướng dẫn, phương pháp huấn luyện bằng video mới giúp robot có điểm số cao hơn 133% so với cách làm cũ.
"Trong nhiều năm, lĩnh vực robot bị 'tắc nghẽn' bởi vấn đề dữ liệu. Việc thu thập dữ liệu vật lý theo cách thủ công đơn giản là không thể mở rộng quy mô nếu muốn đạt siêu trí tuệ", Jason Ma, người đồng sáng lập Dyna Robotics, nói với Interesting Engineering. "Dữ liệu hành động có thể khan hiếm, nhưng video có ở khắp mọi nơi. Với DYNA-2, chúng tôi chứng minh trực giác vật lý không cần hàng triệu giờ huấn luyện trên cánh tay robot, thay vào đó có thể được học trực tiếp từ video của con người".
Khác với AI xử lý văn bản, hình ảnh hay âm thanh, robot phải học từ dữ liệu gắn với chuyển động trong không gian thực, gồm hình ảnh từ camera, trạng thái khớp, lực tác động, vị trí vật thể và phản hồi sau mỗi hành động.
Theo TechRadar, nguồn dữ liệu này khó thu thập ở quy mô lớn vì mỗi robot có thiết kế cơ khí, cảm biến và hệ thống điều khiển khác nhau. Việc cho robot tự thực hiện hàng triệu lần thao tác cũng tốn thời gian và có nguy cơ làm hỏng thiết bị. Do đó, giải pháp như của Dyna Robotics được kỳ vọng đẩy nhanh việc huấn luyện robot hình người cho môi trường thực tế.
Theo ChinaDaily, thực tế dữ liệu đang là điểm nghẽn lớn đối với lĩnh vực robot hình người. Tại nhiều nơi, đặc biệt ở Trung Quốc, nhiều cơ sở huấn luyện được xây dựng thời gian qua nhưng chưa đáp ứng đủ nhu cầu khiến tốc độ ứng dụng loại robot này ra môi trường thực tế bị chậm đáng kể.
Theo Bộ Công nghiệp và Công nghệ Thông tin Trung Quốc, năm ngoái, nước này có hơn 140 nhà sản xuất và hơn 330 mẫu robot hình người. Trong khi đó, thống kê từ công ty nghiên cứu thị trường Smart Analytics Global (SAG) cho biết Trung Quốc chiếm 97% số robot hình người xuất xưởng nửa đầu năm, dẫn đầu là Agibot và Unitree.