Thí nghiệm AI drone Project Pilot – do Anthropic (công ty AI Mỹ đứng sau dòng mô hình Claude) công bố hôm 24/7 cùng Andon Labs – đã giúp mô hình tốt nhất vượt chuẩn ở 4/5 bước tự hành, nhưng tỉ lệ hoàn thành toàn bộ chuỗi 5 bước trong benchmark Drone-Bench vẫn là 0%.
Project Pilot là thí nghiệm kiểm tra khả năng mô hình AI điều khiển drone thương mại tự bay trong văn phòng, tìm ra một người chỉ định và bám theo người đó. Anthropic cho biết mục tiêu là hiểu rõ “cơ hội và rủi ro mà AI tạo ra trong thế giới vật lý”. Để đo lường, nhóm nghiên cứu xây dựng bộ benchmark Drone-Bench, so sánh 15 mô hình cũ và mới đến từ OpenAI, Google và Anthropic.
AI drone Project Pilot vượt chuẩn 4/5 bước trong Drone-Bench
Drone-Bench chia nhiệm vụ thành 5 bước: tái tạo không gian văn phòng thành mô hình 3D từ video quay sẵn; tự xác định vị trí drone (self-localization); di chuyển tới phòng mục tiêu (navigation); tìm người trùng với ảnh tham chiếu (detection); và bám theo người đó (tracking). Với mỗi bước, mô hình AI phải tự viết chương trình điều khiển, nhận điểm đánh giá và được phép sửa tối đa 10 lần; sau đó mỗi mô hình chạy 10 lần để lấy kết quả.
Mô hình tốt nhất là Claude Fable 5 của Anthropic. Trong các lần chạy tốt, mô hình này vượt chuẩn ở 4/5 bước, chỉ trừ bước tái tạo không gian. Khi thử nghiệm trên drone thực tế, khả năng phát hiện và bám người của Claude Fable 5 còn vượt chương trình chuẩn do chuyên gia con người viết: drone tìm được người, giữ người ở giữa khung hình và duy trì khoảng cách khi bay.
Nhóm nghiên cứu đánh giá kỹ năng “tìm người – giữ người giữa khung hình – bay bám theo” đã đạt một mức độ nhất định. Tuy nhiên, khi nối cả 5 bước thành một chuỗi liên hoàn trong Drone-Bench, tỉ lệ thành công của toàn bộ quy trình là 0%.
Vì sao tỉ lệ thành công toàn trình vẫn là 0%?
Nguyên nhân nằm ở bước đầu tiên: không mô hình nào vượt chuẩn ở bước tái tạo không gian 3D từ video. Sai số của bước này lan sang các bước sau – từ xác định vị trí, di chuyển đến tìm và bám người – khiến drone không thể hoàn thành chuỗi nhiệm vụ một cách ổn định, dù có thể bám theo người khi đã thấy họ.
Các số liệu chính của thí nghiệm:
| Chỉ số | Kết quả |
|---|---|
| Tỉ lệ hoàn thành chuỗi 5 bước trong Drone-Bench | 0% |
| Số bước vượt chuẩn của Claude Fable 5 (lần chạy tốt) | 4/5 |
| Xác suất vượt chuẩn 4 bước liên tiếp (mô hình tốt nhất, lần chạy thường) | Khoảng 6% |
| Độ trễ giữa lần chạy trung bình và lần chạy tốt nhất | Khoảng 6 tháng |
| Cải thiện điểm trung bình từ lần nộp đầu đến lần nộp tốt nhất | 182% |
| Claude Fable 5 vượt chuẩn ở lần nộp đầu | 2% |
| Claude Fable 5 vượt chuẩn ở lần nộp tốt nhất | 52% |
| Cải thiện điểm của Claude Fable 5 | 312% |
Dù tỉ lệ 0% nghe có vẻ khiến AI drone còn xa mới dùng được, dữ liệu chi tiết cho thấy bức tranh lạc quan hơn. Theo Andon Labs, mô hình tốt nhất hiện nay có khoảng 6% xác suất vượt chuẩn 4 bước liên tiếp trong các lần chạy thông thường; năng lực của lần chạy trung bình đang thua lần chạy tốt nhất khoảng 6 tháng. Nói cách khác, “thỉnh thoảng làm được” đang tiến gần đến “làm được bình thường” trong khoảng nửa năm.
Khả năng tự sửa lỗi cũng cải thiện rõ rệt. Khi được cho 10 cơ hội sửa, điểm trung bình của các mô hình tăng 182% từ lần nộp đầu đến lần nộp tốt nhất. Riêng Claude Fable 5, tỉ lệ vượt chuẩn tăng từ 2% ở lần nộp đầu lên 52% ở lần nộp tốt nhất, tương đương mức cải thiện 312%.
Tuy nhiên, con số này cần được nhìn thận trọng khi áp dụng vào doanh nghiệp. Trong Drone-Bench, mỗi lần mô hình nộp chương trình đều nhận ngay điểm số định lượng, giúp mô hình dễ nhận ra cần sửa gì. Còn ở nhà máy, kho hàng hay vùng thiên tai thực tế, điểm số “đúng/sai” không trả về ngay lập tức; mô hình phải tự xem video và dữ liệu cảm biến để truy tìm nguyên nhân thất bại.
Andon Labs dự đoán mô hình thế hệ sau có thể vượt cả 5 bước ở lần chạy tốt nhất, nhưng lần chạy trung bình sẽ cần thêm khoảng 6 tháng nữa để bắt kịp. Theo nhóm nghiên cứu, điều quan trọng không phải hiệu suất đỉnh mà là khả năng tái lập: một bản demo thành công một lần và một hệ thống vận hành không ngừng nghỉ mỗi ngày vẫn cách nhau một khoảng rất sâu.
Ý nghĩa với người đọc Việt Nam
AI drone – drone kết hợp trí tuệ nhân tạo – đang là hướng nghiên cứu toàn cầu cho các ứng dụng như giao hàng, khảo sát, vận hành kho bãi và cứu trợ thiên tai. Kết quả Project Pilot cho thấy mô hình AI đã tiến được xa trong việc điều khiển drone thực hiện các nhiệm vụ vật lý, nhưng vẫn còn cách mức sẵn sàng thương mại một quãng rõ rệt. Với người Việt, đây là tín hiệu đáng chú ý để theo dõi tốc độ trưởng thành của công nghệ drone tự hành trước khi nó có thể xuất hiện trong nông nghiệp, logistics hay cứu hộ tại thị trường trong nước.
Theo Business+IT
Ảnh: Foundry / Pixabay
