DiVeR: Học tập kiểm tra quyết định quan trọng cho quy mô thời gian thử nghiệm VLA
DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling
Đoạn trích bài viết
Việc quy mô dữ liệu robot và khả năng mô hình đã cải thiện các chính sách Vision-Language-Action (VLA), nhưng tiến bộ hơn nữa bị hạn chế bởi chi phí cao của dữ liệu robot. Việc quy mô thời gian thử nghiệm được hướng dẫn bởi người xác minh cung cấp một lựa chọn thay thế hiệu quả bằng cách lấy mẫu nhiều ứng cử viên hành động và chọn một ứng cử viên có khả năng nhất.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.