PerturBot: Breaking Shortcut Priors in Vision-Language-Action Models with Perturbative Training
PerturBot: Breaking Shortcut Priors in Vision-Language-Action Models with Perturbative Training
Đoạn trích bài viết
Một chính sách tầm nhìn - ngôn ngữ - hành động (VLA) có thể hoàn thành các nhiệm vụ phức tạp trong khi bỏ qua các bằng chứng có thể xác định hành động của nó. Một vật được giữ gần máy ảnh cổ tay có thể di chuyển mục tiêu được hướng dẫn.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.