ai·radar
Bản tin sáng Tra cứu

InterEvolve: Sự tiến hóa trong thời gian thử nghiệm của các chương trình phần thưởng cho sự thao túng của loài người

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

Đoạn trích bài viết

Chúng tôi nghiên cứu tiến hóa thời gian thử nghiệm cho sự thao túng của loài người: giải quyết các nhiệm vụ mà một người điều khiển chưa bao giờ được đào tạo bằng cách sử dụng lại kỹ năng hiện có của mình, cải thiện từ những nỗ lực của riêng mình, và giữ lại những gì nó học được, mà không cần đào tạo lại.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc