Một tác tử AI mắc lỗi ngay từ đầu tác vụ, sau đó tiếp tục đi sai hướng. Các nhà nghiên cứu của chúng tôi đã xây dựng PivotOPD để dạy các tác tử cách tránh những lỗi đó và phục hồi khi chúng xảy ra. Trong quá trình huấn luyện, một mô hình giáo viên sẽ chỉ cho tác tử một hành động tốt hơn và cách để quay trở lại https://t.co/7hMLMdExEH
An AI agent makes a mistake early in a task, then keeps going in the wrong direction. Our researchers built PivotOPD to teach agents how to avoid those mistakes and recover when they happen. During training, a teacher model shows the agent a better action and how to get back on https://t.co/7hMLMdExEH
Đoạn trích bài viết
Một tác tử AI mắc lỗi ngay từ đầu tác vụ, sau đó tiếp tục đi sai hướng. Các nhà nghiên cứu của chúng tôi đã xây dựng PivotOPD để dạy các tác tử cách tránh những lỗi đó và phục hồi khi chúng xảy ra.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên x:@NVIDIAAI
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.