ai·radar
Bản tin sáng Tra cứu

ASCENT: huấn luyện thời gian thử nghiệm trực tuyến của các agent đường dài thông qua tự chưng cất kinh nghiệm được xác minh

ASCENT: Online Test-Time Training of Long-Horizon Agents via Self-Distillation of Verified Experience

Đoạn trích bài viết

Một agent mô hình ngôn ngữ lớn (LLM) giải quyết các nhiệm vụ chân trời dài thông qua nhiều lượt hành động lý luận, với một tín hiệu xác minh khi kết thúc. Các agent được triển khai phải đối mặt với một loạt các nhiệm vụ liên quan, làm cho quỹ đạo của họ trở thành một nguồn tài nguyên tự nhiên để cải thiện.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc