ai·radar
Bản tin sáng Tra cứu

VepAgent: Kết nối sự chuyển đổi nguyên nhân thông qua việc học tập tăng cường công cụ cho dự đoán sự kiện video

VepAgent: Bridging Causal-Transition via Tool-Augmented Reinforcement Learning for Video Event Prediction

Đoạn trích bài viết

Các mô hình ngôn ngữ lớn đa phương tiện (MLLM) đã chứng minh tiềm năng đáng chú ý trong sự hiểu biết video, tuy nhiên sự phụ thuộc của họ vào kết luận ngược lại và tiền lệ tập trung vào văn bản thường hạn chế khả năng của họ để vượt qua các chuyển đổi nguyên nhân không được quan sát khi được áp dụng cho Dự đoán Sự kiện Video (VEP).

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc