VepAgent: Kết nối sự chuyển đổi nguyên nhân thông qua việc học tập tăng cường công cụ cho dự đoán sự kiện video
VepAgent: Bridging Causal-Transition via Tool-Augmented Reinforcement Learning for Video Event Prediction
Đoạn trích bài viết
Các mô hình ngôn ngữ lớn đa phương tiện (MLLM) đã chứng minh tiềm năng đáng chú ý trong sự hiểu biết video, tuy nhiên sự phụ thuộc của họ vào kết luận ngược lại và tiền lệ tập trung vào văn bản thường hạn chế khả năng của họ để vượt qua các chuyển đổi nguyên nhân không được quan sát khi được áp dụng cho Dự đoán Sự kiện Video (VEP).
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.