Đánh giá mở dựa trên tìm kiếm thất bại ở đâu? Đánh giá tự động phân loại từ hình thức dài Phản ứng Y tế xác minh thực tế
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification
Đoạn trích bài viết
Đánh giá thực tế dựa trên tìm kiếm, nơi các tuyên bố được tạo ra bằng LLM được xác minh với bằng chứng từ các cơ quan y tế có thẩm quyền, đã trở thành mô hình thống trị cho việc phát hiện ảo giác có thể mở rộng trong các môi trường lâm sàng có rủi ro cao.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.