ai·radar
Bản tin sáng Tra cứu

Đánh giá mở dựa trên tìm kiếm thất bại ở đâu? Đánh giá tự động phân loại từ hình thức dài Phản ứng Y tế xác minh thực tế

Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification

Đoạn trích bài viết

Đánh giá thực tế dựa trên tìm kiếm, nơi các tuyên bố được tạo ra bằng LLM được xác minh với bằng chứng từ các cơ quan y tế có thẩm quyền, đã trở thành mô hình thống trị cho việc phát hiện ảo giác có thể mở rộng trong các môi trường lâm sàng có rủi ro cao.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc