ai·radar
Bản tin sáng Tra cứu

TestPrism: Xem xét lại đánh giá thử nghiệm vượt ra ngoài một tham chiếu duy nhất

TestPrism: Rethinking Test Evaluation Beyond a Single Reference

Đoạn trích bài viết

Các agent lập trình mô hình ngôn ngữ lớn (LLM) có hệ thống thử nghiệm tiên tiến trên các nhiệm vụ lập trình khác nhau. Tuy nhiên, thực tiễn phổ biến của việc đánh giá các thử nghiệm với một giải pháp tham chiếu duy nhất bỏ qua các thực hiện hợp lệ thay thế và có thể đánh giá quá cao chất lượng thử nghiệm.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc