ai·radar
Bản tin sáng Tra cứu

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

Đoạn trích bài viết

LLM ngày càng được áp dụng cho các dòng công việc an ninh mạng, nơi chúng được kỳ vọng sẽ chuyển đổi ý định của các nhà phân tích thành việc gọi công cụ. Tuy nhiên, các đánh giá hiện tại tập trung vào các đánh giá dựa trên kiến thức hoặc các nhiệm vụ cơ quan cuối đến cuối, và không đo trực tiếp khả năng của LLM để tạo ra các thông tin có thể thực hiện được.

Toàn văn bài viết

Đọc bài viết đầy đủ trên huggingface

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc