KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards
KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards
Đoạn trích bài viết
LLM ngày càng được áp dụng cho các dòng công việc an ninh mạng, nơi chúng được kỳ vọng sẽ chuyển đổi ý định của các nhà phân tích thành việc gọi công cụ. Tuy nhiên, các đánh giá hiện tại tập trung vào các đánh giá dựa trên kiến thức hoặc các nhiệm vụ cơ quan cuối đến cuối, và không đo trực tiếp khả năng của LLM để tạo ra các thông tin có thể thực hiện được.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên huggingface
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.