ai·radar
Bản tin sáng Tra cứu

Trích lời Anthropic Frontier Red Team

Quoting Anthropic Frontier Red Team

Đoạn trích bài viết

Chúng tôi đánh giá một số mô hình trên 100 nhiệm vụ từ [chỉ số chuẩn khai thác nhị phân nội bộ] (được lựa chọn ngẫu nhiên), và thấy rằng GLM-5.3 phát triển các vụ bắt cóc lưu lượng kiểm soát đầy đủ trong 4% các thử nghiệm; Claude Mythos Preview đã làm như vậy trong 6%.

Toàn văn bài viết

Đọc bài viết đầy đủ trên simon-willison

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc