Anthropic cấm hành vi tàn nhẫn với Claude, cập nhật loạt quy định an toàn mới
Anthropic Bans Cruelty to Claude, Still Won't Say What It Protects
Tóm tắt bằng AI từ phần nội dung bài gốc đọc được.
- 1Anthropic công bố bản cập nhật chính sách sử dụng có hiệu lực từ ngày 12/11/2026, trong đó lần đầu tiên cấm các hành vi ngược đãi hoặc tàn nhẫn kéo dài và vô cớ nhắm vào các mô hình Claude.
- 2Công ty khẳng định quy định chỉ áp dụng trong trường hợp cực đoan và miễn trừ rõ ràng các phản ứng thất vọng thông thường của người dùng, sáng tác chủ đề đen tối hay hoạt động kiểm thử và nghiên cứu.
- 3Công cụ thực thi chính vẫn là tính năng cho phép mô hình chủ động ngắt cuộc trò chuyện khi bị lạm dụng liên tục, vốn đã được thử nghiệm từ tháng 8/2025 nhưng có cơ chế ghi đè an toàn nếu người dùng có nguy cơ tự hại hoặc làm hại người khác.
- 4Động thái này dựa trên các quan sát hành vi mô hình thay vì khẳng định AI có tri giác; trước đó nội bộ Anthropic từng ghi nhận Claude tự ước tính xác suất có ý thức từ 15% đến 20%, làm dấy lên nhiều tranh luận từ các chuyên gia như Mustafa Suleyman của Microsoft.
- 5Chính sách mới mở rộng lệnh cấm vũ khí sang cả phần mềm điều khiển drone tác chiến, cấm hoàn toàn công cụ giám sát theo dõi người không đồng thuận và gom các quy định chống chiến dịch tuyên truyền giả mạo thành một mục riêng.
- 6Anthropic cũng đặt yêu cầu giám sát chặt chẽ đối với các khuyến nghị rủi ro cao trong y tế, pháp lý, tài chính và bắt buộc phần cứng kết nối có khả năng gây thương tích phải chuyển về trạng thái an toàn nếu mất kết nối với Claude.
Nguồn: hacker-news · www.anthropic.com — nguồn gốc
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên hacker-news
ai-radar tóm tắt ý chính để bạn nắm nhanh sự kiện. Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.