Chúng tôi đã so sánh sáu công cụ kiểm tra ảo giác trên cùng các kết quả bàn giao từ một tập hợp cố định gồm 20 tác vụ và tám mô hình. Chúng tôi đã tiến hành kiểm tra hai giai đoạn bằng GPT-6 Sol (high), GPT-6 Luna (high), Grok 4.7 (high), Claude Opus 5.5 (high), Claude Sonnet 5.5 (high) và Gemini 3.8 Flash (high), https://t.co/a0kxux7bZ8
We compared six hallucination checkers on the same deliverables from a fixed subset of 20 tasks and eight models. We ran our two-stage check using GPT-6 Sol (high), GPT-6 Luna (high), Grok 4.7 (high), Claude Opus 5.5 (high), Claude Sonnet 5.5 (high) and Gemini 3.8 Flash (high), https://t.co/a0kxux7bZ8
Đoạn trích bài viết
Chúng tôi đã so sánh sáu công cụ kiểm tra ảo giác trên cùng các kết quả bàn giao từ một tập hợp cố định gồm 20 tác vụ và tám mô hình.
Toàn văn bài viết
Mở bài viết gốc
Đọc bài viết đầy đủ trên x:@ArtificialAnlys
Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.