ai·radar
Bản tin sáng Tra cứu

Tạo ra nhiều token đầu ra hơn không nhất thiết đồng nghĩa với điểm số cao hơn. GPT-6 Astra (max) đạt điểm 8,6% với ~81k token đầu ra cho mỗi tác vụ, chưa bằng một nửa mức ~180k của Grok 4.7 (xhigh). Ba mô hình Claude tạo ra nhiều token đầu ra nhất (~202k đến ~562k cho mỗi tác vụ) và đạt điểm từ 2,8% đến https://t.co/sXHO11c6Wn

Generating more output tokens doesn’t necessarily translate to a higher score. GPT-6 Astra (max) scores 8.6% on ~81k output tokens per task, under half the ~180k of Grok 4.7 (xhigh). Three Claude models generated the most output tokens (~202k to ~562k per task) and score 2.8% to https://t.co/sXHO11c6Wn

Đoạn trích bài viết

Tạo ra nhiều token đầu ra hơn không nhất thiết đồng nghĩa với điểm số cao hơn. GPT-6 Astra (max) đạt điểm 8,6% với ~81k token đầu ra cho mỗi tác vụ, chưa bằng một nửa mức ~180k của Grok 4.7 (xhigh).

Toàn văn bài viết

Đọc bài viết đầy đủ trên x:@ArtificialAnlys

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc