ai·radar
Bản tin sáng Tra cứu

Tôi đã thử chạy lại nó với Qwen 3.8 27B ở mức nỗ lực suy luận "medium" - chỉ một lần chạy cho mỗi phép tính (không phải 30) vì chúng mất nhiều thời gian hơn rất nhiều Nó đã làm đúng chính xác 167 trên 169 lần, vì vậy biểu đồ trông khá tẻ nhạt! Đầy đủ chi tiết tại đây: gist.github.com/simonw/8ef79...

I tried running it again with Qwen 3.8 27B on reasoning effort "medium" - just one run per calculation (not 30) because they took a lot longer It got them exactly right 167 out of 169 times, so the chart is pretty dull looking! Full details here: gist.github.com/simonw/8ef79...

Đoạn trích bài viết

Tôi đã thử chạy lại nó với Qwen 3.8 27B ở mức nỗ lực suy luận "medium" - chỉ một lần chạy cho mỗi phép tính (không phải 30) vì chúng mất nhiều thời gian hơn rất nhiều Nó đã làm đúng chính xác 167 trên 169 lần, vì vậy biểu đồ trông khá tẻ nhạt! Đầy đủ chi tiết tại đây: gist.github.com/simonw/8ef79...

Toàn văn bài viết

Đọc bài viết đầy đủ trên bluesky

Mở bài gốc để xem trọn vẹn chi tiết và dẫn chứng.

Mở bài viết gốc