Cách phát hiện Claude bị giảm hiệu suất (với dữ liệu thực)
Mọi người nói Claude trở nên kém thông minh hơn vài tuần sau mỗi lần ra mắt.
Mọi người nói Claude trở nên kém thông minh hơn vài tuần sau mỗi lần ra mắt. Một nhà phát triển đã đặt Claude Opus 5.5 vào một đồng hồ 30 ngày kể từ tuần ra mắt, với các câu hỏi cố định, một Claude Code được ghim và các quy tắc công khai, và điều đó cho thấy tại sao không ai có thể biết trước đây, và tại sao số lượng token của bạn là thứ cần theo dõi. Phán quyết: SHIP IT.
Đọc phiên bản viết (tiếng Anh) ↗
Nội dung video này đề cập
- Claude trở nên kém thông minh hơn sau khi ra mắt: lý thuyết gặp đồng hồ ngày 0
- livenerf: một đồng hồ 30 ngày trên Opus 5.5 từ tuần ra mắt
- Làm thế nào để phát hiện giảm hiệu suất: 78 câu hỏi đôi khi đúng
- Những gì nó có thể thấy: 7,5 điểm, và số lượng token di chuyển trước
- Điểm mù: một lần hoán đổi Opus 5 và 8 khóa đáp án sai
Bản ghi đã dịch
Được dịch từ lời tường thuật tiếng Anh gốc. Âm thanh và phụ đề có sẵn được điều khiển bởi YouTube.
Claude trở nên kém thông minh hơn sau khi ra mắt: lý thuyết gặp đồng hồ ngày 0
0:00 Mọi người đều biết Claude trở nên kém thông minh hơn vài tuần sau khi ra mắt. Vì vậy, một nhà phát triển đã đặt Opus 5.5 vào một đồng hồ đo từ tuần ra mắt, và đồng hồ cho thấy chưa ai có thể biết được. Trong video này, ba câu hỏi. Làm thế nào để bạn phát hiện giảm hiệu suất? Đồng hồ đo này có thể thấy gì? Và Anthropic nói gì? Và một dòng trong phần tín dụng của kho lưu trữ đã khiến tôi bật cười.
0:20 Tôi sẽ nói đến nó ở cuối. Hôm nay là thứ Tư, ngày 30 tháng 9, và đây là The Daily Diff. Ba câu chuyện hôm nay, và câu chuyện lớn là một kho lưu trữ GitHub có tên live nerf.
livenerf: một đồng hồ 30 ngày trên Opus 5.5 từ tuần ra mắt
0:30 Trong nhiều tháng, mọi người đã nói rằng Anthropic lặng lẽ giảm hiệu suất các mô hình của mình sau khi ra mắt. Các lý thuyết thông thường là một mô hình bị nén, một mô hình nhỏ hơn dưới cùng một tên hoặc đơn giản là ít suy nghĩ hơn. Kho lưu trữ gọi mọi lập luận cho đến nay là cảm giác đấu với cảm giác. Opus 5.5 đã được xuất xưởng vào ngày 22 tháng 9, và một tuần trước tôi đã nói với bạn rằng nó đứng đầu bảng xếp hạng độc lập trong khi viết nhiều hơn ba lần số từ so với mô hình trung bình. Hai ngày rưỡi sau, một nhà phát triển tên ninja hawk đã bắt đầu đồng hồ,
0:59 mỗi ngày một lần trong ba mươi ngày, với nhật ký không ai có thể chỉnh sửa. Chủ đề Hacker News đạt gần 800 điểm và chia rẽ như một cuộc trò chuyện nhóm. Một người bình luận nói rằng việc giảm hiệu suất mô hình không có thật trong phần lớn các trường hợp được báo cáo. Một người khác nói rằng mọi người chỉ đang quen với cấp độ thông minh mới. Và một người dùng thành thạo Claude Code hiện bỏ qua cửa sổ bật lên 'đánh giá phiên này' mỗi lần, vì việc đánh giá Claude dường như làm cho nó tệ hơn. Đánh giá đồng nghiệp. Vậy, câu hỏi một, làm thế nào để bạn phát hiện giảm hiệu suất?
Làm thế nào để phát hiện giảm hiệu suất: 78 câu hỏi đôi khi đúng
1:27 Bạn bắt đầu với khoảng 2300 câu hỏi thi khó, và Opus đúng 93 phần trăm ngay lần đầu tiên, điều này vô dụng cho một bộ phát hiện, vì một câu hỏi nó luôn đúng thì không thể giảm. 97 phần trăm luôn đúng hoặc luôn sai, và 78 câu nó chỉ đôi khi đúng đã trở thành bảng điều khiển. Cùng một lời nhắc, không có công cụ, và chấm điểm khớp chính xác không có AI đánh giá, vì người đánh giá cũng sẽ trôi dạt. Nó chạy trên gói đăng ký Max thông qua Claude Code không giao diện,
1:55 vì phiên bản API có giá khoảng 1600 đô la một tháng. Và phiên bản Claude Code được ghim, bởi vì, theo lời của kho lưu trữ, một bộ thử nghiệm đã thay đổi trông giống hệt như một mô hình đã thay đổi. Số liệu thống kê đến từ một bài báo có tên Adding Error Bars to Evals, của Evan Miller tại Anthropic. Vì vậy, toán học của chính Anthropic giờ đây đang kiểm toán Anthropic, đây là phiên bản học thuật của việc trích dẫn các điều khoản dịch vụ cho bộ phận hỗ trợ khách hàng.
Những gì nó có thể thấy: 7,5 điểm, và số lượng token di chuyển trước
2:19 Câu hỏi hai, nó có thể thấy gì? Trong mỗi cửa sổ mười ngày, một sự sụt giảm khoảng 7,5 điểm. Để chứng minh thiết bị hoạt động, tác giả đã cố ý giảm nỗ lực của Claude. Nỗ lực trung bình cắt giảm đầu ra khoảng một phần tư, và điểm số chỉ bốn điểm. Nỗ lực thấp cắt giảm đầu ra gần hai phần ba, cho tám điểm. Đó là phần đáng để học hỏi. Ít suy nghĩ hơn xuất hiện trong số lượng token trước khi nó xuất hiện trong câu trả lời.
2:43 Vì vậy, hãy ghim phiên bản mô hình của bạn, ghi nhật ký token đầu ra cho mỗi tác vụ, và giữ một vài câu hỏi cố định của riêng bạn. Nếu tác nhân của bạn đột nhiên viết ngắn hơn, hãy kiểm tra nhật ký của bạn trước khi bạn kiểm tra Reddit. Và đây là phần trung thực.
Điểm mù: một lần hoán đổi Opus 5 và 8 khóa đáp án sai
2:54 Việc lặng lẽ hoán đổi Opus 5 cũ hơn là một thay đổi quá nhỏ để thiết bị phát hiện, và readme nói rõ điều đó. Cuộc kiểm toán cũng tìm thấy tám khóa đáp án trông có vẻ sai, vì vậy bộ phát hiện giảm hiệu suất đã tìm thấy lỗi trong điểm chuẩn trước khi nó tìm thấy giảm hiệu suất.
Anthropic: chúng tôi không bao giờ giảm chất lượng mô hình
3:08 Câu hỏi ba, Anthropic nói gì? Năm ngoái, sau một làn sóng khiếu nại, Anthropic đã công bố một bài phân tích hậu sự. Nó nói, trích dẫn, chúng tôi không bao giờ giảm chất lượng mô hình do nhu cầu, thời gian trong ngày hoặc tải máy chủ. Bài đăng tương tự thừa nhận ba lỗi đã làm giảm chất lượng Claude, và gần một phần ba số người dùng Claude Code đã truy cập nhầm máy chủ ít nhất một lần. Vì vậy, các khiếu nại là có thật và nguyên nhân là do lỗi, đó là lý do tại sao kho lưu trữ cảnh báo rằng tuần ra mắt có thể là tuần tồi tệ nhất.
3:35 Sáu trong ba mươi ngày đã trôi qua. Cuộc gọi có thể xảy ra đầu tiên rơi vào khoảng ngày 24 tháng 10, vì vậy câu trả lời trung thực là không ai biết, kể cả tất cả những người đã chắc chắn. Nói về những con số không ai công bố.
Các trung tâm dữ liệu giữ bí mật số liệu của họ; Backblaze công bố
3:46 Lighthouse Reports và tờ báo Trouw của Hà Lan phát hiện ra rằng phần lớn các trung tâm dữ liệu châu Âu giữ bí mật việc sử dụng điện và nước của họ, mặc dù một quy định của EU đã yêu cầu báo cáo trong ba năm. Ở Hà Lan, chưa đến một phần tư công bố. Chỉ riêng một trung tâm dữ liệu của Microsoft đã sử dụng khoảng một phần trăm điện năng của Hà Lan. Trong khi đó, Backblaze lại làm điều nhàm chán. Thống kê ổ đĩa hàng quý của họ bao gồm khoảng 350 nghìn ổ cứng, và tỷ lệ hỏng hóc đã tăng lên 1,73 phần trăm,
4:16 mức cao nhất trong một thời gian. Ba mẫu Seagate không có lỗi nào. Đó là những gì một đường cơ sở công khai trông như thế nào, quý này qua quý khác, trong mười ba năm.
Dòng tín dụng: Claude đã giúp xây dựng đồng hồ đo
4:25 Bây giờ, dòng tín dụng đó. Readme thừa nhận rằng nhiều phần của kho lưu trữ được viết với sự giúp đỡ của Claude, đó là mô hình đang được đo lường. Vì vậy, Claude đã giúp xây dựng đồng hồ đo kiểm tra xem Claude có kém thông minh hơn không. Đó là lý do tại sao các bộ chấm điểm là các hàm đơn giản. Theo lời của tác giả, bạn không nên tin tưởng tác giả, con người hay cách khác. Nếu bạn muốn đọc điều này hơn là nghe tôi nói, the diff sẽ đến hộp thư đến của bạn
4:46 mỗi sáng, miễn phí tại the daily diff dot dev, liên kết bên dưới. Vậy, phán quyết hôm nay về live nerf.
Phán quyết: SHIP IT, và đừng trích dẫn trước ngày 24 tháng 10
4:51 SHIP IT. Tôi sẽ SHIP IT vì đây là lập luận giảm hiệu suất đầu tiên tôi thấy có dấu thời gian, một quy tắc công khai và một điểm mù được nêu rõ. Chỉ cần đừng trích dẫn nó trước ngày 24 tháng 10. Và đó là the diff của ngày hôm nay. Tôi là Niko từ Axrisi. Hợp nhất có trách nhiệm.
Nguồn
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



