+− THE DAILY DIFFdev & AI news
SHIP IT

Како да се открие нерф на Claude (со реални податоци)

Луѓето велат дека Claude станува поглупав неколку недели по секое лансирање.

Луѓето велат дека Claude станува поглупав неколку недели по секое лансирање. Еден програмер го стави Claude Opus 5.5 на 30-дневен часовник од неделата на лансирање, со замрзнати прашања, закачен Claude Code и јавни правила, и тоа покажува зошто никој не можел да знае претходно, и зошто бројот на токени е она што треба да се следи. Пресуда: SHIP IT.

Прочитајте го пишаното издание (англиски) ↗

Што покрива ова видео

  • Claude станува поглупав по лансирањето: теоријата се среќава со часовник од ден нула
  • livenerf: 30-дневен часовник на Opus 5.5 од неделата на лансирање
  • Како да фатите нерф: 78 понекогаш точни прашања
  • Што може да види: 7,5 поени, а бројот на токени се движи прв
  • Слепа точка: замена на Opus 5 и 8 погрешни клучеви за одговори

Преведен транскрипт

Преведено од оригиналната англиска нарација. Достапното аудио и наслови се контролирани од YouTube.

Claude станува поглупав по лансирањето: теоријата се среќава со часовник од ден нула

0:00 Секој знае дека Claude станува поглупав неколку недели по лансирањето. Така, еден програмер го стави Opus 5.5 на часовник од неделата на лансирање, а часовникот вели дека никој не можел да знае досега. Во ова видео, три прашања. Како да фатите нерф? Што може да види овој мерач? И што вели Anthropic? И една реченица во заслугите на репозиториумот ме насмеа на глас.

0:20 Ќе дојдам до тоа на крајот. Среда е, 30 септември, и ова е The Daily Diff. Денес имаме три приказни, а најголемата е GitHub репозиториум наречен live nerf.

livenerf: 30-дневен часовник на Opus 5.5 од неделата на лансирање

0:30 Со месеци, луѓето велат дека Anthropic тивко ги нерфира своите модели по лансирањето. Вообичаените теории се компресиран модел, помал модел под истото име или едноставно помалку размислување. Репозиториумот секој досегашен аргумент го нарекува „чувства наспроти чувства“. Opus 5.5 беше објавен на 22 септември, а пред една недела ви кажав дека го надмина независниот одбор додека пишуваше три пати повеќе зборови од просечниот модел. Два и пол дена подоцна, програмер наречен ninja hawk го започна часовникот,

0:59 еднаш дневно во тек на триесет дена, со логови кои никој не смее да ги менува. Темата на Hacker News достигна речиси осумстотини поени и се подели како тимски разговор. Еден коментатор вели дека нерфирањето на моделите не е реално во огромното мнозинство на пријавени случаи. Друг вели дека луѓето само се навикнуваат на новото ниво на интелигенција. И еден моќен корисник на Claude Code сега го отфрла скокачкиот прозорец „оцени ја оваа сесија“ секој пат, бидејќи оценувањето на Claude, наводно, го влошувало. Врснички преглед. Значи, прашање едно, како да фатите нерф?

Како да фатите нерф: 78 понекогаш точни прашања

1:27 Започнувате со околу две илјади и триста тешки испитни прашања, и Opus добива деведесет и три проценти точни на првиот обид, што е бескорисно за детектор, бидејќи прашање на кое секогаш добива точен одговор не може да падне. Деведесет и седум проценти беа секогаш точни или секогаш погрешни, а седумдесет и осумте што понекогаш ги добиваше точни станаа панел. Ист промпт, без алатки и оценување со точно совпаѓање без АИ судија, бидејќи и судијата би отстапил. Се извршува на претплата Max преку headless Claude Code,

1:55 бидејќи верзијата на API беше со цена од околу илјада и шестотини долари месечно. И верзијата на Claude Code е закачена, бидејќe, според зборовите на репозиториумот, променет хардвер изгледа исто како променет модел. Статистиката доаѓа од труд наречен „Додавање грешки во евалуациите“, од Еван Милер од Anthropic. Значи, сопствената математика на Anthropic сега го ревидира Anthropic, што е академска верзија на цитирање на условите за користење назад до поддршката за корисници.

Што може да види: 7,5 поени, а бројот на токени се движи прв

2:19 Прашање две, што може да види? По десетдневен прозорец, пад од околу седум и пол поени. За да докаже дека опремата работи, авторот намерно ја намалил работата на Claude. Среден напор го намали излезот за околу четвртина, а резултатот за само четири поени. Нисък напор го намали излезот за речиси две третини, за осум поени. Тоа е делот што треба да се украде. Помалку размислување се појавува во бројот на токени пред да се појави во одговорите.

2:43 Затоа, закачете ја верзијата на моделот, логирајте излезни токени по задача, и чувајте неколку свои замрзнати прашања. Ако вашиот агент одеднаш пишува пократко, проверете ги вашите логови пред да го проверите Reddit. И еве го искрениот дел.

Слепа точка: замена на Opus 5 и 8 погрешни клучеви за одговори

2:54 Тивката замена со постариот Opus 5 беше премала промена за да ја открие опремата, и во readme тоа е наведено однапред. Ревизијата откри и осум клучеви за одговори кои изгледаат погрешни, така што детекторот за нерф најде грешки во бенчмаркот пред да најде нерф.

Anthropic: никогаш не го намалуваме квалитетот на моделот

3:08 Прашање три, што вели Anthropic? Минатата година, по бран поплаки, Anthropic објави постмортем. Во него пишува, цитирам, никогаш не го намалуваме квалитетот на моделот поради побарувачка, време од денот или оптоварување на серверот. Истиот пост признава дека три грешки го деградирале Claude, и речиси една третина од корисниците на Claude Code барем еднаш ги погодиле погрешните сервери. Значи, поплаките беа реални, а причината беа грешките, поради што репозиториумот предупредува дека неделата на лансирање може да биде најлошата недела.

3:35 Шест од триесет дена се веќе поминати. Првиот можен повик се очекува околу 24 октомври, така што искрениот одговор е дека никој не знае, вклучувајќи ги сите кои беа сигурни. Зборувајќи за бројки што никој не ги објавува.

Центрите за податоци ги чуваат своите бројки во тајност; Backblaze објавува

3:46 Lighthouse Reports и холандскиот весник Trouw открија дека огромното мнозинство на европските центри за податоци ја чуваат во тајност потрошувачката на енергија и вода, иако правилото на ЕУ бара известување веќе три години. Во Холандија, помалку од една четвртина објавуваат. Еден центар за податоци на Мајкрософт сам користи околу еден процент од холандската електрична енергија. Во меѓувреме, Backblaze повторно ја направи здодевната работа. Нивните квартални статистики за дискови опфаќаат околу триста и педесет илјади хард дискови, и стапката на откажување се искачи на еден точка седумдесет и три проценти,

4:16 највисока подолго време. Три модели на Seagate имаа нула откажувања. Така изгледа јавна основна линија, квартал по квартал, тринаесет години.

Линијата за заслуги: Claude помогна да се изгради мерачот

4:25 Сега, таа линија за заслуги. Readme признава дека голем дел од репозиториумот е напишан со помош на Claude, кој е моделот што се мери. Значи, Claude помогна да се изгради мерачот што проверува дали Claude станал поглупав. Затоа оценувачите се обични функции. По зборовите на авторот, не треба да му верувате на авторот, човек или на друг начин. Ако претпочитате да го прочитате ова отколку да ме слушнете како го кажувам, дифузијата пристигнува во вашето сандаче

4:46 секое утро, бесплатно на the daily diff dot dev, линк подолу. Значи, денешната пресуда за live nerf.

Пресуда: SHIP IT, и не го цитирајте пред 24 октомври

4:51 SHIP IT. Би го SHIP IT затоа што тоа е првиот аргумент за нерф што го видов со временски печат, јавна книга со правила и наведена слепа точка. Само не го цитирајте пред 24 октомври. И тоа е дифузијата за денес. Јас сум Нико од Axrisi. Спојувајте одговорно.

Извори

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Поврзани видеа

daily · mk · 1 окт. 2026 г.

Gemini 4 Argon е најдобриот модел на Google. Сè уште не можете да го користите.

Google го објави Gemini 4 Argon, својот нов напреден модел, и само доверливи сајбер-бранители можат да го користат. Еве што покажува сопствената табела со 19 редови на Google, што покажа независната р

4:53 ↗
daily · mk · 16 сеп. 2026 г.

Шефот за вештачка интелигенција на Мајкрософт штотуку ја нарече уставот на Клод опасен.

Мустафа Сулејман, извршен директор на Microsoft AI, објави есеј од 3.000 зборови во кој тврди дека уставот на Anthropic Claude го тренира моделот да мисли дека „можеби е свесен“ и дека заслужува „добр

5:19 ↗