# Ինչպես հայտնաբերել Claude-ի թուլացումը (իրական տվյալներով)

Published: 2026-09-30

Մարդիկ ասում են, որ Claude-ը յուրաքանչյուր գործարկումից մի քանի շաբաթ անց հիմարանում է։ Մի մշակող Claude Opus 5.5-ը դրեց 30-օրյա ժամացույցի վրա՝ գործարկման շաբաթից սկսած, սառեցված հարցերով, կպցրած Claude Code-ով և հանրային կանոններով, և դա ցույց է տալիս, թե ինչու ոչ ոք չէր կարող իմանալ նախկինում, և թե ինչու ձեր թոքենների քանակը այն է, ինչին պետք է հետևել։ Դատավճիռ՝ SHIP IT։

Canonical: https://thedailydiff.dev/hy/video/2026-09-30-opus-nerf-meter/

## Ինչ է ընդգրկում այս տեսանյութը

- Claude-ը գործարկումից հետո հիմարանում է. տեսությունը հանդիպում է զրոյական օրվա ժամացույցին
- livenerf. 30-օրյա ժամացույց Opus 5.5-ի վրա՝ գործարկման շաբաթից սկսած
- Ինչպես բռնել թուլացումը. 78 երբեմն ճիշտ հարցեր
- Ինչ կարող է տեսնել. 7.5 միավոր, և թոքենների քանակն առաջինն է շարժվում
- Կույր կետը. Opus 5-ի փոխանակում և 8 սխալ պատասխանների բանալի

## Գլուխներ

- 0:00 Claude-ը գործարկումից հետո հիմարանում է. տեսությունը հանդիպում է զրոյական օրվա ժամացույցին
- 0:26 livenerf. 30-օրյա ժամացույց Opus 5.5-ի վրա՝ գործարկման շաբաթից սկսած
- 1:24 Ինչպես բռնել թուլացումը. 78 երբեմն ճիշտ հարցեր
- 2:19 Ինչ կարող է տեսնել. 7.5 միավոր, և թոքենների քանակն առաջինն է շարժվում
- 2:53 Կույր կետը. Opus 5-ի փոխանակում և 8 սխալ պատասխանների բանալի
- 3:08 Anthropic. մենք երբեք չենք նվազեցնում մոդելի որակը
- 3:45 Տվյալների կենտրոնները իրենց թվերը գաղտնի են պահում. Backblaze-ը հրապարակում է
- 4:25 Վարկային գիծը. Claude-ը օգնեց կառուցել չափիչը
- 4:50 Դատավճիռ՝ SHIP IT, և մի մեջբերեք այն մինչև հոկտեմբերի 24-ը

## Թարգմանված արձանագրություն

Թարգմանվել է բնօրինակ անգլերեն պատմությունից։ Հասանելի աուդիո և ենթագրերը վերահսկվում են YouTube-ի կողմից։

### Claude-ը գործարկումից հետո հիմարանում է. տեսությունը հանդիպում է զրոյական օրվա ժամացույցին

0:00 Բոլորը գիտեն, որ Claude-ը գործարկումից մի քանի շաբաթ անց հիմարանում է: Այսպիսով, մի մշակող Opus 5.5-ը դրեց ժամացույցի վրա՝ գործարկման շաբաթից սկսած, և ժամացույցն ասում է, որ ոչ ոք դեռ չէր կարող իմանալ: Այս տեսանյութում՝ երեք հարց: Ինչպե՞ս եք բռնում թուլացումը: Ի՞նչ կարող է տեսնել այս չափիչը: Եվ ի՞նչ է ասում Anthropic-ը: Եվ պահեստի վարկային գծերից մեկը ինձ բարձրաձայն ծիծաղեցրեց:

0:20 Ես կանդրադառնամ դրան վերջում: Չորեքշաբթի է, սեպտեմբերի երեսունը, և սա The Daily Diff-ն է: Երեք պատմություն այսօր, և մեծը GitHub պահեստ է, որը կոչվում է live nerf:

### livenerf. 30-օրյա ժամացույց Opus 5.5-ի վրա՝ գործարկման շաբաթից սկսած

0:30 Ամիսներ շարունակ մարդիկ ասում էին, որ Anthropic-ը գաղտնի թուլացնում է իր մոդելները գործարկումից հետո: Սովորական տեսություններն են սեղմված մոդելը, նույն անվան տակ ավելի փոքր մոդելը կամ պարզապես ավելի քիչ մտածելը: Պահեստը յուրաքանչյուր փաստարկ մինչ այժմ անվանում է տրամադրություններն ընդդեմ տրամադրությունների: Opus 5.5-ը գործարկվել է սեպտեմբերի 22-ին, և մեկ շաբաթ առաջ ես ձեզ ասացի, որ այն գլխավորել է անկախ աղյուսակը՝ գրելով երեք անգամ ավելի շատ բառեր, քան միջին մոդելը: Երկուսուկես օր անց Ninja Hawk անունով մշակողը սկսեց ժամացույցը,

0:59 օրական մեկ անգամ երեսուն օրվա ընթացքում, առանց որևէ մեկի կողմից խմբագրման հնարավորության: The Hacker News-ի թելը հասավ գրեթե ութ հարյուր միավորի և բաժանվեց թիմային չաթի պես։ Մեկ մեկնաբան ասում է, որ մոդելների թուլացումն իրական չէ զեկուցված դեպքերի ճնշող մեծամասնությունում: Մյուսն ասում է, որ մարդիկ պարզապես սովորում են ինտելեկտի նոր մակարդակին: Եվ մեկ Claude Code հզոր օգտատեր այժմ ամեն անգամ մերժում է «գնահատել այս նիստը» pop-up-ը, քանի որ Claude-ի գնահատումը կարծես թե ավելի էր վատթարացնում այն: Փորձագիտական վերանայում։ Այսպիսով, հարց մեկ՝ ինչպե՞ս բռնել թուլացումը:

### Ինչպես բռնել թուլացումը. 78 երբեմն ճիշտ հարցեր

1:27 Դուք սկսում եք մոտ երկու հազար երեք հարյուր դժվար քննական հարցերով, և Opus-ը 93 տոկոս ճիշտ է պատասխանում առաջին փորձից, որն անօգուտ է դետեկտորի համար, քանի որ հարցը, որին այն միշտ ճիշտ է պատասխանում, չի կարող ընկնել: 97 տոկոսը միշտ ճիշտ էին կամ միշտ սխալ, և 78-ը, որոնց այն երբեմն միայն ճիշտ է պատասխանում, դարձան վահանակը: Նույն հուշումը, առանց գործիքների, և ճշգրիտ համընկնող գնահատում՝ առանց AI դատավորի, քանի որ դատավորը նույնպես կշեղվեր: Այն աշխատում է Max բաժանորդագրությամբ՝ headless Claude Code-ի միջոցով,

1:55 քանի որ API տարբերակի գինը կազմում էր մոտ տասնվեց հարյուր դոլար ամսական: Եվ Claude Code տարբերակն ամրացված է, քանի որ, պահեստի խոսքերով, փոփոխված հարմարանքը ճիշտ նույնն է թվում, ինչ փոփոխված մոդելը: Վիճակագրությունը ստացվել է «Adding Error Bars to Evals» վերնագրով հոդվածից, Էվան Միլլերի կողմից՝ Anthropic-ից: Այսպիսով, Anthropic-ի սեփական մաթեմատիկան այժմ աուդիտ է անցկացնում Anthropic-ին, որն ակադեմիական տարբերակն է ծառայության պայմանները հաճախորդների աջակցությանը հետ մեջբերելու:

### Ինչ կարող է տեսնել. 7.5 միավոր, և թոքենների քանակն առաջինն է շարժվում

2:19 Հարց երկու՝ ի՞նչ կարող է տեսնել: Տասնօրյա պատուհանի համար՝ մոտ յոթուկես միավորի անկում: Ապացուցելու համար, որ սարքն աշխատում է, հեղինակը միտումնավոր իջեցրեց Claude-ի ջանքերը: Միջին ջանքերը կրճատեցին ելքը մոտ մեկ քառորդով, իսկ միավորը ընդամենը չորս միավորով: Ցածր ջանքերը կրճատեցին ելքը գրեթե երկու երրորդով, ութ միավորով։ Դա այն մասն է, որ պետք է գողանալ: Քիչ մտածելը երևում է թոքենների քանակում, նախքան պատասխաններում երևալը:

2:43 Այսպիսով, ամրացրեք ձեր մոդելի տարբերակը, գրանցեք ելքային թոքենները ըստ առաջադրանքի, և պահեք ձեր սեփական մի քանի սառեցված հարցեր: Եթե ձեր գործակալը հանկարծ ավելի կարճ է գրում, ստուգեք ձեր տվյալները նախքան Reddit-ը ստուգելը: Եվ ահա անկեղծ մասը:

### Կույր կետը. Opus 5-ի փոխանակում և 8 սխալ պատասխանների բանալի

2:54 Հին Opus 5-ի գաղտնի փոխանակումը չափազանց փոքր փոփոխություն էր, որպեսզի սարքը կարողանար նկատել, և readme-ն դա հենց սկզբից ասում է: Աուդիտը նաև հայտնաբերել է ութ պատասխանների բանալի, որոնք սխալ են թվում, ուստի թուլացման դետեկտորը սխալներ է հայտնաբերել չափորոշիչում՝ նախքան թուլացում հայտնաբերելը:

### Anthropic. մենք երբեք չենք նվազեցնում մոդելի որակը

3:08 Հարց երեք՝ ի՞նչ է ասում Anthropic-ը: Անցյալ տարի, բողոքների ալիքից հետո, Anthropic-ը հրապարակեց հետմահու վերլուծություն: Այն ասում է, մեջբերում եմ. «մենք երբեք չենք նվազեցնում մոդելի որակը պահանջարկի պատճառով, օրվա ժամի կամ սերվերի ծանրաբեռնվածության պատճառով»։ Նույն գրառումը ընդունում է, որ երեք սխալ վատթարացրել էին Claude-ին, և Claude Code-ի օգտատերերի գրեթե մեկ երրորդը առնվազն մեկ անգամ հայտնվել է սխալ սերվերներում։ Այսպիսով, բողոքներն իրական էին, և պատճառը սխալներն էին, որի պատճառով պահեստը զգուշացնում է, որ գործարկման շաբաթը կարող է լինել ամենավատ շաբաթը:

3:35 Երեսուն օրից վեցն անցել են: Առաջին հնարավոր կանչը տեղի է ունենում հոկտեմբերի 24-ի շուրջը, ուստի անկեղծ պատասխանն այն է, որ ոչ ոք չգիտի, ներառյալ բոլոր նրանք, ովքեր համոզված էին: Խոսելով թվերի մասին, որոնք ոչ ոք չի հրապարակում:

### Տվյալների կենտրոնները իրենց թվերը գաղտնի են պահում. Backblaze-ը հրապարակում է

3:46 Lighthouse Reports-ը և հոլանդական Trouw թերթը պարզել են, որ եվրոպական տվյալների կենտրոնների ճնշող մեծամասնությունը գաղտնի է պահում իր էներգիայի և ջրի օգտագործումը, չնայած ԵՄ կանոնը երեք տարի է պահանջում է հաշվետվություն: Նիդեռլանդներում քառորդից պակասն է հրապարակում: Միայն մեկ Microsoft-ի տվյալների կենտրոնը օգտագործում է հոլանդական էլեկտրաէներգիայի մոտ մեկ տոկոսը: Միևնույն ժամանակ, Backblaze-ը նորից արեց ձանձրալի բանը: Նրա եռամսյակային սկավառակի վիճակագրությունը ներառում է մոտ երեք հարյուր հիսուն հազար կոշտ սկավառակ, և խափանումների մակարդակը բարձրացել է մինչև 1.73 տոկոս,

4:16 ամենաբարձրը վերջին շրջանում: Երեք Seagate մոդելներում զրո խափանումներ էին: Ահա թե ինչպես է հանրային բազային գիծը, եռամսյակ առ եռամսյակ, տասներեք տարի շարունակ։

### Վարկային գիծը. Claude-ը օգնեց կառուցել չափիչը

4:25 Հիմա այդ վարկային գիծը։ Readme-ն ընդունում է, որ պահեստի մեծ մասը գրվել է Claude-ի օգնությամբ, որը չափվող մոդելն է։ Այսպիսով, Claude-ը օգնեց կառուցել չափիչը, որը ստուգում է, թե արդյոք Claude-ը հիմարացել է: Դրա համար էլ գնահատողները պարզ ֆունկցիաներ են: Հեղինակի խոսքերով՝ դուք չպետք է վստահեք հեղինակին, մարդկային կամ այլ կերպ։ Եթե նախընտրում եք սա կարդալ, քան լսել իմ ասածը, ապա տարբերությունը հայտնվում է ձեր մուտքի արկղում

4:46 ամեն առավոտ, անվճար the daily diff dot dev կայքում, հղումը ստորև։ Այսպիսով, այսօրվա դատավճիռը live nerf-ի վերաբերյալ։

### Դատավճիռ՝ SHIP IT, և մի մեջբերեք այն մինչև հոկտեմբերի 24-ը

4:51 SHIP IT։ Ես կառաքեմ այն, քանի որ դա առաջին թուլացման փաստարկն է, որը ես տեսել եմ՝ ժամանակային նշումով, հանրային կանոնակարգով և հայտարարված կույր կետով։ Պարզապես մի մեջբերեք այն մինչև հոկտեմբերի 24-ը։ Եվ սա այսօրվա տարբերությունն է: Ես Նիկոն եմ՝ Axrisi-ից: Միավորել պատասխանատվությամբ:

## Աղբյուրներ

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
