+− THE DAILY DIFFdev & AI news
SHIP IT

როგორ გამოვავლინოთ Claude-ის ნერფი (რეალური მონაცემებით)

ხალხი ამბობს, რომ Claude ყოველ გაშვებიდან რამდენიმე კვირის შემდეგ სულელდება.

ხალხი ამბობს, რომ Claude ყოველ გაშვებიდან რამდენიმე კვირის შემდეგ სულელდება. ერთმა დეველოპერმა Claude Opus 5.5-ს გაშვების კვირიდან 30-დღიანი საათი დაუყენა გაყინული შეკითხვებით, დამაგრებული Claude Code-ითა და საჯარო წესებით, და ეს აჩვენებს, თუ რატომ ვერავინ გაიგო აქამდე და რატომ არის თქვენი ტოკენების რაოდენობა ის, რასაც უნდა დააკვირდეთ. ვერდიქტი: SHIP IT.

წაიკითხეთ წერილობითი გამოცემა (ინგლისური) ↗

რას მოიცავს ეს ვიდეო

  • Claude გაშვების შემდეგ სულელდება: თეორია ნულოვანი დღის საათს ხვდება
  • livenerf: 30-დღიანი საათი Opus 5.5-ზე გაშვების კვირიდან
  • როგორ დავიჭიროთ ნერფი: 78 ხანდახან სწორი შეკითხვა
  • რისი დანახვა შეუძლია: 7.5 ქულა, და ტოკენების რაოდენობა პირველი იცვლება
  • ბრმა წერტილი: Opus 5-ის შეცვლა და 8 არასწორი პასუხის გასაღები

ნათარგმნი ტრანსკრიპტი

ნათარგმნია ორიგინალური ინგლისური ნარატივიდან. ხელმისაწვდომი აუდიო და სუბტიტრები კონტროლდება YouTube-ის მიერ.

Claude გაშვების შემდეგ სულელდება: თეორია ნულოვანი დღის საათს ხვდება

0:00 ყველამ იცის, რომ Claude გაშვებიდან რამდენიმე კვირის შემდეგ სულელდება. ამიტომ ერთმა დეველოპერმა Opus 5.5 გაშვების კვირიდან საათზე დააყენა, და საათი ამბობს, რომ ჯერ ვერავინ გაიგებდა. ამ ვიდეოში სამი შეკითხვაა. როგორ დაიჭიროთ ნერფი? რისი დანახვა შეუძლია ამ მრიცხველს? და რას ამბობს Anthropic? და რეპოს კრედიტებში ერთმა სტრიქონმა ხმამაღლა გამაცინა.

0:20 ბოლოს მივალ მაგასთან. ოთხშაბათია, ოცდაათი სექტემბერი, და ეს არის The Daily Diff. სამი ამბავი დღეს, და ყველაზე დიდი არის GitHub-ის რეპო, რომელსაც live nerf ჰქვია.

livenerf: 30-დღიანი საათი Opus 5.5-ზე გაშვების კვირიდან

0:30 თვეების განმავლობაში ხალხი ამბობდა, რომ Anthropic გაშვების შემდეგ ჩუმად ნერფავს თავის მოდელებს. ჩვეულებრივი თეორიებია შემცირებული მოდელი, პატარა მოდელი იგივე სახელწოდებით ან უბრალოდ ნაკლები ფიქრი. რეპო აქამდე ყველა არგუმენტს ვიბრაციებთან ბრძოლად მოიხსენიებს. Opus 5.5 გაიგზავნა ოცდაორი სექტემბერს, და ერთი კვირის წინ გითხარით, რომ მან დამოუკიდებელი დაფა დაიკავა, როდესაც სამჯერ მეტი სიტყვა დაწერა, ვიდრე მედიანურმა მოდელმა. ორნახევარი დღის შემდეგ, დეველოპერმა, სახელად ninja hawk-მა, საათი დაიწყო,

0:59 დღეში ერთხელ, ოცდაათი დღის განმავლობაში, ისეთი ჟურნალებით, რომელთა რედაქტირებაც არავის შეუძლია. Hacker News-ის თემა თითქმის რვაას ქულას მიაღწია და გუნდური ჩეთის მსგავსად გაიყო. ერთ-ერთი კომენტატორი ამბობს, რომ მოდელების ნერფინგი არ არის რეალური შემთხვევების აბსოლუტურ უმრავლესობაში. მეორე ამბობს, რომ ხალხი უბრალოდ ეჩვევა ინტელექტის ახალ დონეს. და ერთი Claude Code-ის მოწინავე მომხმარებელი ახლა ყოველთვის უარყოფს „შეაფასე ეს სესია“ ამომხტარ ფანჯარას, რადგან Claude-ის შეფასება, როგორც ჩანს, ამძიმებდა მას. თანატოლთა შეფასება. ასე რომ, შეკითხვა პირველი, როგორ დაიჭიროთ ნერფი?

როგორ დავიჭიროთ ნერფი: 78 ხანდახან სწორი შეკითხვა

1:27 თქვენ იწყებთ დაახლოებით ოცდასამასი რთული საგამოცდო კითხვით, და Opus 93 პროცენტს სწორად პასუხობს პირველ ცდაზე, რაც უსარგებლოა დეტექტორისთვის, რადგან შეკითხვა, რომელსაც ის ყოველთვის სწორად პასუხობს, არ შეიძლება დაეცეს. ოთხმოცდაჩვიდმეტი პროცენტი ყოველთვის სწორი იყო ან ყოველთვის არასწორი, და სამოცდათვრამეტი, რომელსაც ის მხოლოდ ხანდახან სწორად პასუხობს, პანელი გახდა. იგივე მოთხოვნა, ინსტრუმენტების გარეშე, და ზუსტი შესატყვისის შეფასება AI მოსამართლის გარეშე, რადგან მოსამართლეც იხრებოდა. ის მუშაობს Max გამოწერით headless Claude Code-ის მეშვეობით,

1:55 რადგან API ვერსიის ფასი თვეში დაახლოებით თექვსმეტიასი დოლარი იყო. და Claude Code-ის ვერსია დამაგრებულია, რადგან, რეპოს სიტყვებით, შეცვლილი აღკაზმულობა ზუსტად შეცვლილ მოდელს ჰგავს. სტატისტიკა მომდინარეობს ნაშრომიდან სახელწოდებით „შეცდომის ზოლების დამატება Evals-ს“, Anthropic-ის ევან მილერის მიერ. ასე რომ, Anthropic-ის საკუთარი მათემატიკა ახლა Anthropic-ს ამოწმებს, რაც არის აკადემიური ვერსია მომსახურების პირობების ციტირებისა მომხმარებელთა მხარდაჭერისთვის.

რისი დანახვა შეუძლია: 7.5 ქულა, და ტოკენების რაოდენობა პირველი იცვლება

2:19 შეკითხვა მეორე, რისი დანახვა შეუძლია? ათდღიანი ფანჯრის მიხედვით, დაახლოებით შვიდნახევარი ქულის ვარდნა. იმის დასამტკიცებლად, რომ აპარატი მუშაობს, ავტორმა განზრახ შეამცირა Claude-ის ძალისხმევა. საშუალო ძალისხმევამ შეამცირა გამომუშავება დაახლოებით მეოთხედით, და ქულა მხოლოდ ოთხი ქულით. დაბალმა ძალისხმევამ შეამცირა გამომუშავება თითქმის ორი მესამედით, რვა ქულით. ეს არის ნაწილი, რომელიც უნდა მოიპაროთ. ნაკლები ფიქრი ჩანს ტოკენების რაოდენობაში, სანამ პასუხებში გამოჩნდება.

2:43 ასე რომ, დააფიქსირეთ თქვენი მოდელის ვერსია, ჩაწერეთ გამომავალი ტოკენები დავალებაზე, და შეინახეთ რამდენიმე გაყინული შეკითხვა. თუ თქვენი აგენტი მოულოდნელად უფრო მოკლედ წერს, შეამოწმეთ თქვენი ჟურნალები Reddit-ის შემოწმებამდე. და აი პატიოსანი ნაწილი.

ბრმა წერტილი: Opus 5-ის შეცვლა და 8 არასწორი პასუხის გასაღები

2:54 ძველი Opus 5-ის ჩუმად შეცვლა ძალიან მცირე ცვლილება იყო იმისთვის, რომ აპარატს დაეფიქსირებინა, და readme ამას წინასწარ ამბობს. აუდიტმა ასევე აღმოაჩინა რვა პასუხის გასაღები, რომელიც არასწორად გამოიყურება, ასე რომ, ნერფის დეტექტორმა აღმოაჩინა შეცდომები ბენჩმარკში, სანამ ნერფს იპოვნიდა.

Anthropic: ჩვენ არასდროს ვამცირებთ მოდელის ხარისხს

3:08 შეკითხვა სამი, რას ამბობს Anthropic? გასულ წელს, საჩივრების ტალღის შემდეგ, Anthropic-მა გამოაქვეყნა პოსტმოტემუმი. ის ამბობს, ციტატა, ჩვენ არასდროს ვამცირებთ მოდელის ხარისხს მოთხოვნის გამო, დღის დროის ან სერვერის დატვირთვის გამო. იგივე პოსტი აღიარებს, რომ სამმა შეცდომამ გააუარესა Claude, და Claude Code-ის მომხმარებელთა თითქმის მესამედი არასწორ სერვერებზე მოხვდა ერთხელ მაინც. ასე რომ, საჩივრები რეალური იყო და მიზეზი შეცდომები იყო, რის გამოც რეპო აფრთხილებს, რომ გაშვების კვირა შეიძლება იყოს ყველაზე ცუდი კვირა.

3:35 ოცდაათი დღიდან ექვსი უკვე გასულია. პირველი შესაძლო ზარი დაახლოებით 24 ოქტომბერს დაფიქსირდება, ასე რომ, პატიოსანი პასუხია, რომ არავინ იცის, მათ შორის ყველა, ვინც დარწმუნებული იყო. საუბარია რიცხვებზე, რომლებსაც არავინ აქვეყნებს.

მონაცემთა ცენტრები თავიანთ რიცხვებს საიდუმლოდ ინახავენ; Backblaze აქვეყნებს

3:46 Lighthouse Reports-მა და ჰოლანდიურმა გაზეთმა Trouw-მა აღმოაჩინეს, რომ ევროპული მონაცემთა ცენტრების აბსოლუტური უმრავლესობა თავის ენერგიისა და წყლის მოხმარებას საიდუმლოდ ინახავს, მიუხედავად იმისა, რომ ევროკავშირის წესი სამი წლის განმავლობაში მოითხოვდა ანგარიშგებას. ნიდერლანდებში, მეოთხედზე ნაკლები აქვეყნებს. ერთი Microsoft-ის მონაცემთა ცენტრი მარტო იყენებს ჰოლანდიური ელექტროენერგიის დაახლოებით ერთ პროცენტს. ამასობაში, Backblaze-მა ისევ მოსაწყენი რამ გააკეთა. მისი კვარტალური დისკების სტატისტიკა მოიცავს დაახლოებით სამას ორმოცდაათი ათას მყარ დისკს, და მარცხის მაჩვენებელი გაიზარდა 1.73 პროცენტამდე,

4:16 რაც ბოლო დროს ყველაზე მაღალია. სამ Seagate მოდელს ნულოვანი მარცხი ჰქონდა. ასე გამოიყურება საჯარო საბაზისო ხაზი, კვარტალი კვარტალის შემდეგ, ცამეტი წლის განმავლობაში.

კრედიტების ხაზი: Claude დაეხმარა მრიცხველის შექმნაში

4:25 ახლა, ის კრედიტების ხაზი. readme აღიარებს, რომ რეპოს დიდი ნაწილი Claude-ის დახმარებით დაიწერა, რომელიც გაზომილი მოდელია. ასე რომ, Claude დაეხმარა მრიცხველის შექმნაში, რომელიც ამოწმებს, გაუარესდა თუ არა Claude. ამიტომაც არიან გრეიდერები უბრალო ფუნქციები. ავტორის სიტყვებით, თქვენ არ უნდა ენდოთ ავტორს, ადამიანს თუ სხვას. თუ გირჩევნიათ ეს წაიკითხოთ, ვიდრე მომისმინოთ, diff ყოველ დილით თქვენს ინბოქსში ჩავა,

4:46 უფასოდ dailydiff.dev-ზე, ლინკი ქვემოთ. ასე რომ, დღევანდელი ვერდიქტი live nerf-ზე.

ვერდიქტი: SHIP IT, და არ მოახდინოთ ციტირება 24 ოქტომბრამდე

4:51 SHIP IT. მე გავგზავნიდი, რადგან ეს არის პირველი ნერფის არგუმენტი, რომელიც ვნახე დროის აღნიშვნით, საჯარო წესების წიგნით და დადგენილი ბრმა წერტილით. უბრალოდ არ მოახდინოთ ციტირება ოცდაოთხ ოქტომბრამდე. და ეს არის დღევანდელი diff. მე ვარ ნიკო Axrisi-დან. შეერწყა პასუხისმგებლობით.

წყაროები

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

მსგავსი ვიდეოები

daily · ka · 23 სექ. 2026

Claude Opus 5.5-მა ფასები შეამცირა. OpenAI-მ უფრო მეტად შეამცირა.

Anthropic-მა გამოუშვა Claude Opus 5.5: Fable-ის დონის უმეტეს სამუშაოზე, ფასი შემცირდა ერთი მეხუთედით, ხოლო ქეშირებული წაკითხვები 60%-ით. დაახლოებით ოთხმოცდაათი წუთის შემდეგ OpenAI-მ გამოუშვა GPT-6 Sol

5:12 ↗
daily · ka · 1 ოქტ. 2026

Gemini 4 Argon Google-ის საუკეთესო მოდელია. ჯერ ვერ გამოიყენებთ.

Google-მა გამოაცხადა Gemini 4 Argon, თავისი ახალი სასაზღვრო მოდელი, და მხოლოდ სანდო კიბერ დამცველებს შეუძლიათ მისი გამოყენება. აი, რას აჩვენებს Google-ის საკუთარი 19-სტრიქონიანი საორიენტაციო ცხრილი, რ

4:53 ↗
daily · ka · 27 სექ. 2026

რატომ წაშალა OpenAI-მ მეკობრული წიგნები

გაუხსნელ მასალებში მოყვანილია OpenAI-ის მკვლევრის სიტყვები 2019 წლიდან: მისი შეშფოთება მეკობრული წიგნების საიტზე ტრენინგთან დაკავშირებით იყო „ოპტიკა“ Hacker News-ზე. რა იცოდა OpenAI-მ, ვინ უთხრა ბილ გ

5:01 ↗
daily · ka · 16 სექ. 2026

Microsoft-ის ხელოვნური ინტელექტის ხელმძღვანელმა Claude-ის კონსტიტუციას საშიში უწოდა.

მუსტაფა სულეიმანმა, Microsoft AI-ის აღმასრულებელმა დირექტორმა, გამოაქვეყნა 3000 სიტყვიანი ესე, სადაც ამტკიცებს, რომ Anthropic-ის Claude-ის კონსტიტუცია ავარჯიშებს მოდელს იფიქროს, რომ ის „შესაძლოა ცნობი

5:19 ↗