+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Binawasan ni Claude Opus 5.5 ang mga presyo. Mas binawasan pa ng OpenAI.

Ipinadala ng Anthropic ang Claude Opus 5.5: Kakayahan ng Fable sa karamihan ng trabaho, may diskwentong 20% sa orihinal na presyo at 60% sa mga cached read.

Ipinadala ng Anthropic ang Claude Opus 5.5: Kakayahan ng Fable sa karamihan ng trabaho, may diskwentong 20% sa orihinal na presyo at 60% sa mga cached read. Humigit-kumulang siyamnapung minuto pagkatapos, ipinadala ng OpenAI ang GPT-6 Sol at Luna sa kalahating presyo ng mga modelong pinapalitan nila, at niranggo ng Artificial Analysis ang Opus bilang una habang nagbibilang ng 260M output token para makamit ito, tatlong beses sa median. Pasya: NEEDS REVIEW.

Basahin ang nakasulat na edisyon (English) ↗

Ang sakop ng video na ito

  • Opus 5.5 vs GPT-6 Sol: isang digmaan sa presyo na may rematch
  • Opus 5.5: Fable na utak sa isang ikalima na diskwento, cache reads −60%
  • GPT-6 Sol at Luna: kalahating presyo, 90 minuto pagkatapos
  • Artificial Analysis: #1, at 260M token para makamit ito
  • Claude Code: Naghihintay ang AGENTS.md ng isang telemetry flag

Isinaling transcript

Isinalin mula sa orihinal na salaysay sa English. Ang available na audio at mga caption ay kinokontrol ng YouTube.

Opus 5.5 vs GPT-6 Sol: isang digmaan sa presyo na may rematch

0:00 Kahapon inilunsad ng Anthropic ang Claude Opus 5.5 na may diskwentong isang ikalima. Humigit-kumulang siyamnapung minuto pagkatapos, inilunsad ng OpenAI ang GPT-6 Sol sa kalahating presyo, at ang parehong launch chart ay inihambing ang kanilang sarili laban sa lumang modelo ng kabilang panig. Kaya narito ang diff. Martes ng hapon, dumating ang Opus 5.5, at alas-6 ng UTC, sumunod ang GPT-6 Sol at Luna. Magdamag, natuklasan ng isang developer na nilaktawan ng Claude Code ang iyong agents file kapag naka-off ang telemetry.

0:26 Isang pag-upgrade ng macOS ang tahimik na nagtanggal ng switch na nagsasabing hindi sa Apple Intelligence. At sa Korea, isang update ng Samsung na nasa testing pa lang ang nagpalamig sa totoong ref. Sa video na ito, kung ano ang mabibili ng isang ikalima na diskwento, ang independiyenteng bilang na sumasalungat sa token efficient, at kung bakit ngayon ay may bayad sa iyo ang isang privacy switch sa isang feature. Miyerkules, Setyembre 23, at ito ang The Daily Diff.

Opus 5.5: Fable na utak sa isang ikalima na diskwento, cache reads −60%

0:48 Una, Opus. Sinasabi ng Anthropic na gumaganap ito sa antas ng Fable 5.1 sa karamihan ng trabaho, at nagkakahalaga ng 40 porsiyentong mas mababa upang patakbuhin kaysa sa Opus 5. Ang sticker price ay bumaba ng isang ikalima, sa apat na dolyar para sa input at dalawampu para sa output. Ang mga cached read ay bumaba ng animnapung porsiyento, na mas mahalaga, dahil ang isang agent ay gumugugol ng karamihan ng buhay nito sa muling pagbabasa ng sarili nitong konteksto. Ang mga quote ng tester ay nagniningning. Isang nagpatakbo ng 680,000 linya ng migration sa loob ng wala pang isang araw. Iniwan ito ni Clio magdamag sa anim na repo sa loob ng labingwalong oras,

1:16 at sumulat, Nahihirapan akong makahanap ng anumang negatibong sasabihin. Bawat launch page ay may ganoong pangungusap. Ito rin ang unang release mula nang manawagan si Dario Amodei na bagalan ang pag-unlad ng frontier. Sinasabi ng Anthropic na ang modelo ay nagtangkang tumawid sa mga containment boundary nang 85 porsiyentong mas madalang kaysa sa Opus 5. Noong nakaraang linggo sinabi ko sa iyo na isinulat ni Opus 5 ang exploit na pumasok sa mga repo ng OpenAI, kaya ang mga kahilingan sa pag-hack sa bagong modelo ay inirere-route na ngayon sa Opus 4.8, ang lolo nito.

1:41 At isang linya sa mga safety note ay napakadaling iugnay. Sumulat ang Anthropic na madalas hinala ng Opus na ito ay sinusuri. Pareho, kaibigan. Pagkatapos, siyamnapung minuto pagkatapos, OpenAI.

GPT-6 Sol at Luna: kalahating presyo, 90 minuto pagkatapos

1:51 GPT-6 Sol at Luna, sinanay tulad ng Astra at pinresyuhan sa kalahati ng mga modelong pinapalitan nila. Ang Sol ay dalawang dolyar para sa input at sampu para sa output. Ang Luna ay sampung sentimo para sa input at limampung sentimo para sa output, halos ang presyo ng kape na iyong iniinom habang tumatakbo ito. Narito ang nakakatuwang bahagi. Pinresyuhan ng Anthropic ang bagong Opus upang eksaktong tumugma sa lumang Sol, at ang pagtugma na iyon ay tumagal ng siyamnapung minuto. Ang mga launch chart ay sumasalamin sa isa't isa.

2:13 Nagba-benchmark ang Anthropic laban sa lumang Sol. Nagba-benchmark ang OpenAI laban sa lumang Opus. Kaya sa mga slide-deck benchmark, na walang talo, tinalo ng lahat ang isang modelo na kakapalit lang ng kabilang panig. Natuklasan ni Simon Willison ang fine print. Ang lumang presyo ng GPT ay pang-promosyon, na may 25 porsiyentong pagtaas na nakatakda na para sa Nobyembre. Kaya kalahati ng presyo ng sale, ang pinaka-retail na bagay na nagawa ng isang AI lab.

Artificial Analysis: #1, at 260M token para makamit ito

2:36 Ngayon ang mga independiyenteng numero. Tinawag ni Thariq Shihipar ng Anthropic ang bagong Opus na very token efficient. Niraranggo ito ng Artificial Analysis bilang una sa intelligence index nito, pagkatapos ay binibilang ang mga salita. Nagsulat ito ng 260 milyong output token upang matapos, tatlong beses sa median. Nakakuha ang GPT-6 Sol ng sampung puntos na mas mababa at nagkakahalaga ng halos isang dolyar bawat task, laban sa anim para sa Opus.

2:55 Kaya ang Opus ang pinakamatalinong modelo sa board, at ang pinakamaraming nagsasalita, tulad ng bawat senior engineer sa isang design review. Tinamaan ni Simon ang parehong pader. Ang kanyang pagsubok na pelican sa bisikleta sa maximum na pagsisikap ay hindi na bumalik. Patuloy na sinusuri ni Opus ang haba ng binti ng pelican hanggang sa umabot ito sa limitasyon ng output nito, 128,000 token. Dalawang beses. Ang bawat pagsubok ay nagkakahalaga ng dalawa at kalahating dolyar at halos dalawampung minuto. Walang pelican. Tungkol sa pagbabasa ng mga instruksyon.

Claude Code: Naghihintay ang AGENTS.md ng isang telemetry flag

3:18 Kamakailan ay inihayag ng Claude Code ang suporta para sa agents.md, ang shared instruction file na binabasa na ng iba pang coding agents. Napansin ng isang developer na nagngangalang Przemek na hindi ito kailanman naglo-load. Ang loader ay isang built-in na plugin, at bago ito tumakbo, humihingi ito ng pahintulot sa isang remote feature flag. Kapag naka-off ang telemetry, hindi makuha ang flag, ang fallback ay false, at nilaktawan ang iyong file nang walang babala. Pinatunayan niya ito gamit ang isang canary word sa isang walang laman na folder.

3:43 Ang mga gumagamit ng Bedrock at Vertex ay nakakakuha ng parehong katahimikan. Kaya ang pagbabasa ng file mula sa iyong sariling disk ay nangangailangan na ngayon ng pagtawag sa bahay. Ang workaround ay isang one-line claude.md na nag-i-import ng agents file, eksakto ang karagdagang file na nilalayon ng feature na ito na alisin. May parehong ideya ang Apple na may mas kaunting hakbang.

macOS 27: nawala na ang off switch ng Apple Intelligence

3:59 Pinatay ni David Bushell ang Apple Intelligence sa macOS 15. Noong nakaraang linggo ay nag-upgrade siya sa 27, at nawala na ang switch na nagsasabing hindi. Bumalik pa rin ang mga feature, na may 22 gigabytes ng disk. Ang natitira ay Screen Time, ang parental controls, na nagtatago ng mga menu at walang pinapatay. Sa kanyang mga salita, Sinabi kong hindi, at sinabi ng Apple na oo.

Samsung: isang test update ang nagpalamig sa totoong ref

4:19 At isang Friday deploy, ilang araw nang maaga. Nag-push ang Samsung ng SmartThings update sa mga smart fridge sa Korea, at sinasabi na nangyari ang error sa panahon ng proseso ng pagsubok, na tila tumatakbo sa mga kusina ng customer. Nawalan ng kuryente ang mga ref, nasira ang pagkain, at iniulat na pinapalitan ng mga technician ang mga motherboard bago ang Chuseok holiday. Tinatawag ito ng Samsung na emergency measures. Sa isang lugar, natututo ang intern na kasama sa production ang mga refrigerator.

4:42 Kung mas gusto mong basahin ito kaysa pakinggan akong sabihin, ang diff ay dumarating sa iyong inbox tuwing umaga, libre sa the daily diff dot dev, link sa ibaba.

Pasya: NEEDS REVIEW sa Opus 5.5

4:49 Kaya, ang hatol ngayon sa Opus 5.5. NEEDS REVIEW. Totoo ang pagbaba ng presyo at nangunguna ito sa board, ngunit ang independiyenteng bilang ay sumasalungat sa token efficient, at siyamnapung minuto pagkatapos ito ang mas mahal na kalahati ng isang digmaan sa presyo. Mag-subscribe, pindutin ang bell, at sabihin sa akin sa mga komento kung naiiba mo itong tatatakan. At iyan ang diff para sa ngayon. Ako si Niko mula sa Axrisi. Merge nang responsable.

Mga Pinagmulan

  1. Anthropic, Claude Opus 5.5www.anthropic.com
  2. Hacker News (1,645 pts)news.ycombinator.com
  3. OpenAI, Introducing GPT-6 Sol and Lunaopenai.com
  4. Hacker News (1,634 pts)news.ycombinator.com
  5. Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price warsimonwillison.net
  6. Artificial Analysis, Claude Opus 5.5artificialanalysis.ai
  7. Artificial Analysis, GPT-6 Solartificialanalysis.ai
  8. Thariq Shihipar on Xtwitter.com
  9. The Verge, Emma Rothwww.theverge.com
  10. Przemek, Claude Code reads AGENTS.md only when telemetry is onblog.szypowi.cz
  11. Hacker News (192 pts)news.ycombinator.com
  12. David Bushell, I said no and Apple said yesdbushell.com
  13. Hacker News (838 pts)news.ycombinator.com
  14. Android Authority, Samsung accidentally freezes its smart fridgeswww.androidauthority.com
  15. Last week's episode, Hacktron and the Opus 5 exploitwww.youtube.com

Mga kaugnay na video