+− THE DAILY DIFFdev & AI news
SHIP IT

ວິທີກວດຫາ Claude ທີ່ອ່ອນແອລົງ (ດ້ວຍຂໍ້ມູນຈິງ)

ຄົນເວົ້າວ່າ Claude ໂງ່ລົງສອງສາມອາທິດຫຼັງຈາກເປີດຕົວແຕ່ລະຄັ້ງ.

ຄົນເວົ້າວ່າ Claude ໂງ່ລົງສອງສາມອາທິດຫຼັງຈາກເປີດຕົວແຕ່ລະຄັ້ງ. ຜູ້ພັດທະນາຄົນໜຶ່ງໄດ້ຕັ້ງ Claude Opus 5.5 ໃສ່ໂມງ 30 ວັນນັບຈາກອາທິດເປີດຕົວ, ດ້ວຍຄຳຖາມທີ່ຖືກກຳນົດໄວ້, ລະຫັດ Claude ທີ່ຖືກປັກໝຸດ ແລະ ກົດລະບຽບສາທາລະນະ, ແລະ ມັນສະແດງໃຫ້ເຫັນວ່າເປັນຫຍັງບໍ່ມີໃຜຮູ້ມາກ່ອນ, ແລະ ເປັນຫຍັງຈຳນວນ token ຂອງເຈົ້າຈຶ່ງເປັນສິ່ງທີ່ຕ້ອງເຝົ້າເບິ່ງ. ຄຳຕັດສິນ: SHIP IT.

ອ່ານສະບັບລາຍລັກອັກສອນ (ພາສາອັງກິດ) ↗

ສິ່ງທີ່ວິດີໂອນີ້ກວມເອົາ

  • Claude ໂງ່ລົງຫຼັງຈາກເປີດຕົວ: ທິດສະດີພົບກັບໂມງມື້ສູນ
  • livenerf: ໂມງ 30 ວັນໃນ Opus 5.5 ນັບຕັ້ງແຕ່ອາທິດເປີດຕົວ
  • ວິທີຈັບຄວາມອ່ອນແອລົງ: 78 ຄໍາຖາມທີ່ບາງຄັ້ງຖືກຕ້ອງ
  • ສິ່ງທີ່ມັນສາມາດເຫັນໄດ້: 7.5 ຄະແນນ, ແລະ ຈຳນວນ token ເຄື່ອນຍ້າຍກ່ອນ
  • ຈຸດບອດ: ການແລກປ່ຽນ Opus 5 ແລະ 8 ຄີຄຳຕອບທີ່ຜິດ

ບົດບັນທຶກທີ່ແປແລ້ວ

ແປຈາກຄຳບັນຍາຍຕົ້ນສະບັບພາສາອັງກິດ. ສຽງ ແລະ ຄຳບັນຍາຍທີ່ມີໃຫ້ແມ່ນຄວບຄຸມໂດຍ YouTube.

Claude ໂງ່ລົງຫຼັງຈາກເປີດຕົວ: ທິດສະດີພົບກັບໂມງມື້ສູນ

0:00 ທຸກຄົນຮູ້ວ່າ Claude ໂງ່ລົງສອງສາມອາທິດຫຼັງຈາກເປີດຕົວ. ດັ່ງນັ້ນ, ນັກພັດທະນາຄົນໜຶ່ງໄດ້ຕັ້ງ Opus ຫ້າຈຸດຫ້າໃສ່ໂມງຕັ້ງແຕ່ອາທິດເປີດຕົວ, ແລະໂມງບອກວ່າບໍ່ມີໃຜຮູ້ເທື່ອ. ໃນວິດີໂອນີ້, ສາມຄຳຖາມ. ເຈົ້າຈະຈັບຄວາມອ່ອນແອລົງໄດ້ແນວໃດ? ເຄື່ອງວັດແທກນີ້ສາມາດເຫັນຫຍັງໄດ້? ແລະ Anthropic ເວົ້າວ່າແນວໃດ? ແລະໜຶ່ງປະໂຫຍກໃນເຄຣດິດຂອງ repo ເຮັດໃຫ້ຂ້ອຍຫົວຂວັນອອກມາ.

0:20 ຂ້ອຍຈະເວົ້າເຖິງມັນໃນຕອນທ້າຍ. ມັນແມ່ນວັນພຸດ, ວັນທີ 30 ກັນຍາ, ແລະນີ້ແມ່ນ The Daily Diff. ສາມເລື່ອງໃນມື້ນີ້, ແລະເລື່ອງໃຫຍ່ແມ່ນ GitHub repo ທີ່ເອີ້ນວ່າ live nerf.

livenerf: ໂມງ 30 ວັນໃນ Opus 5.5 ນັບຕັ້ງແຕ່ອາທິດເປີດຕົວ

0:30 ເປັນເວລາຫຼາຍເດືອນ, ຄົນໄດ້ເວົ້າວ່າ Anthropic ຫຼຸດຄຸນນະພາບຕົວແບບຂອງພວກເຂົາຢ່າງງຽບໆຫຼັງຈາກເປີດຕົວ. ທິດສະດີປົກກະຕິແມ່ນຕົວແບບທີ່ຖືກບີບອັດ, ຕົວແບບນ້ອຍລົງພາຍໃຕ້ຊື່ດຽວກັນ ຫຼືພຽງແຕ່ຄິດໜ້ອຍລົງ. repo ເອີ້ນທຸກຂໍ້ໂຕ້ແຍ້ງທີ່ຜ່ານມາວ່າ vibes ຕໍ່ vibes. Opus ຫ້າຈຸດຫ້າໄດ້ຖືກຈັດສົ່ງໃນວັນທີ 22 ກັນຍາ, ແລະໜຶ່ງອາທິດກ່ອນຂ້ອຍບອກເຈົ້າວ່າມັນໄດ້ຂຶ້ນອັນດັບສູງສຸດຂອງກະດານເອກະລາດໃນຂະນະທີ່ຂຽນສາມ ເທື່ອຂອງຄຳສັບຫຼາຍກວ່າຕົວແບບສະເລ່ຍ. ສອງມື້ເຄິ່ງຜ່ານໄປ, ນັກພັດທະນາຊື່ ninja hawk ໄດ້ເລີ່ມໂມງ,

0:59 ມື້ລະຄັ້ງເປັນເວລາສາມສິບມື້, ດ້ວຍບັນທຶກທີ່ບໍ່ມີໃຜສາມາດແກ້ໄຂໄດ້. ກະທູ້ Hacker News ໄດ້ຮັບເກືອບແປດຮ້ອຍຄະແນນ ແລະ ແຍກອອກຄືກັບການສົນທະນາເປັນທີມ. ຜູ້ໃຫ້ຄຳເຫັນຄົນໜຶ່ງເວົ້າວ່າການຫຼຸດຄຸນນະພາບຕົວແບບບໍ່ແມ່ນຄວາມຈິງໃນກໍລະນີສ່ວນໃຫຍ່ຂອງ ກໍລະນີທີ່ຖືກລາຍງານ. ອີກຄົນໜຶ່ງເວົ້າວ່າຄົນພຽງແຕ່ຄຸ້ນເຄີຍກັບລະດັບໃໝ່ຂອງ ຄວາມສະຫຼາດ. ແລະຜູ້ໃຊ້ Claude Code ທີ່ມີປະສິດທິພາບຄົນໜຶ່ງຕອນນີ້ປະຕິເສດປັອບອັບການໃຫ້ຄະແນນເຊດຊັນນີ້ ທຸກຄັ້ງ, ເພາະວ່າການໃຫ້ຄະແນນ Claude ເບິ່ງຄືວ່າເຮັດໃຫ້ມັນຮ້າຍແຮງຂຶ້ນ. ການທົບທວນຄືນໂດຍເພື່ອນຮ່ວມງານ. ດັ່ງນັ້ນ, ຄຳຖາມທີໜຶ່ງ, ເຈົ້າຈະຈັບຄວາມອ່ອນແອລົງໄດ້ແນວໃດ?

ວິທີຈັບຄວາມອ່ອນແອລົງ: 78 ຄໍາຖາມທີ່ບາງຄັ້ງຖືກຕ້ອງ

1:27 ເຈົ້າເລີ່ມຕົ້ນດ້ວຍປະມານສອງພັນສາມຮ້ອຍຄຳຖາມສອບເສັງທີ່ຍາກ, ແລະ Opus ໄດ້ 93 ເປີເຊັນຖືກຕ້ອງໃນການລອງຄັ້ງທຳອິດ, ເຊິ່ງບໍ່ມີປະໂຫຍດສຳລັບເຄື່ອງກວດຈັບ, ເນື່ອງຈາກຄຳຖາມທີ່ມັນຖືກຕ້ອງສະເໝີບໍ່ສາມາດ ຫຼຸດລົງໄດ້. 97 ເປີເຊັນແມ່ນຖືກຕ້ອງສະເໝີ ຫຼືຜິດສະເໝີ, ແລະ 78 ຄຳຖາມທີ່ມັນຖືກຕ້ອງບາງຄັ້ງເທົ່ານັ້ນໄດ້ກາຍເປັນຄະນະ. Prompt ດຽວກັນ, ບໍ່ມີເຄື່ອງມື, ແລະການໃຫ້ຄະແນນທີ່ກົງກັນຢ່າງຖືກຕ້ອງໂດຍບໍ່ມີ AI ຕັດສິນ, ເພາະວ່າຜູ້ຕັດສິນກໍ່ຈະຄາດເຄື່ອນເຊັ່ນກັນ. ມັນເຮັດວຽກໃນການສະໝັກ Max ຜ່ານ headless Claude Code,

1:55 ເນື່ອງຈາກເວີຊັນ API ມີລາຄາປະມານໜຶ່ງພັນຫົກຮ້ອຍໂດລາຕໍ່ເດືອນ. ແລະເວີຊັນ Claude Code ຖືກປັກໝຸດ, ເພາະວ່າ, ໃນຄຳເວົ້າຂອງ repo, ເຄື່ອງມືທີ່ປ່ຽນແປງເບິ່ງຄືກັນກັບຕົວແບບທີ່ປ່ຽນແປງ. ສະຖິຕິມາຈາກເອກະສານທີ່ຊື່ວ່າ Adding Error Bars to Evals, ໂດຍ Evan Miller ທີ່ Anthropic. ດັ່ງນັ້ນ, ຄະນິດສາດຂອງ Anthropic ເອງກຳລັງກວດສອບ Anthropic, ເຊິ່ງແມ່ນເວີຊັນທາງວິຊາການ ຂອງການອ້າງອິງເງື່ອນໄຂການບໍລິການຄືນໃສ່ການຊ່ວຍເຫຼືອລູກຄ້າ.

ສິ່ງທີ່ມັນສາມາດເຫັນໄດ້: 7.5 ຄະແນນ, ແລະ ຈຳນວນ token ເຄື່ອນຍ້າຍກ່ອນ

2:19 ຄຳຖາມທີສອງ, ມັນສາມາດເຫັນຫຍັງໄດ້? ຕໍ່ປ່ອງຢ້ຽມສິບມື້, ຫຼຸດລົງປະມານເຈັດຈຸດຫ້າຄະແນນ. ເພື່ອພິສູດວ່າລະບົບເຮັດວຽກ, ຜູ້ຂຽນໄດ້ຫຼຸດຄວາມພະຍາຍາມຂອງ Claude ລົງໂດຍເຈດຕະນາ. ຄວາມພະຍາຍາມປານກາງຕັດຜົນຜະລິດລົງປະມານໜຶ່ງສ່ວນສີ່, ແລະຄະແນນພຽງແຕ່ສີ່ ຄະແນນ. ຄວາມພະຍາຍາມຕໍ່າຕັດຜົນຜະລິດລົງເກືອບສອງສ່ວນສາມ, ສຳລັບແປດຄະແນນ. ນັ້ນຄືສ່ວນທີ່ຈະລັກ. ການຄິດໜ້ອຍລົງປາກົດຢູ່ໃນຈຳນວນ token ກ່ອນທີ່ມັນຈະປາກົດຢູ່ໃນຄຳຕອບ.

2:43 ດັ່ງນັ້ນ, ປັກໝຸດເວີຊັນຕົວແບບຂອງເຈົ້າ, ບັນທຶກ output tokens ຕໍ່ໜ້າວຽກ, ແລະເກັບຄຳຖາມທີ່ຖືກກຳນົດໄວ້ຈຳນວນໜຶ່ງຂອງເຈົ້າເອງ. ຖ້າຕົວແທນຂອງເຈົ້າຂຽນສັ້ນລົງຢ່າງກະທັນຫັນ, ກວດເບິ່ງບັນທຶກຂອງເຈົ້າກ່ອນທີ່ຈະກວດເບິ່ງ Reddit. ແລະນີ້ແມ່ນສ່ວນທີ່ຊື່ສັດ.

ຈຸດບອດ: ການແລກປ່ຽນ Opus 5 ແລະ 8 ຄີຄຳຕອບທີ່ຜິດ

2:54 ການແລກປ່ຽນ Opus ຫ້າທີ່ເກົ່າກວ່າຢ່າງງຽບໆແມ່ນການປ່ຽນແປງທີ່ນ້ອຍເກີນໄປສຳລັບລະບົບທີ່ຈະ ເອີ້ນ, ແລະ readme ບອກໄວ້ແຕ່ຕົ້ນ. ການກວດສອບຍັງພົບແປດຄີຄຳຕອບທີ່ເບິ່ງຄືວ່າຜິດ, ດັ່ງນັ້ນ, ເຄື່ອງກວດຈັບຄວາມອ່ອນແອລົງໄດ້ພົບບັກໃນ benchmark ກ່ອນທີ່ມັນຈະພົບຄວາມອ່ອນແອລົງ.

Anthropic: ພວກເຮົາບໍ່ເຄີຍຫຼຸດຄຸນນະພາບຕົວແບບ

3:08 ຄຳຖາມທີສາມ, Anthropic ເວົ້າວ່າແນວໃດ? ປີກາຍນີ້, ຫຼັງຈາກມີຄຳຮ້ອງຮຽນຫຼາຍຄັ້ງ, Anthropic ໄດ້ເຜີຍແຜ່ບົດວິເຄາະຫຼັງເກີດເຫດ. ມັນເວົ້າວ່າ, ອ້າງອີງ, ພວກເຮົາບໍ່ເຄີຍຫຼຸດຄຸນນະພາບຕົວແບບເນື່ອງຈາກຄວາມຕ້ອງການ, ເວລາຂອງມື້ ຫຼື ພາລະຂອງເຊີບເວີ. ໂພສດຽວກັນຍອມຮັບວ່າສາມບັກໄດ້ເຮັດໃຫ້ Claude ເສຍຫາຍ, ແລະເກືອບໜຶ່ງສ່ວນສາມຂອງ ຜູ້ໃຊ້ Claude Code ໄດ້ເຂົ້າເຖິງເຊີບເວີທີ່ຜິດຢ່າງໜ້ອຍໜຶ່ງຄັ້ງ. ດັ່ງນັ້ນ, ຄຳຮ້ອງຮຽນແມ່ນຄວາມຈິງ ແລະສາເຫດແມ່ນບັກ, ເຊິ່ງເປັນເຫດຜົນທີ່ repo ເຕືອນວ່າອາທິດເປີດຕົວອາດຈະເປັນອາທິດທີ່ຮ້າຍແຮງທີ່ສຸດ.

3:35 ຫົກໃນສາມສິບມື້ແມ່ນຢູ່ໃນ. ການໂທທີ່ເປັນໄປໄດ້ຄັ້ງທຳອິດຈະມາຮອດປະມານວັນທີ 24 ຕຸລາ, ດັ່ງນັ້ນ, ຄຳຕອບທີ່ຊື່ສັດຄືບໍ່ມີໃຜຮູ້, ລວມທັງທຸກຄົນທີ່ໝັ້ນໃຈ. ເວົ້າເຖິງຕົວເລກທີ່ບໍ່ມີໃຜເຜີຍແຜ່.

ສູນຂໍ້ມູນເກັບກຳຕົວເລກຂອງພວກເຂົາເປັນຄວາມລັບ; Backblaze ເຜີຍແຜ່

3:46 Lighthouse Reports ແລະໜັງສືພິມໂຮນລັງ Trouw ພົບວ່າສູນຂໍ້ມູນສ່ວນໃຫຍ່ຂອງ ເອີຣົບເກັບຮັກສາການໃຊ້ພະລັງງານແລະນ້ຳຂອງພວກເຂົາເປັນຄວາມລັບ, ເຖິງແມ່ນວ່າກົດລະບຽບ EU ໄດ້ຮຽກຮ້ອງໃຫ້ລາຍງານເປັນເວລາສາມປີແລ້ວ. ໃນເນເທີແລນ, ມີໜ້ອຍກວ່າໜຶ່ງສ່ວນສີ່ເຜີຍແຜ່. ສູນຂໍ້ມູນ Microsoft ແຫ່ງດຽວໃຊ້ປະມານໜຶ່ງເປີເຊັນຂອງໄຟຟ້າໂຮນລັງ. ໃນຂະນະດຽວກັນ, Backblaze ໄດ້ເຮັດສິ່ງທີ່ໜ້າເບື່ອອີກຄັ້ງ. ສະຖິຕິໄດຣຟ໌ລາຍໄຕມາດຂອງມັນຄອບຄຸມຮາດດິດປະມານສາມແສນຫ້າສິບພັນໜ່ວຍ, ແລະອັດຕາຄວາມລົ້ມເຫຼວເພີ່ມຂຶ້ນເປັນ 1.73 ເປີເຊັນ,

4:16 ສູງທີ່ສຸດໃນໄລຍະໜຶ່ງ. ສາມຕົວແບບ Seagate ບໍ່ມີຄວາມລົ້ມເຫຼວ. ນັ້ນຄືສິ່ງທີ່ເສັ້ນພື້ນຖານສາທາລະນະເບິ່ງຄື, ໄຕມາດແລ້ວໄຕມາດ, ເປັນເວລາສິບສາມປີ.

ສາຍເຄຣດິດ: Claude ຊ່ວຍສ້າງເຄື່ອງວັດແທກ

4:25 ຕອນນີ້, ສາຍເຄຣດິດນັ້ນ. readme ຍອມຮັບວ່າຫຼາຍສ່ວນຂອງ repo ໄດ້ຖືກຂຽນດ້ວຍການຊ່ວຍເຫຼືອຂອງ Claude, ເຊິ່ງແມ່ນຕົວແບບທີ່ກຳລັງວັດແທກ. ດັ່ງນັ້ນ, Claude ຊ່ວຍສ້າງເຄື່ອງວັດແທກທີ່ກວດສອບວ່າ Claude ໂງ່ລົງຫຼືບໍ່. ນັ້ນຄືເຫດຜົນທີ່ຜູ້ໃຫ້ຄະແນນແມ່ນຟັງຊັນທຳມະດາ. ໃນຄຳເວົ້າຂອງຜູ້ຂຽນ, ເຈົ້າບໍ່ຄວນຈະຕ້ອງໄວ້ວາງໃຈຜູ້ຂຽນ, ບໍ່ວ່າຈະເປັນມະນຸດ ຫຼື ອື່ນໆ. ຖ້າເຈົ້າຢາກອ່ານເລື່ອງນີ້ແທນທີ່ຈະຟັງຂ້ອຍເວົ້າ, diff ຈະມາຮອດ inbox ຂອງເຈົ້າ

4:46 ທຸກໆເຊົ້າ, ຟຣີທີ່ the daily diff dot dev, ລິ້ງຂ້າງລຸ່ມ. ດັ່ງນັ້ນ, ຄຳຕັດສິນຂອງມື້ນີ້ກ່ຽວກັບ live nerf.

ຄຳຕັດສິນ: SHIP IT, ແລະ ຢ່າອ້າງອິງກ່ອນວັນທີ 24 ຕຸລາ

4:51 SHIP IT. ຂ້ອຍຈະຈັດສົ່ງມັນເພາະວ່າມັນເປັນຂໍ້ໂຕ້ແຍ້ງການຫຼຸດຄຸນນະພາບຄັ້ງທຳອິດທີ່ຂ້ອຍເຄີຍເຫັນກັບ ເຄື່ອງໝາຍເວລາ, ປຶ້ມກົດລະບຽບສາທາລະນະ ແລະ ຈຸດບອດທີ່ລະບຸໄວ້. ພຽງແຕ່ຢ່າອ້າງອິງມັນກ່ອນວັນທີ 24 ຕຸລາ. ແລະນັ້ນຄື diff ສໍາລັບມື້ນີ້. ຂ້ອຍ Niko ຈາກ Axrisi. ຮວມເຂົ້າກັນຢ່າງຮັບຜິດຊອບ.

ແຫຼ່ງຂໍ້ມູນ

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

ວິດີໂອທີ່ກ່ຽວຂ້ອງ

daily · lo · 23 ກ.ຍ. 2026

Claude Opus 5.5 ຫຼຸດລາຄາ. OpenAI ຫຼຸດລາຄາເລິກກວ່າ.

Anthropic ໄດ້ປ່ອຍ Claude Opus 5.5: ລະດັບ Fable ໃນວຽກສ່ວນໃຫຍ່, ຫຼຸດລາຄາປ້າຍລົງຫ້າເທົ່າ ແລະ 60% ສໍາລັບການອ່ານແບບ cached. ປະມານເກົ້າສິບນາທີຕໍ່ມາ OpenAI ໄດ້ປ່ອຍ GPT-6 Sol ແລະ Luna ໃນລາຄາເຄິ່ງໜຶ່ງຂອງຮູບແບບ

5:12 ↗
daily · lo · 1 ຕ.ລ. 2026

Gemini 4 Argon ແມ່ນຕົວແບບທີ່ດີທີ່ສຸດຂອງ Google. ທ່ານຍັງບໍ່ສາມາດນຳໃຊ້ມັນໄດ້ເທື່ອ.

Google ໄດ້ປະກາດ Gemini 4 Argon, ຕົວແບບຊັ້ນນຳໃໝ່ຂອງຕົນ, ແລະ ມີພຽງແຕ່ນັກປ້ອງກັນໄພໄຊເບີທີ່ເຊື່ອຖືໄດ້ເທົ່ານັ້ນທີ່ສາມາດນຳໃຊ້ມັນໄດ້. ນີ້ແມ່ນສິ່ງທີ່ຕາຕະລາງ benchmark 19 ແຖວຂອງ Google ສະແດງໃຫ້ເຫັນ, ສິ່ງທີ່ກະດ

4:53 ↗
daily · lo · 27 ກ.ຍ. 2026

ເປັນຫຍັງ OpenAI ຈຶ່ງລຶບປຶ້ມທີ່ລະເມີດລິຂະສິດຂອງຕົນ

ເອກະສານທີ່ເປີດເຜີຍໄດ້ອ້າງອີງເຖິງນັກຄົ້ນຄວ້າຂອງ OpenAI ໃນປີ 2019: ຄວາມກັງວົນຂອງລາວກ່ຽວກັບການຝຶກອົບຮົມຢູ່ໃນເວັບໄຊປຶ້ມທີ່ລະເມີດລິຂະສິດແມ່ນ "ຮູບລັກສະນະ" ຢູ່ໃນ Hacker News. OpenAI ຮູ້ຫຍັງ, ໃຜບອກ Bill Gates

5:01 ↗
daily · lo · 16 ກ.ຍ. 2026

ຫົວໜ້າ AI ຂອງ Microsoft ຫາກໍເອີ້ນລັດຖະທຳມະນູນຂອງ Claude ວ່າເປັນອັນຕະລາຍ.

Mustafa Suleyman, CEO ຂອງ Microsoft AI, ໄດ້ພິມເຜີຍແຜ່ບົດຄວາມຍາວ 3,000 ຄໍາ ໂດຍໂຕ້ຖຽງວ່າລັດຖະທໍາມະນູນ Claude ຂອງ Anthropic ໄດ້ຝຶກຝົນຮູບແບບເພື່ອຄິດວ່າມັນ "ອາດຈະມີສະຕິ" ແລະ ສົມຄວນໄດ້ຮັບ "ສະຫວັດດີການຂອງຮູບ

5:19 ↗