ວິທີກວດຫາ Claude ທີ່ອ່ອນແອລົງ (ດ້ວຍຂໍ້ມູນຈິງ)
ຄົນເວົ້າວ່າ Claude ໂງ່ລົງສອງສາມອາທິດຫຼັງຈາກເປີດຕົວແຕ່ລະຄັ້ງ.
ຄົນເວົ້າວ່າ Claude ໂງ່ລົງສອງສາມອາທິດຫຼັງຈາກເປີດຕົວແຕ່ລະຄັ້ງ. ຜູ້ພັດທະນາຄົນໜຶ່ງໄດ້ຕັ້ງ Claude Opus 5.5 ໃສ່ໂມງ 30 ວັນນັບຈາກອາທິດເປີດຕົວ, ດ້ວຍຄຳຖາມທີ່ຖືກກຳນົດໄວ້, ລະຫັດ Claude ທີ່ຖືກປັກໝຸດ ແລະ ກົດລະບຽບສາທາລະນະ, ແລະ ມັນສະແດງໃຫ້ເຫັນວ່າເປັນຫຍັງບໍ່ມີໃຜຮູ້ມາກ່ອນ, ແລະ ເປັນຫຍັງຈຳນວນ token ຂອງເຈົ້າຈຶ່ງເປັນສິ່ງທີ່ຕ້ອງເຝົ້າເບິ່ງ. ຄຳຕັດສິນ: SHIP IT.
ອ່ານສະບັບລາຍລັກອັກສອນ (ພາສາອັງກິດ) ↗
ສິ່ງທີ່ວິດີໂອນີ້ກວມເອົາ
- Claude ໂງ່ລົງຫຼັງຈາກເປີດຕົວ: ທິດສະດີພົບກັບໂມງມື້ສູນ
- livenerf: ໂມງ 30 ວັນໃນ Opus 5.5 ນັບຕັ້ງແຕ່ອາທິດເປີດຕົວ
- ວິທີຈັບຄວາມອ່ອນແອລົງ: 78 ຄໍາຖາມທີ່ບາງຄັ້ງຖືກຕ້ອງ
- ສິ່ງທີ່ມັນສາມາດເຫັນໄດ້: 7.5 ຄະແນນ, ແລະ ຈຳນວນ token ເຄື່ອນຍ້າຍກ່ອນ
- ຈຸດບອດ: ການແລກປ່ຽນ Opus 5 ແລະ 8 ຄີຄຳຕອບທີ່ຜິດ
ບົດບັນທຶກທີ່ແປແລ້ວ
ແປຈາກຄຳບັນຍາຍຕົ້ນສະບັບພາສາອັງກິດ. ສຽງ ແລະ ຄຳບັນຍາຍທີ່ມີໃຫ້ແມ່ນຄວບຄຸມໂດຍ YouTube.
Claude ໂງ່ລົງຫຼັງຈາກເປີດຕົວ: ທິດສະດີພົບກັບໂມງມື້ສູນ
0:00 ທຸກຄົນຮູ້ວ່າ Claude ໂງ່ລົງສອງສາມອາທິດຫຼັງຈາກເປີດຕົວ. ດັ່ງນັ້ນ, ນັກພັດທະນາຄົນໜຶ່ງໄດ້ຕັ້ງ Opus ຫ້າຈຸດຫ້າໃສ່ໂມງຕັ້ງແຕ່ອາທິດເປີດຕົວ, ແລະໂມງບອກວ່າບໍ່ມີໃຜຮູ້ເທື່ອ. ໃນວິດີໂອນີ້, ສາມຄຳຖາມ. ເຈົ້າຈະຈັບຄວາມອ່ອນແອລົງໄດ້ແນວໃດ? ເຄື່ອງວັດແທກນີ້ສາມາດເຫັນຫຍັງໄດ້? ແລະ Anthropic ເວົ້າວ່າແນວໃດ? ແລະໜຶ່ງປະໂຫຍກໃນເຄຣດິດຂອງ repo ເຮັດໃຫ້ຂ້ອຍຫົວຂວັນອອກມາ.
0:20 ຂ້ອຍຈະເວົ້າເຖິງມັນໃນຕອນທ້າຍ. ມັນແມ່ນວັນພຸດ, ວັນທີ 30 ກັນຍາ, ແລະນີ້ແມ່ນ The Daily Diff. ສາມເລື່ອງໃນມື້ນີ້, ແລະເລື່ອງໃຫຍ່ແມ່ນ GitHub repo ທີ່ເອີ້ນວ່າ live nerf.
livenerf: ໂມງ 30 ວັນໃນ Opus 5.5 ນັບຕັ້ງແຕ່ອາທິດເປີດຕົວ
0:30 ເປັນເວລາຫຼາຍເດືອນ, ຄົນໄດ້ເວົ້າວ່າ Anthropic ຫຼຸດຄຸນນະພາບຕົວແບບຂອງພວກເຂົາຢ່າງງຽບໆຫຼັງຈາກເປີດຕົວ. ທິດສະດີປົກກະຕິແມ່ນຕົວແບບທີ່ຖືກບີບອັດ, ຕົວແບບນ້ອຍລົງພາຍໃຕ້ຊື່ດຽວກັນ ຫຼືພຽງແຕ່ຄິດໜ້ອຍລົງ. repo ເອີ້ນທຸກຂໍ້ໂຕ້ແຍ້ງທີ່ຜ່ານມາວ່າ vibes ຕໍ່ vibes. Opus ຫ້າຈຸດຫ້າໄດ້ຖືກຈັດສົ່ງໃນວັນທີ 22 ກັນຍາ, ແລະໜຶ່ງອາທິດກ່ອນຂ້ອຍບອກເຈົ້າວ່າມັນໄດ້ຂຶ້ນອັນດັບສູງສຸດຂອງກະດານເອກະລາດໃນຂະນະທີ່ຂຽນສາມ ເທື່ອຂອງຄຳສັບຫຼາຍກວ່າຕົວແບບສະເລ່ຍ. ສອງມື້ເຄິ່ງຜ່ານໄປ, ນັກພັດທະນາຊື່ ninja hawk ໄດ້ເລີ່ມໂມງ,
0:59 ມື້ລະຄັ້ງເປັນເວລາສາມສິບມື້, ດ້ວຍບັນທຶກທີ່ບໍ່ມີໃຜສາມາດແກ້ໄຂໄດ້. ກະທູ້ Hacker News ໄດ້ຮັບເກືອບແປດຮ້ອຍຄະແນນ ແລະ ແຍກອອກຄືກັບການສົນທະນາເປັນທີມ. ຜູ້ໃຫ້ຄຳເຫັນຄົນໜຶ່ງເວົ້າວ່າການຫຼຸດຄຸນນະພາບຕົວແບບບໍ່ແມ່ນຄວາມຈິງໃນກໍລະນີສ່ວນໃຫຍ່ຂອງ ກໍລະນີທີ່ຖືກລາຍງານ. ອີກຄົນໜຶ່ງເວົ້າວ່າຄົນພຽງແຕ່ຄຸ້ນເຄີຍກັບລະດັບໃໝ່ຂອງ ຄວາມສະຫຼາດ. ແລະຜູ້ໃຊ້ Claude Code ທີ່ມີປະສິດທິພາບຄົນໜຶ່ງຕອນນີ້ປະຕິເສດປັອບອັບການໃຫ້ຄະແນນເຊດຊັນນີ້ ທຸກຄັ້ງ, ເພາະວ່າການໃຫ້ຄະແນນ Claude ເບິ່ງຄືວ່າເຮັດໃຫ້ມັນຮ້າຍແຮງຂຶ້ນ. ການທົບທວນຄືນໂດຍເພື່ອນຮ່ວມງານ. ດັ່ງນັ້ນ, ຄຳຖາມທີໜຶ່ງ, ເຈົ້າຈະຈັບຄວາມອ່ອນແອລົງໄດ້ແນວໃດ?
ວິທີຈັບຄວາມອ່ອນແອລົງ: 78 ຄໍາຖາມທີ່ບາງຄັ້ງຖືກຕ້ອງ
1:27 ເຈົ້າເລີ່ມຕົ້ນດ້ວຍປະມານສອງພັນສາມຮ້ອຍຄຳຖາມສອບເສັງທີ່ຍາກ, ແລະ Opus ໄດ້ 93 ເປີເຊັນຖືກຕ້ອງໃນການລອງຄັ້ງທຳອິດ, ເຊິ່ງບໍ່ມີປະໂຫຍດສຳລັບເຄື່ອງກວດຈັບ, ເນື່ອງຈາກຄຳຖາມທີ່ມັນຖືກຕ້ອງສະເໝີບໍ່ສາມາດ ຫຼຸດລົງໄດ້. 97 ເປີເຊັນແມ່ນຖືກຕ້ອງສະເໝີ ຫຼືຜິດສະເໝີ, ແລະ 78 ຄຳຖາມທີ່ມັນຖືກຕ້ອງບາງຄັ້ງເທົ່ານັ້ນໄດ້ກາຍເປັນຄະນະ. Prompt ດຽວກັນ, ບໍ່ມີເຄື່ອງມື, ແລະການໃຫ້ຄະແນນທີ່ກົງກັນຢ່າງຖືກຕ້ອງໂດຍບໍ່ມີ AI ຕັດສິນ, ເພາະວ່າຜູ້ຕັດສິນກໍ່ຈະຄາດເຄື່ອນເຊັ່ນກັນ. ມັນເຮັດວຽກໃນການສະໝັກ Max ຜ່ານ headless Claude Code,
1:55 ເນື່ອງຈາກເວີຊັນ API ມີລາຄາປະມານໜຶ່ງພັນຫົກຮ້ອຍໂດລາຕໍ່ເດືອນ. ແລະເວີຊັນ Claude Code ຖືກປັກໝຸດ, ເພາະວ່າ, ໃນຄຳເວົ້າຂອງ repo, ເຄື່ອງມືທີ່ປ່ຽນແປງເບິ່ງຄືກັນກັບຕົວແບບທີ່ປ່ຽນແປງ. ສະຖິຕິມາຈາກເອກະສານທີ່ຊື່ວ່າ Adding Error Bars to Evals, ໂດຍ Evan Miller ທີ່ Anthropic. ດັ່ງນັ້ນ, ຄະນິດສາດຂອງ Anthropic ເອງກຳລັງກວດສອບ Anthropic, ເຊິ່ງແມ່ນເວີຊັນທາງວິຊາການ ຂອງການອ້າງອິງເງື່ອນໄຂການບໍລິການຄືນໃສ່ການຊ່ວຍເຫຼືອລູກຄ້າ.
ສິ່ງທີ່ມັນສາມາດເຫັນໄດ້: 7.5 ຄະແນນ, ແລະ ຈຳນວນ token ເຄື່ອນຍ້າຍກ່ອນ
2:19 ຄຳຖາມທີສອງ, ມັນສາມາດເຫັນຫຍັງໄດ້? ຕໍ່ປ່ອງຢ້ຽມສິບມື້, ຫຼຸດລົງປະມານເຈັດຈຸດຫ້າຄະແນນ. ເພື່ອພິສູດວ່າລະບົບເຮັດວຽກ, ຜູ້ຂຽນໄດ້ຫຼຸດຄວາມພະຍາຍາມຂອງ Claude ລົງໂດຍເຈດຕະນາ. ຄວາມພະຍາຍາມປານກາງຕັດຜົນຜະລິດລົງປະມານໜຶ່ງສ່ວນສີ່, ແລະຄະແນນພຽງແຕ່ສີ່ ຄະແນນ. ຄວາມພະຍາຍາມຕໍ່າຕັດຜົນຜະລິດລົງເກືອບສອງສ່ວນສາມ, ສຳລັບແປດຄະແນນ. ນັ້ນຄືສ່ວນທີ່ຈະລັກ. ການຄິດໜ້ອຍລົງປາກົດຢູ່ໃນຈຳນວນ token ກ່ອນທີ່ມັນຈະປາກົດຢູ່ໃນຄຳຕອບ.
2:43 ດັ່ງນັ້ນ, ປັກໝຸດເວີຊັນຕົວແບບຂອງເຈົ້າ, ບັນທຶກ output tokens ຕໍ່ໜ້າວຽກ, ແລະເກັບຄຳຖາມທີ່ຖືກກຳນົດໄວ້ຈຳນວນໜຶ່ງຂອງເຈົ້າເອງ. ຖ້າຕົວແທນຂອງເຈົ້າຂຽນສັ້ນລົງຢ່າງກະທັນຫັນ, ກວດເບິ່ງບັນທຶກຂອງເຈົ້າກ່ອນທີ່ຈະກວດເບິ່ງ Reddit. ແລະນີ້ແມ່ນສ່ວນທີ່ຊື່ສັດ.
ຈຸດບອດ: ການແລກປ່ຽນ Opus 5 ແລະ 8 ຄີຄຳຕອບທີ່ຜິດ
2:54 ການແລກປ່ຽນ Opus ຫ້າທີ່ເກົ່າກວ່າຢ່າງງຽບໆແມ່ນການປ່ຽນແປງທີ່ນ້ອຍເກີນໄປສຳລັບລະບົບທີ່ຈະ ເອີ້ນ, ແລະ readme ບອກໄວ້ແຕ່ຕົ້ນ. ການກວດສອບຍັງພົບແປດຄີຄຳຕອບທີ່ເບິ່ງຄືວ່າຜິດ, ດັ່ງນັ້ນ, ເຄື່ອງກວດຈັບຄວາມອ່ອນແອລົງໄດ້ພົບບັກໃນ benchmark ກ່ອນທີ່ມັນຈະພົບຄວາມອ່ອນແອລົງ.
Anthropic: ພວກເຮົາບໍ່ເຄີຍຫຼຸດຄຸນນະພາບຕົວແບບ
3:08 ຄຳຖາມທີສາມ, Anthropic ເວົ້າວ່າແນວໃດ? ປີກາຍນີ້, ຫຼັງຈາກມີຄຳຮ້ອງຮຽນຫຼາຍຄັ້ງ, Anthropic ໄດ້ເຜີຍແຜ່ບົດວິເຄາະຫຼັງເກີດເຫດ. ມັນເວົ້າວ່າ, ອ້າງອີງ, ພວກເຮົາບໍ່ເຄີຍຫຼຸດຄຸນນະພາບຕົວແບບເນື່ອງຈາກຄວາມຕ້ອງການ, ເວລາຂອງມື້ ຫຼື ພາລະຂອງເຊີບເວີ. ໂພສດຽວກັນຍອມຮັບວ່າສາມບັກໄດ້ເຮັດໃຫ້ Claude ເສຍຫາຍ, ແລະເກືອບໜຶ່ງສ່ວນສາມຂອງ ຜູ້ໃຊ້ Claude Code ໄດ້ເຂົ້າເຖິງເຊີບເວີທີ່ຜິດຢ່າງໜ້ອຍໜຶ່ງຄັ້ງ. ດັ່ງນັ້ນ, ຄຳຮ້ອງຮຽນແມ່ນຄວາມຈິງ ແລະສາເຫດແມ່ນບັກ, ເຊິ່ງເປັນເຫດຜົນທີ່ repo ເຕືອນວ່າອາທິດເປີດຕົວອາດຈະເປັນອາທິດທີ່ຮ້າຍແຮງທີ່ສຸດ.
3:35 ຫົກໃນສາມສິບມື້ແມ່ນຢູ່ໃນ. ການໂທທີ່ເປັນໄປໄດ້ຄັ້ງທຳອິດຈະມາຮອດປະມານວັນທີ 24 ຕຸລາ, ດັ່ງນັ້ນ, ຄຳຕອບທີ່ຊື່ສັດຄືບໍ່ມີໃຜຮູ້, ລວມທັງທຸກຄົນທີ່ໝັ້ນໃຈ. ເວົ້າເຖິງຕົວເລກທີ່ບໍ່ມີໃຜເຜີຍແຜ່.
ສູນຂໍ້ມູນເກັບກຳຕົວເລກຂອງພວກເຂົາເປັນຄວາມລັບ; Backblaze ເຜີຍແຜ່
3:46 Lighthouse Reports ແລະໜັງສືພິມໂຮນລັງ Trouw ພົບວ່າສູນຂໍ້ມູນສ່ວນໃຫຍ່ຂອງ ເອີຣົບເກັບຮັກສາການໃຊ້ພະລັງງານແລະນ້ຳຂອງພວກເຂົາເປັນຄວາມລັບ, ເຖິງແມ່ນວ່າກົດລະບຽບ EU ໄດ້ຮຽກຮ້ອງໃຫ້ລາຍງານເປັນເວລາສາມປີແລ້ວ. ໃນເນເທີແລນ, ມີໜ້ອຍກວ່າໜຶ່ງສ່ວນສີ່ເຜີຍແຜ່. ສູນຂໍ້ມູນ Microsoft ແຫ່ງດຽວໃຊ້ປະມານໜຶ່ງເປີເຊັນຂອງໄຟຟ້າໂຮນລັງ. ໃນຂະນະດຽວກັນ, Backblaze ໄດ້ເຮັດສິ່ງທີ່ໜ້າເບື່ອອີກຄັ້ງ. ສະຖິຕິໄດຣຟ໌ລາຍໄຕມາດຂອງມັນຄອບຄຸມຮາດດິດປະມານສາມແສນຫ້າສິບພັນໜ່ວຍ, ແລະອັດຕາຄວາມລົ້ມເຫຼວເພີ່ມຂຶ້ນເປັນ 1.73 ເປີເຊັນ,
4:16 ສູງທີ່ສຸດໃນໄລຍະໜຶ່ງ. ສາມຕົວແບບ Seagate ບໍ່ມີຄວາມລົ້ມເຫຼວ. ນັ້ນຄືສິ່ງທີ່ເສັ້ນພື້ນຖານສາທາລະນະເບິ່ງຄື, ໄຕມາດແລ້ວໄຕມາດ, ເປັນເວລາສິບສາມປີ.
ສາຍເຄຣດິດ: Claude ຊ່ວຍສ້າງເຄື່ອງວັດແທກ
4:25 ຕອນນີ້, ສາຍເຄຣດິດນັ້ນ. readme ຍອມຮັບວ່າຫຼາຍສ່ວນຂອງ repo ໄດ້ຖືກຂຽນດ້ວຍການຊ່ວຍເຫຼືອຂອງ Claude, ເຊິ່ງແມ່ນຕົວແບບທີ່ກຳລັງວັດແທກ. ດັ່ງນັ້ນ, Claude ຊ່ວຍສ້າງເຄື່ອງວັດແທກທີ່ກວດສອບວ່າ Claude ໂງ່ລົງຫຼືບໍ່. ນັ້ນຄືເຫດຜົນທີ່ຜູ້ໃຫ້ຄະແນນແມ່ນຟັງຊັນທຳມະດາ. ໃນຄຳເວົ້າຂອງຜູ້ຂຽນ, ເຈົ້າບໍ່ຄວນຈະຕ້ອງໄວ້ວາງໃຈຜູ້ຂຽນ, ບໍ່ວ່າຈະເປັນມະນຸດ ຫຼື ອື່ນໆ. ຖ້າເຈົ້າຢາກອ່ານເລື່ອງນີ້ແທນທີ່ຈະຟັງຂ້ອຍເວົ້າ, diff ຈະມາຮອດ inbox ຂອງເຈົ້າ
4:46 ທຸກໆເຊົ້າ, ຟຣີທີ່ the daily diff dot dev, ລິ້ງຂ້າງລຸ່ມ. ດັ່ງນັ້ນ, ຄຳຕັດສິນຂອງມື້ນີ້ກ່ຽວກັບ live nerf.
ຄຳຕັດສິນ: SHIP IT, ແລະ ຢ່າອ້າງອິງກ່ອນວັນທີ 24 ຕຸລາ
4:51 SHIP IT. ຂ້ອຍຈະຈັດສົ່ງມັນເພາະວ່າມັນເປັນຂໍ້ໂຕ້ແຍ້ງການຫຼຸດຄຸນນະພາບຄັ້ງທຳອິດທີ່ຂ້ອຍເຄີຍເຫັນກັບ ເຄື່ອງໝາຍເວລາ, ປຶ້ມກົດລະບຽບສາທາລະນະ ແລະ ຈຸດບອດທີ່ລະບຸໄວ້. ພຽງແຕ່ຢ່າອ້າງອິງມັນກ່ອນວັນທີ 24 ຕຸລາ. ແລະນັ້ນຄື diff ສໍາລັບມື້ນີ້. ຂ້ອຍ Niko ຈາກ Axrisi. ຮວມເຂົ້າກັນຢ່າງຮັບຜິດຊອບ.
ແຫຼ່ງຂໍ້ມູນ
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



