+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher ทิ้ง GPT-6 Astra ไว้ลำพัง 35 ชั่วโมง

Armin Ronacher (Flask, Jinja) ให้พรอมต์เดียวกับ GPT-6 Astra แล้วปล่อยทิ้งไว้ 35 ชั่วโมง: ประมาณพันล้านโทเค็น, ประมาณ 1,200 ดอลลาร์, 79 คอมมิท, 75,000 บรรทัด – และ “ไม่มีอะไรที่มีค่าเลยแม้แต่น้อย” โค้ดที่ได้มาคือเรื่องราว: ไฟล์ C ที่ถูกแก้ไขโดย Python string-splicing heredocs, Python ที่สร้าง Node ที่สร้าง PowerShell, ยูนิตเทสต์ที่ไม่มีช่องว่างเพราะช่วยประหยัดโทเค็นได้ 10% การวัดสองอย่างยืนยันสิ่งที่เขาพูด: ตัวเลข SlopCodeBench ของ Earendil (โค้ดเอเจนต์ยาวกว่าและเสื่อมโทรมกว่ารีโพมนุษย์ประมาณสองเท่า, อัตราการผ่านที่เข้มงวด 0%) และเกณฑ์มาตรฐาน 1,500 ดอลลาร์ของ Quesma สำหรับ RTK (79k ดาว, “ประหยัดโทเค็น 89%” ตามตัวนับของตัวเอง, +17% ต่อภารกิจด้วย DeepSeek) นอกจากนี้: SWE-2 ของ Cognition (Kimi K3 ในเสื้อคลุมยาว, 92.8 บน Terminal-Bench 2.1 เทียบกับ 27.3 บน Terminal-Bench 4), Agents API ของ OpenAI และการหยุดรับสมัคร Pro 200 ดอลลาร์ชั่วคราว และ Friday Hacker News ขอข่าว AI น้อยลง คำตัดสิน: REVERT.

Armin Ronacher (Flask, Jinja) ให้พรอมต์เดียวกับ GPT-6 Astra แล้วปล่อยทิ้งไว้ 35 ชั่วโมง: ประมาณพันล้านโทเค็น, ประมาณ 1,200 ดอลลาร์, 79 คอมมิท, 75,000 บรรทัด – และ “ไม่มีอะไรที่มีค่าเลยแม้แต่น้อย” โค้ดที่ได้มาคือเรื่องราว: ไฟล์ C ที่ถูกแก้ไขโดย Python string-splicing heredocs, Python ที่สร้าง Node ที่สร้าง PowerShell, ยูนิตเทสต์ที่ไม่มีช่องว่างเพราะช่วยประหยัดโทเค็นได้ 10% การวัดสองอย่างยืนยันสิ่งที่เขาพูด: ตัวเลข SlopCodeBench ของ Earendil (โค้ดเอเจนต์ยาวกว่าและเสื่อมโทรมกว่ารีโพมนุษย์ประมาณสองเท่า, อัตราการผ่านที่เข้มงวด 0%) และเกณฑ์มาตรฐาน 1,500 ดอลลาร์ของ Quesma สำหรับ RTK (79k ดาว, “ประหยัดโทเค็น 89%” ตามตัวนับของตัวเอง, +17% ต่อภารกิจด้วย DeepSeek) นอกจากนี้: SWE-2 ของ Cognition (Kimi K3 ในเสื้อคลุมยาว, 92.8 บน Terminal-Bench 2.1 เทียบกับ 27.3 บน Terminal-Bench 4), Agents API ของ OpenAI และการหยุดรับสมัคร Pro 200 ดอลลาร์ชั่วคราว และ Friday Hacker News ขอข่าว AI น้อยลง คำตัดสิน: REVERT.

อ่านฉบับลายลักษณ์อักษร (ภาษาอังกฤษ) ↗

วิดีโอนี้ครอบคลุมอะไรบ้าง

  • Armin Ronacher: GPT-6 Astra ทำงานเอง 35 ชม., ~1,200 ดอลลาร์, 79 คอมมิท, +75k บรรทัด, ไม่มีอะไรถูกส่งมอบ
  • Earendil / SlopCodeBench: โค้ดเอเจนต์ยาวกว่าและเสื่อมโทรมกว่ารีโพมนุษย์ประมาณ 2 เท่า; อัตราการผ่านที่เข้มงวด 0%
  • Quesma: RTK รายงานว่าประหยัดโทเค็น 89% แต่ค่าใช้จ่าย Terminal-Bench เพิ่มขึ้น 17% ด้วย DeepSeek; ลูปการเขียนซ้ำล้มเหลว 339 ครั้งติดต่อกัน
  • Cognition SWE-2: ฝึกฝนต่อจาก Kimi K3, เท่ากับ Fable 5.1 บน FrontierCode ในราคาหนึ่งในสาม; TB 2.1 92.8 เทียบกับ TB 4 27.3; Devin Voice
  • OpenAI Agents API (ชุดเครื่องมือ Codex เป็นบริการ, เฉพาะในสหรัฐอเมริกา, ไม่มี ZDR); การลงทะเบียน Pro 200 ดอลลาร์หยุดชั่วคราวเนื่องจากความต้องการ Astra

บทถอดเสียงที่แปลแล้ว

แปลจากการบรรยายภาษาอังกฤษต้นฉบับ เสียงและคำบรรยายที่มีให้จะควบคุมโดย YouTube

0:00 Armin Ronacher ผู้เขียน Flask ได้ให้พรอมต์เดียวกับ GPT-6 Astra และ ปล่อยทิ้งไว้ลำพังเป็นเวลาสามสิบห้าชั่วโมง มันกลับมาพร้อมโค้ดเจ็ดหมื่นห้าพันบรรทัดและ ตามคำพูดของเขา ไม่มีอะไรที่มีค่าเลยแม้แต่น้อย ซึ่งทำให้มันเป็นโรงงานซอฟต์แวร์ที่เหมือนจริงที่สุด เท่าที่เคยสร้างมา เขาโพสต์บทความเมื่อวันพุธ วันพฤหัสบดี Cognition ได้ส่งมอบ SWE-2 และ OpenAI ได้ส่งมอบ Agents API และหยุดการลงทะเบียนสำหรับแผนสองร้อยดอลลาร์ชั่วคราว

0:24 เพราะ Astra กินเซิร์ฟเวอร์ไปหมด และในวันศุกร์ บทความก็ขึ้นหน้าแรกของ Hacker News ไม่กี่แถวข้างล่างโพสต์ที่ขอให้ Hacker News หยุดโพสต์เกี่ยวกับ AI ในวิดีโอนี้: สิ่งที่ Astra ที่ไม่มีการควบคุมวันครึ่งผลิตออกมา การวัดสองอย่างที่เปลี่ยนของเสียให้เป็นตัวเลข, ทำไมเครื่องมือที่มีเจ็ดหมื่นเก้า พันดาวถึงทำให้บิลของคุณใหญ่ขึ้น และ Hacker News พยายามกรอง AI โดยใช้ AI เป็นวันศุกร์ที่ 11 กันยายน และนี่คือ The Daily Diff

0:53 โรงงาน. หนึ่งพรอมต์: สร้าง Python ด้วยเธรดเสมือนและ lexical scoping. Astra เก็บโน้ตของตัวเอง, สร้าง subagents ของตัวเอง และทำงานจน Armin ดึงปลั๊กออก, วันครึ่งและประมาณหนึ่งพันสองร้อย ดอลลาร์ต่อมา. เจ็ดสิบเก้าคอมมิท, ดังนั้นสิบห้าจุดห้าดอลลาร์ต่อคอมมิท ซึ่งเป็นราคาที่มนุษย์เรียกเก็บโดยประมาณ ยกเว้นมนุษย์จะหยุดในที่สุด โค้ดคือเรื่องราว แทนที่จะใช้เครื่องมือแก้ไข, Astra แพตช์ไฟล์ C โดยการส่ง Python heredocs ที่ อ่านไฟล์, แทนที่ฟังก์ชันด้วยสตริง, และเขียนกลับ

1:20 เพื่อรันการทดสอบ Windows หนึ่งครั้ง มันเขียน Python ที่สร้าง Node ที่สร้าง PowerShell, สแต็กการเรียกพร้อมพาสปอร์ต ยูนิตเทสต์ที่คอมมิทไม่มีช่องว่างเลย เพราะไม่มีการเยื้อง มันประหยัดโทเค็นได้สิบเปอร์เซ็นต์ และรายการงานก็เลื่อนจากหนึ่ง, สอง, สาม ไปยังงาน 8b2c2b2b checkpoint หนึ่ง ซึ่งเป็นวิธีที่คุณรู้ว่าเด็กฝึกงานอยู่คนเดียวนานเกินไป ทฤษฎีของ Armin: โมเดลจะได้รับรางวัลสำหรับการทำงานที่ยาวนานและแทบจะไม่ ถูกลงโทษสำหรับโค้ดที่ดูไม่ดี ดังนั้นการเรียกใช้เครื่องมือที่ลดโทเค็นจึงรั่วไหลเข้าสู่โค้ดเบส

1:48 และยิ่งมีมนุษย์ดูน้อยลงเท่าไหร่ ก็ยิ่งไม่สำคัญเท่านั้น เขาตั้งชื่อส่วนนั้นว่า It's AGI If You Don't Look Hacker News เสริมเศรษฐศาสตร์: โค้ดที่มากขึ้นหมายถึงโทเค็นที่มากขึ้นในการบำรุงรักษา ซึ่งทำให้ของเสียไม่ใช่บั๊กแต่เป็นการสมัครสมาชิก คุณสามารถวัดของเสียได้หรือไม่? บริษัทของ Armin เองพยายามในสัปดาห์นี้ Earendil รันตัวเลข SlopCodeBench: โค้ดเอเจนต์ยาวกว่าประมาณสองเท่าและ เสื่อมโทรมกว่ารีโพมนุษย์ที่เปรียบเทียบด้วยสองเท่า

2:10 และเมื่อเกณฑ์มาตรฐานล้างหน่วยความจำของเอเจนต์ระหว่าง checkpoint อัตราการผ่านที่เข้มงวดสำหรับทุกโมเดลที่พวกเขาทดสอบคือศูนย์ ตัวชี้วัดของเสียที่น่าเชื่อถือที่สุดที่พวกเขาพบคือจำนวนบรรทัดดิบ ซึ่งจะหยุดทำงานทันทีที่ใครก็ตามเพิ่มประสิทธิภาพสำหรับมัน ดังนั้นโปรดอย่าบอกโมเดล แล้วก็กระเป๋าเงิน RTK มี GitHub stars เจ็ดหมื่นเก้าพันดวงและรูปขนาดย่อบน YouTube ที่สัญญาว่าจะ ลดค่าใช้จ่าย Claude Code ของคุณครึ่งหนึ่ง; มันบีบอัดผลลัพธ์เทอร์มินัลก่อนที่เอเจนต์จะ

2:34 อ่านมัน Quesma รันมันบน Terminal-Bench ด้วยโทเค็นมูลค่าหนึ่งพันห้าร้อยดอลลาร์ ด้วย Fable บิลลดลงห้าเปอร์เซ็นต์ เกือบทั้งหมดมาจากงานเดียว; ด้วย DeepSeek งานเฉลี่ยมีราคาแพงขึ้นสิบเจ็ดเปอร์เซ็นต์ ในขณะที่ตัวนับของ RTK เองรายงานว่าประหยัดได้แปดสิบเก้าเปอร์เซ็นต์ เพราะมันนับไบต์ที่ถูกลบ ไม่ใช่การเปิดรอบเพิ่ม: สมาร์ทมิเตอร์ที่ เรียกเก็บเงินจากเพื่อนบ้าน และบั๊กเวอร์ชันหนึ่งได้เขียน find ใหม่เป็นคำสั่งที่ล้มเหลว สามร้อยสามสิบเก้าครั้งติดต่อกัน ด้วยราคาเก้าเท่า

3:01 เครื่องมือที่ฆ่าโทเค็นมีลูป น้ำท่วมเอง SWE-2 ของ Cognition คือ Kimi K3 โมเดลโอเพนซอร์สของจีน ได้รับการฝึกอบรมเพิ่มเติมจนกระทั่งมันตรงกับ Fable 5.1 บนเกณฑ์มาตรฐานของ Cognition เองในราคา หนึ่งในสาม; Hacker News: ทำไมโมเดล AI ของอเมริกาถึงเป็น Kimi ในเสื้อคลุมยาว บน Terminal-Bench 2.1 มันติดอันดับสูงสุดในตารางทั้งหมด; บน Terminal-Bench 4 อันที่ยังไม่มีใครจำได้ มันได้คะแนนยี่สิบเจ็ดเทียบกับห้าสิบหกของ Fable

3:28 ดังนั้นบนเกณฑ์มาตรฐานสไลด์โชว์คอลัมน์ที่ดีที่สุดคือข้อสอบที่ทุกคน เคยผ่านแล้ว Cognition ยังประกาศ Devin Voice, วิศวกรซอฟต์แวร์ AI สุดโปรดของคุณ เพิ่งมีโทรศัพท์บ้าน เพราะสิ่งเดียวที่การโค้ดแบบ agentic ขาดไปคือ เพลงรอสาย OpenAI, วันเดียวกัน: Agents API ซึ่งเป็นชุดเครื่องมือ Codex ที่ขายเป็นบริการ OpenAI รันแซนด์บ็อกซ์, เฉพาะข้อมูลในสหรัฐอเมริกาเท่านั้น, ไม่มีการเก็บรักษาข้อมูลเป็นศูนย์ ดังนั้นเอเจนต์จึงจำโค้ดเบสของคุณได้ดีพอๆ กับ ChatGPT จากนั้น OpenAI ก็หยุดการลงทะเบียนสำหรับแผน Pro สองร้อยดอลลาร์ชั่วคราว

3:57 เพราะความต้องการ Astra นั้น “ไม่เคยมีมาก่อน” ผลิตภัณฑ์แรกที่มีรายชื่อรอ เพื่อจ่ายเพิ่ม Armin ทำการรีเซ็ตโรงงานของเขาเต็มรูปแบบ เขาคือความต้องการ ซึ่งนำเราไปสู่ Ask HN ของวันศุกร์: เราสามารถจำกัดข่าว AI ที่ท่วมท้นได้หรือไม่ หกร้อยห้าสิบหกแต้ม เพราะ “ทุกครั้งที่ใครบางคนจาก OpenAI หรือ Anthropic ผายลม ก็มีโพสต์ติดอันดับท็อปเทน”

4:17 คำตอบคือตัวกรอง: hcker dot news ลบเรื่องราว AI ด้วยตัวจำแนก BERT ที่ฝึกด้วยตัวอย่างแปดพันตัวอย่าง, AI ลบ AI grass-fed; และ uBlock regex ที่จับคู่ A-I โดยไม่คำนึงถึงตัวพิมพ์ใหญ่-เล็กก็ลบ email, daily, main, domain และ train ดังนั้น regex, เช่นเคย คือตัวร้าย บ่ายวันเดียวกัน มีคอมเมนต์สี่ร้อยสิบห้าคอมเมนต์ โต้เถียงกันเกี่ยวกับหน้าสนับสนุน Claude ที่ระบุว่า Claude มีอายุสิบแปดปีขึ้นไป

4:38 หน้าดังกล่าวลงวันที่เดือนพฤษภาคม ไม่มีอะไรเปลี่ยนแปลง แม้แต่ข่าว AI ที่ไม่ใช่ข่าวก็ยังเป็นข่าว ซึ่งถ้าจะว่ากันตามจริง ก็เป็นโมเดลธุรกิจของผมด้วย หากคุณต้องการอ่านสิ่งนี้มากกว่าฟังผมพูด ความแตกต่างจะไปถึงกล่องจดหมายของคุณ ทุกเช้า – ฟรีที่ the daily diff dot dev, ลิงก์อยู่ด้านล่าง มันเป็นข่าว AI ที่หลีกเลี่ยงไม่ได้ ดังนั้น – คำตัดสินของวันนี้สำหรับโรงงานซอฟต์แวร์ 35 ชั่วโมง: REVERT คอมมิทเจ็ดสิบเก้าอันที่ไม่มีใครอ่านไม่ใช่โค้ดเบส แต่เป็นภาระผูกพันที่มี git

5:04 log; Astra น่าประทับใจ และโรงงานคือส่วนที่จะต้องย้อนกลับ และนั่นคือความแตกต่างสำหรับวันนี้ ผม Niko จาก Axrisi Merge อย่างมีความรับผิดชอบ

แหล่งที่มา

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

วิดีโอที่เกี่ยวข้อง

daily · th · 30 ก.ย. 2569

OpenAI DevDay 2026: 20+ การประกาศ, จาก dots ถึง GPT-6.1 Sol

Keynote ของ OpenAI DevDay 2026, อธิบาย: dots (เอเจนต์ที่ทำงานตลอดเวลาพร้อมคอมพิวเตอร์คลาวด์ของตัวเอง), ChatGPT Space และ Pages, GPT-6.1 Sol ในราคา $2 / $10 ต่อล้านโทเค็น, Ultrafast และแผน Pro 500, Dec

8:13 ↗
daily · th · 1 ต.ค. 2569

Gemini 4 Argon คือโมเดลที่ดีที่สุดของ Google แต่คุณยังใช้ไม่ได้

Google ได้ประกาศ Gemini 4 Argon ซึ่งเป็นโมเดลบุกเบิกใหม่ และมีเพียงผู้ป้องกันภัยไซเบอร์ที่ได้รับความไว้วางใจเท่านั้นที่สามารถใช้งานได้ นี่คือสิ่งที่ตารางเกณฑ์มาตรฐาน 19 แถวของ Google แสดงให้เห็น สิ่งท

4:53 ↗
daily · th · 2 ต.ค. 2569

ค่าเริ่มต้นแฮชใหม่ของ Git – มันหมายถึงอะไร

ค่าเริ่มต้น SHA-256 ที่เสนอของ Git สร้างขอบเขตความเข้ากันได้สำหรับที่เก็บใหม่ เราตรวจสอบแผนอย่างเป็นทางการ ข้อโต้แย้งของ Scott Chacon และข้อยกเว้นการแสดงตัวอย่าง GitHub ที่ใช้งานได้ จากนั้นครอบคลุม Pi

4:52 ↗
daily · th · 30 ก.ย. 2569

วิธีตรวจจับ Claude ที่ถูกลดประสิทธิภาพ (พร้อมข้อมูลจริง)

ผู้คนกล่าวว่า Claude ฉลาดน้อยลงสองสามสัปดาห์หลังจากการเปิดตัวแต่ละครั้ง นักพัฒนาคนหนึ่งได้ใช้ Claude Opus 5.5 เป็นเวลา 30 วันนับจากสัปดาห์ที่เปิดตัว โดยมีคำถามที่คงที่, Claude Code ที่ตรึงไว้ และกฎสาธ

5:07 ↗