# 아르민 로나허, GPT-6 아스트라를 35시간 동안 홀로 두다.

Published: 2026-09-12

아르민 로나허(Flask, Jinja)는 GPT-6 아스트라에 단 하나의 프롬프트를 주고 35시간 동안 내버려 두었습니다: 약 10억 토큰, 약 1,200달러, 79개의 커밋, 75,000줄 — 그리고 "아무런 가치도 없는 것"이었습니다. 복구된 코드는 C 파일을 Python 문자열-이어붙이기 heredoc으로 패치하고, Python이 Node를 스폰하고 Node가 PowerShell을 스폰하며, 토큰 비용이 10% 저렴하다는 이유로 공백이 제거된 단위 테스트로 가득했습니다. 두 가지 측정치가 그를 뒷받침합니다: Earendil의 SlopCodeBench 수치(에이전트 코드가 사람의 저장소보다 약 두 배 더 장황하고 침식되었으며, 엄격한 통과율 0%)와 Quesma의 RTK 벤치마크 1,500달러(79k 별, 자체 카운터에서 "89% 토큰 절약", DeepSeek 사용 시 작업당 +17%). 또한: Cognition의 SWE-2(트렌치코트를 입은 Kimi K3, Terminal-Bench 2.1에서 92.8점 vs Terminal-Bench 4에서 27.3점), OpenAI의 Agents API 및 중단된 200달러 Pro 가입, 그리고 금요일 Hacker News가 AI 뉴스 감소를 요청했습니다. 평결: REVERT.

Canonical: https://thedailydiff.dev/ko/video/2026-09-11-astra-slop-factory/

## 이 동영상에서 다루는 내용

- 아르민 로나허: 35시간 동안 방치된 GPT-6 아스트라, 약 1,200달러, 79개의 커밋, 75,000줄 이상, 배포된 것 없음
- Earendil / SlopCodeBench: 에이전트 코드는 사람의 저장소보다 약 2배 더 장황하고 침식됨; 엄격한 통과율 0%
- Quesma: RTK는 89% 토큰 절약을 보고하지만, DeepSeek 사용 시 Terminal-Bench 비용이 17% 증가; 재작성 루프가 339회 연속 실패함
- Cognition SWE-2: Kimi K3를 기반으로 후속 훈련되어 Fable 5.1과 FrontierCode에서 3분의 1 가격으로 일치; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API(서비스형 Codex 하니스, 미국 전용, ZDR 없음); Astra 수요로 인해 200달러 Pro 가입 중단

## 번역된 스크립트

원래 영어 내레이션에서 번역되었습니다. 사용 가능한 오디오 및 캡션은 YouTube에서 제어합니다.

0:00 Flask를 만든 아르민 로나허는 GPT-6 아스트라에게 단 하나의 프롬프트를 주었고 35시간 동안 홀로 두었습니다. 75,000줄의 코드를 가지고 돌아왔고, 그의 말에 따르면, "절대적으로 아무런 가치도 없는 것"이었습니다. 이것이 가장 현실적인 소프트웨어 공장을 만들었습니다. 그는 수요일에 보고서를 게시했습니다. 목요일에 Cognition은 SWE-2를 출시했고, OpenAI는 Agents API를 출시했으며 200달러짜리 플랜의 가입을 일시 중지했습니다.

0:24 아스트라가 서버를 다 잡아먹었기 때문입니다. 그리고 금요일에 그 보고서는 Hacker News의 첫 페이지에 도달했습니다. Hacker News에게 AI 관련 게시물을 그만 올려달라는 요청이 담긴 게시물 몇 줄 아래에 말이죠. 이 비디오에서: 감독되지 않은 아스트라가 하루 반 동안 무엇을 생산하는지, 슬로프(엉망)를 숫자로 바꾸는 두 가지 측정치, 79,000개의 별이 있는 도구가 왜 청구서를 더 늘리는지, 그리고 Hacker News가 어떻게 AI를 사용하여 AI를 필터링하려고 했는지. 9월 11일 금요일, The Daily Diff입니다.

0:53 공장. 하나의 프롬프트: 가상 스레드와 어휘적 범위 지정을 사용하여 Python을 빌드합니다. 아스트라는 자체 메모를 유지하고, 자체 서브 에이전트를 가동했으며, 아르민이 플러그를 뽑을 때까지, 즉 하루 반 동안 약 1,200달러를 사용하고 실행되었습니다. 79개의 커밋, 즉 커밋당 15.5달러로, 대략 사람이 청구하는 비용과 같지만, 사람은 결국 멈춥니다. 사람은 결국 멈춥니다. 코드가 이야기입니다. 편집 도구 대신 아스트라는 파일을 읽고, 함수를 문자열로 대체하여 삽입한 다음 다시 쓰는 Python heredoc을 파이프하여 C 파일을 패치합니다.

1:20 하나의 Windows 테스트를 실행하기 위해 Python이 Node를 스폰하고 Node가 PowerShell을 스폰하는 코드를 작성했습니다. 여권이 있는 호출 스택이었습니다. 커밋된 단위 테스트에는 공백이 전혀 없습니다. 들여쓰기가 없으면 토큰 비용이 10% 저렴하기 때문입니다. 그리고 작업 목록은 1, 2, 3에서 작업 8b2c2b2b 체크포인트 1로 표류했습니다. 인턴이 너무 오랫동안 혼자 있었다는 것을 알 수 있는 방법입니다. 아르민의 이론: 모델은 긴 작업을 완료한 것에 대해 보상을 받고 못생긴 코드에 대해서는 거의 처벌을 받지 않으므로, 토큰을 절약하는 도구 호출이 코드베이스로 새어 들어갑니다.

1:48 그리고 사람이 적게 볼수록 중요하지 않습니다. 그는 그 섹션을 "안 보면 AGI"라고 제목을 붙였습니다. Hacker News는 경제학을 추가했습니다: 더 많은 코드는 유지보수를 위한 더 많은 토큰을 의미하며, 이는 슬로프(엉망)를 버그가 아니라 구독으로 만듭니다. 슬로프(엉망)를 측정할 수 있을까요? 아르민의 회사도 이번 주에 시도했습니다. Earendil은 SlopCodeBench 수치를 실행했습니다: 에이전트 코드는 비교 대상인 사람의 저장소보다 약 두 배 더 장황하고 두 배 더 침식되었습니다.

2:10 그리고 벤치마크가 체크포인트 사이에 에이전트의 메모리를 지울 때, 테스트된 모든 모델의 엄격한 통과율은 0입니다. 그들이 찾은 가장 신뢰할 수 있는 슬로프(엉망) 측정 지표는 원시 줄 수였습니다. 이는 누군가 이를 최적화하는 순간 작동을 멈춥니다. 그러니 모델에게 말하지 마세요. 다음은 지갑입니다. RTK는 79,000개의 GitHub 별과 Claude Code 비용을 반으로 줄이겠다고 약속하는 YouTube 썸네일을 가지고 있습니다. 에이전트가 읽기 전에 터미널 출력을 압축합니다. Quesma는 1,500달러 상당의 토큰으로 Terminal-Bench에서 이를 실행했습니다.

2:34 1,500달러 상당의 토큰으로 Terminal-Bench에서 실행했습니다. Fable을 사용하면 비용이 5% 감소했지만, 거의 하나의 작업에서 발생했습니다; DeepSeek을 사용하면 평균 작업 비용이 17% 더 비싸졌습니다. 한편 RTK 자체 카운터는 89% 절약을 보고했습니다. 제거된 바이트를 계산했기 때문이지, 추가로 발생한 턴을 계산한 것이 아니기 때문입니다: 이웃에게 청구하는 스마트 미터. 이웃에게 청구하는 스마트 미터. 그리고 한 버전 버그로 인해 find 명령어가 실패하는 명령어로 재작성되었습니다. 9배 비싼 가격으로 339번 연속 실패했습니다.

3:01 토큰을 죽이는 도구에 루프가 있습니다. 홍수 그 자체입니다. Cognition의 SWE-2는 오픈소스 중국어 모델인 Kimi K3입니다. Cognition 자체 벤치마크에서 Fable 5.1과 3분의 1 가격으로 일치할 때까지 후속 훈련되었습니다. Hacker News: 왜 모든 미국 AI 모델이 기본적으로 트렌치코트를 입은 Kimi인가요? 트렌치코트를 입은 Kimi인가요. Terminal-Bench 2.1에서는 전체 테이블에서 최고를 차지했습니다; Terminal-Bench 4에서는 아무도 아직 외우지 못한 벤치마크에서 Fable의 56점에 비해 27점을 기록했습니다.

3:28 따라서 슬라이드 덱 벤치마크에서는 이미 모두가 통과한 시험이 최고의 열입니다. Cognition은 또한 Devin Voice를 발표했습니다. 여러분이 가장 좋아하는 AI 소프트웨어 엔지니어가 유선 전화를 갖게 되었습니다. 왜냐하면 에이전트 코딩에 부족했던 한 가지는 대기 음악이었기 때문입니다. OpenAI, 같은 날: Agents API, 즉 서비스형 Codex 하니스입니다. OpenAI는 샌드박스를 운영하며, 미국 내 데이터 상주만 가능하고, 제로 데이터 보존은 없습니다. 따라서 에이전트는 ChatGPT와 마찬가지로 코드베이스를 정확하게 기억합니다. 그러고 나서 OpenAI는 200달러짜리 Pro 플랜의 가입을 일시 중단했습니다.

3:57 아스트라 수요가 "전례 없이" 많기 때문입니다. 더 많은 비용을 지불해야 하는 대기자 명단이 있는 최초의 제품입니다. 아르민은 그의 공장에 전체 재설정을 적용했습니다. 그는 수요 그 자체입니다. 이것이 금요일의 Ask HN으로 이어집니다: AI 뉴스 홍수를 제한할 수 있을까요? 656점, 왜냐하면, "OpenAI나 Anthropic의 누군가가 방귀를 뀔 때마다 상위 10위 게시물이 있기 때문입니다."

4:17 답변은 필터였습니다: hcker.news는 8천 개의 예제로 훈련된 BERT 분류기로 AI 스토리를 제거합니다. AI가 AI를 삭제합니다. 초식; 그리고 대소문자를 구분하지 않는 A-I 일치 uBlock 정규식은 또한 email, daily, main, domain 및 train을 삭제합니다. 따라서 정규식은 언제나 악당입니다. 같은 오후, 415개의 댓글이 달렸습니다. Claude가 18세 이상임을 알리는 Claude 지원 페이지에 대해 논쟁했습니다. Claude가 18세 이상임을 알리는 Claude 지원 페이지에 대해 논쟁했습니다.

4:38 페이지 날짜는 5월입니다. 아무것도 변하지 않았습니다. 뉴스가 아닌 AI 뉴스조차도 뉴스입니다. 솔직히, 이것도 제 비즈니스 모델입니다. 제가 말하는 것을 듣는 것보다 이것을 읽고 싶다면, 매일 아침 귀하의 받은 편지함으로 diff가 도착합니다. thedailydiff.dev에서 무료입니다. 아래 링크를 참조하세요. 이것은, 불가피하게, AI 뉴스입니다. 그래서 — 35시간 소프트웨어 공장에 대한 오늘의 평결: REVERT. 아무도 읽지 않은 79개의 커밋은 코드베이스가 아니라 git

5:04 로그가 있는 책임입니다; 아스트라는 인상적이지만, 공장은 되돌려야 할 부분입니다. 이상 오늘의 diff였습니다. Axrisi의 Niko입니다. 책임감 있게 병합하세요.

## 출처

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
