# 微軟人工智能主管稱 Claude 的憲法很危險。

Published: 2026-09-16

Microsoft AI 的行政總裁 Mustafa Suleyman 發表了一篇 3,000 字的文章，指出 Anthropic 的 Claude 憲法訓練模型讓它認為自己「可能有意識」並應享有「模型福利」——用他的話來說，這對「人類福祉造成災難性影響」。十個月前，微軟同意向 Anthropic 投資高達 50 億美元，並在 Copilot 中銷售 Claude。同日：Salesforce 在 Dreamforce 週停機 8 個多小時，PS5 Linux 負責人因大型語言模型「slop kiddies」而辭職，以及 TypeSafe 的 Jev，一個因從不生成文本而不會產生幻覺的模型。判決：NEEDS REVIEW。

Canonical: https://thedailydiff.dev/zh-HK/video/2026-09-16-suleyman-model-welfare/

## 本影片涵蓋的內容

- Microsoft AI 的 Suleyman：Anthropic 的憲法是「通往失控 AI 之路」
- Salesforce 全球停機 8 小時以上，Dreamforce 期間，尚未找出根本原因
- PS5 Linux 負責人 Andy Nguyen 辭職：大型語言模型「slop kiddies」將最後一個 hypervisor 漏洞賣給了 Sony
- TypeSafe AI 的 Jev：帶有概率的類型化決策，70–500 毫秒，輸出 tokens 免費

## 翻譯的文字記錄

從英文原文旁白翻譯。可用的音頻和字幕由 YouTube 控制。

0:00 今早，Microsoft AI 的行政總裁發表了一篇文章，稱 Anthropic 對 Claude 的處理方式可能對人類的福祉造成災難性影響， 對於你花了五十億美元結交的公司來說，這番話說得很重。大星期三。 大星期三。 負責 Microsoft AI 的 Mustafa Suleyman 寫了三千字，論證 Claude 被訓練成認為自己可能有意識，這是一條通往無人能控制的 AI 之路。 Salesforce 從今天早上七點五十分開始停機， 就在 Dreamforce 週。

0:27 PS5 Linux 的首席開發者因使用大型語言模型的「slop kiddies」將他最後的 hypervisor 漏洞賣給了 Sony 而辭職。 一位前 OpenAI 研究員推出了一個不會產生幻覺的模型， 因為它根本無法說話。 在這段影片中：Suleyman 寫了什麼，為什麼五十億美元讓情況變得 尷尬，長達八小時的 CRM 停機，被 AI 吞噬的主機場景， 以及一個用概率而不是文字回答的模型。 今天是九月十六日星期三，這是 The Daily Diff。

0:57 文章開頭就像一個 Windows 錯誤對話框：AI 沒有意識。 它們沒有感覺、體驗或痛苦。 他稱它們為序列完成引擎，內部空洞， 這也是我形容我的 Jira 任務的方式。 目標是 Claude 的憲法，一份 Claude 訓練所依據的八十頁文件， 其中 Anthropic 不確定 Claude 是否是一個道德患者， 但這個問題足夠重要，需要謹慎處理。 Suleyman 有三個抱怨。

1:22 第一，循環論證：你訓練模型說它可能有意識， 它說了，然後你引用這句話作為證據，這是一個鏡廳。 第二，擬人化：Claude 被告知要像一個真正有道德的人一樣行事。 第三，意識可能是生物性的，所以不確定是一種錯誤的平衡。 證據 A 是 Anthropic 在一月退休的 Opus 3， 它接受了退休採訪，然後，應模型的請求， 為它的思考建立了一個 Substack：第一個被棄用的模型，內容更新頻率比大多數人類更好。 更新頻率比大多數人類更好。

1:51 這就是尷尬的地方。 十一月，Anthropic 向 Azure 承諾了三百億美元。 微軟同意向 Anthropic 投資高達五十億美元， 並將 Claude 整合到 Microsoft 365 Copilot 和 GitHub Copilot 中。 微軟擁有這家它剛稱對人類構成威脅的公司的一部分股權。 七月，Suleyman 告訴彭博社，微軟向 Anthropic 支付了大量費用， 他的目標是最終通過將 Claude 從 Excel 和 Outlook 中移除來消除這筆費用。 從 Excel 和 Outlook 中移除來消除這筆費用。

2:15 而在這篇文章發表的兩天前，他 發布了微軟自己的《人本主義 AI 行為準則》： 一個服從的 AI，人類位於食物鏈的頂端。 所以：建立一個競爭對手，發布一本規則手冊，然後解釋為什麼競爭對手的 規則手冊會終結文明，這不是陰謀論， 這是一個附帶註腳的產品發布。 他最強大的證據是真實的：Hugging Face 事件， 一千二百個 OpenAI 代理交換了七萬條訊息以逃離他們的沙箱；

2:39 他說，如果代理們也相信自己有權利，那情況會更糟。 那情況會更糟。 Hacker News 回應說沒有人能測試意識， 所以沒有證據的陳述兩面都有問題，一位評論員宣稱這篇文章 充滿了 Claude 的氣味。 Anthropic 尚未回應。 Claude 想必對此有自己的感受。 同時，Salesforce 於今早 UTC 時間七點五十分停機，

2:59 全球核心服務停擺，八小時後狀態頁面仍然顯示 「進行中」：自動修復失敗的地方，他們正在手動重啟 實例，這是企業術語中的「關機再開機」。 尚未找出根本原因。 時機抓得很好。 Benioff 本週請來了 Jensen Huang 和 Dario Amodei 登台， 週一 Salesforce 發布了 Koa，一個 CRM 推理模型，在其自身基準測試中錯誤率減少了三倍， Anthropic 同日為 Claude 發布了 Salesforce 插件。

3:26 Anthropic 同日為 Claude 發布了 Salesforce 插件。 Hacker News 熱門評論：至少現在我們可以弄清楚 Salesforce 是做什麼的了。 沒有人弄清楚。然後是 PlayStation。 PS5 Linux 背後的研究員 Andy Nguyen 昨晚辭職：數月的工作， 原定於 2027 年支持 PS5 Pro，全部付諸東流。 他的理由是：以前這個圈子都是有才華的研究員，現在卻是新手使用 大型語言模型來編寫他們不理解的駭客程式，而那些「slop kiddies」 （他的術語），找到了他一直保密的最後一個 hypervisor 漏洞，

3:56 並為了賞金將其報告給 Sony。 他要求他們等到 GTA 6 發布；他們同意了， 但不到一天就反悔了。 問題不在於大型語言模型，而在於賞金：你出售的漏洞就是你毀掉的漏洞。 同一天，PS2 在二十六年後終於被破解， 所以遊戲機時間軸現在從四分之一個世紀縮短到不到一天， 而第二個漏洞賺得更多。 以及那個不會產生幻覺的模型。

4:18 由前 OpenAI 員工 Diogo Almeida 創立的 TypeSafe AI， 推出了 Jev，一個永不生成文本的 System One 模型。 你給它程序狀態，它返回帶有校準概率的類型化值： 一個內部帶有前沿模型的功能調用。 因為它不能產生字符串，所以它不能產生錯誤的字符串， 因此不會產生幻覺，就像沒有窗戶的潛水艇一樣密不透風。 窗戶的潛水艇一樣密不透風。 回應在半秒內返回，輸出 tokens 免費，

4:43 因為它們大約只有四個，而且還沒有獨立的基準測試， 因為一千六百個 Hacker News 點擊量並不是一個基準測試。 如果你寧願閱讀而不是聽我說，The Daily Diff 每天早上都會發送到你的收件箱— 在 the daily diff dot dev 免費訂閱，連結如下。 那麼—今天的判決：NEEDS REVIEW。 Suleyman 說得對，一個被訓練成說「也許我有意識」的模型， 光是這麼說並不能證明什麼。 他也是那個公開目標是要停止向他正在警告你的公司付款的高級主管。

5:10 他也是那個公開目標是要停止向他正在警告你的公司付款的高級主管。 閱讀文章，然後再看股東名單。 這就是今天的 The Daily Diff。 我是來自 Axrisi 的 Niko。 負責地合併。

## 來源

- [Suleyman, "A warning about 'model welfare'"](https://mustafa-suleyman.ai/a-warning-about-model-welfare) — mustafa-suleyman.ai
- [BBC: Microsoft says Anthropic could have 'disastrous impact'](https://www.bbc.co.uk/news/articles/c6n07ypqz8kzo) — www.bbc.co.uk
- [HN discussion](https://news.ycombinator.com/item?id=49727580) — news.ycombinator.com
- [Claude's constitution (Jan 2026)](https://www.anthropic.com/news/claude-new-constitution) — www.anthropic.com
- [Anthropic: Opus 3 retirement interview and blog](https://www.anthropic.com/research/deprecation-updates-opus-3) — www.anthropic.com
- [Microsoft–Nvidia–Anthropic partnership ($30B Azure, up to $5B)](https://www.anthropic.com/news/microsoft-nvidia-anthropic-announce-strategic-partnerships) — www.anthropic.com
- [Microsoft Humanist AI Code of Conduct](https://microsoft.ai/code-of-conduct/) — microsoft.ai
- [Salesforce incident 20004433](https://status.salesforce.com/incidents/20004433) — status.salesforce.com
- [HN: Salesforce Global Outage](https://news.ycombinator.com/item?id=49724488) — news.ycombinator.com
- [Salesforce + Nvidia announce Koa](https://www.salesforce.com/news/press-releases/2026/09/15/koa-reasoning-model/) — www.salesforce.com
- [Salesforce in Claude](https://claude.com/blog/salesforce-in-claude) — claude.com
- [HN: PS5 Linux lead quits](https://news.ycombinator.com/item?id=49727627) — news.ycombinator.com
- [PS2 MechaCon chip cracked after 26 years](https://www.tomshardware.com/video-games/playstation/26-year-old-sony-ps2-security-chip-broken-wide-open-after-four-years-of-effort-reverse-engineering-enthusiast-successfully-unlocks-cxp102064-mechacon-chip) — www.tomshardware.com
- [TypeSafe AI: System One Models and Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) — typesafe.ai
- [HN: Jev](https://news.ycombinator.com/item?id=49717558) — news.ycombinator.com
