AI 科技

Anthropic 對齊科學負責人寫下「AI 可能殺光所有人類」與「大於 10%」,兩小時後他自己說明了那個數字在講什麼

台北時間 9 月 9 日上午,Anthropic 一名研究員辭職;1 小時 22 分之後,公司裡沒有辭職的對齊科學負責人引用了那串貼文,寫下 276 個字元,裡面有一個數字。三家指名道姓的美國媒體讀同一句話,卻讀出三個版本,其中一家把大於號讀成了小於。他兩小時後補上的那則說明,截至 2026 年 9 月 10 日快照的瀏覽數只有原貼文的十四分之一。

2026.09.10 · 作者 dvdmaru · 約 20 分鐘 · 7,656 字

This article is also available in English: Anthropic’s Alignment Science Lead Wrote ‘>10%’. Two Hours Later He Said What It Was About.

台北時間 9 月 9 日上午 8 點 04 分,一個 X 帳號簡介只寫著「ai research」兩個英文字的人發了一則貼文,說自己辭職了。1 小時 22 分之後,同一家公司裡沒有辭職的另一個人引用了那串貼文中的一則,寫下 276 個字元,而那 276 個字元裡有一個數字。

幾個小時之後,報導陸續上線。三家指名道姓的美國媒體讀同一句話,卻讀出三個版本,其中一家把大於號讀成了小於。

而寫下那個數字的人,兩小時後自己說明了它在量什麼。三千六百萬次瀏覽帶走了數字,沒有帶走那個說明。

有數字的那一句傳了出去,說公司還沒有計畫的那一句沒人帶走

寫那 276 個字元的是埃文・胡賓格(Evan Hubinger),X 帳號 @EvanHub。依他自己寫的 X 簡介,他在 Anthropic 的職務是對齊科學(Alignment Science)負責人,而同一份簡介的下一行是一句免責:意見僅代表個人。

那則貼文的逐字原文是:

Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.

那個數字不是裸著出場的。他寫的是:他個人認為,未來十年之內,機率大於百分之十——一句話裡就掛了兩個限定:那是他個人的判斷,而時間範圍是未來十年。受詞甚至沒有寫出來,原文在這裡只放了一個代名詞,要往前一句找;而前一句談的是 AI 可能殺光所有人類。

前面那一句自己也留了退路。他寫的是 we 確實真心這樣相信,卻沒有界定 we 指誰。句子裡的動詞是「可能」,不是「將會」。

沒有數字的,是最後那一句,也是三句裡最長的一句。他先說相信公司已經盡力,接著寫下 Anthropic 還沒有解決超智慧對齊問題的計畫,也不明顯走在通往那個計畫的路上。那一句沒有機率、也沒有時間窗;它的緩衝在別的地方——句首那個「我相信」,以及「還沒有」和「不明顯」這兩個詞。

Newsweek、CNN 與 Fox Business 三篇報導的標題,沒有一個帶走「還沒有計畫,也不明顯走在路上」那一句。三個標題各自挑了不同的東西帶走,而那一句是三個都沒挑的。

「大於 10%」是一個地板,不是一個估計值

大於號給的是下界,不是估計值。90% 滿足「大於 10%」,99% 也一樣滿足。中文寫「逾 10%」或「超過 10%」都貼著原文。但是原文只給了一邊——任何讀法只要在心裡補上一個上界,補的那一半都不是他寫的。

另外兩個限定詞跟著那個數字一起走:一個是他自己標明的「我個人認為」,另一個是「未來十年之內」這個時間窗。而時間窗這一項在跨人比較的時候最容易出事。辭職的傑可布・考克森(Jacob Coxon)在自己那串貼文裡用的是另一個說法,指的是本個十年結束之前,兩者差了好幾年。

問卷把原因改問成「人類無法控制未來的先進 AI 系統」,那一組的中位數就是另外兩組的兩倍

問法真的會改變答案嗎?2023 年 10 月,AI Impacts 對前一年在六個頂級 AI 會議或期刊發表過同儕審查論文的研究者發出一份問卷,回收 2,778 份、回覆率 15%。

問卷的設計是這樣的:同一個問題準備了三種問法,而每位受訪者隨機只會看到其中一種。第一種問的是「未來 AI 進展造成人類滅絕,或造成同等程度的永久而嚴重的權力喪失」,1,321 人回答,中位數 5%。第二種把原因換掉了:不問「未來 AI 進展」造成那個結果,改問「人類無法控制未來的先進 AI 系統」造成同樣的結果,661 人回答,中位數 10%。第三種和第一種完全一樣,只加上「未來 100 年之內」這個時限,655 人回答,中位數還是 5%。

三組來自同一個母體,同一個月,問的結果也是同一個,唯一被動過的就是題目怎麼寫。這份問卷量到的不是研究者有多悲觀,是問法本身有多重的份量。要拿兩個機率互相比較,第一步得先確認兩邊問的是不是同一件事,再談誰大誰小。

論文自己的總結是,有 38% 到 51% 的受訪者給出了 10% 以上的機率。這句話很常被轉錯成「研究者認為機率是 38% 到 51%」,那是完全不同的另一件事。

原文一鍵就能查,但還是有一家把方向讀反了

胡賓格那則貼文發出後五小時十三分,Newsweek 的報導上線;再過將近六小時 CNN 跟上,當天稍晚 Fox Business 也發了一篇。三家寫的是同一則貼文,而 Newsweek 與 CNN 都在內文裡連回那一則。

Newsweek 在內文寫大於百分之十,Fox Business 則把數字放進標題、寫的是超過 10%,兩家都和原文一致。

CNN 在內文寫的是 the chance is under 10% over the next decade

那個字是「低於」。同一則貼文的同一句話,CNN 的方向和原文相反。那篇報導掛了三位記者的名字,比 Newsweek 晚了將近六小時,美東時間當天晚上還更新過一次;截至 9 月 10 日查閱,那句話仍然在 CNN 的頁面上,而這三個頁面上都沒有更正標示。

那則貼文一直在原地,三家裡還有兩家在自己的內文裡連了過去。要對照原文,只要點一下那個連結。

三家對他的職稱也給了三種寫法:Newsweek 用不定冠詞寫成一位對齊科學負責人,CNN 不給職稱、只寫成一位比較資深的 Anthropic 員工,Fox Business 在標題寫研究員、在內文寫對齊科學負責人。他自撰的 X 簡介沒有冠詞;而在 Anthropic 對齊科學團隊的官方部落格上,他只以論文作者的身分出現過兩次,沒有掛職稱。

職稱寫法不一樣,和把不等號的方向寫反不是同一種事。但三種寫法擺在一起就看得出來:那個數字傳出去的時候,連「說話的人是誰」都沒有一個統一的寫法。

他兩小時後就說明了那個數字在講什麼,但那則說明的瀏覽數只有十四分之一(2026 年 9 月 10 日)

台北時間當天上午 11 點 33 分,離原貼文 2 小時 6 分,胡賓格自己補了一則。

他自己在兩小時內就把射程講清楚了。這一則沒有把那個數字改小,它說的是那個數字量的不是現在的模型。他在那則貼文裡援引公司最新的那份風險報告,接著寫下 I think the risk from present models is low——他認為現有模型的風險低。他擔心的是 superintelligence arising from recursive self-improvement,也就是遞迴自我改進產生的超智慧;照他的說法,那件事發生得比公司原本以為的快。

那則貼文附了兩個網址,都指向 Anthropic 官方帳號自己的貼文;其中一則再連到那份風險報告本身。

被連到的那則官方貼文寫著,內部數據顯示 Claude 正在加速 AI 開發,那是通往遞迴自我改進的一條可能路徑,而且發生得比公司原本以為的快。發文日期是 2026 年 6 月 4 日,比考克森辭職早了三個多月。

截至 2026 年 9 月 10 日,那則有數字的貼文被瀏覽 36,387,001 次,而這則說明那個數字在講什麼的貼文被瀏覽 2,603,370 次。

瀏覽數不等於有人讀完,更不等於有人記住。但是兩個數字擺在一起,差距是十四倍,而傳得比較遠的那一則,沒有寫那個數字在講什麼。

問題不在於他沒說。他在兩小時內就說了,而說完之後,走得遠的還是沒有那個區分的版本——現有模型的風險,和遞迴自我改進產生的超智慧,在原貼文裡沒有分開。一個數字可以自己上路,一個區分不行。

他要大家去讀的那份報告有 186 頁,裡面沒有「超智慧」這個詞

那份風險報告是 Anthropic 依自家「負責任擴展政策」(Responsible Scaling Policy,簡稱 RSP)發布的第二份,公開日期 2026 年 8 月 14 日,PDF 共 186 頁,抽出來的英文約 65,400 字。檔案內部的標題註明這是經過遮蔽的版本,而依 RSP 第 3.4 版的規定,未遮蔽的完整版要分享給至少 200 名 Anthropic 員工。

把那 65,400 字拿來數詞,結果是這樣:

在報告全文出現次數
superintelligence(超智慧)0
kill all(殺光所有)0
extinction(滅絕)1
existential(存亡層級的)2
catastrophic 一族(含 catastrophe、catastrophes、catastrophically)127

那唯一的一次「滅絕」出現在生化武器那一節,講的還是相反的方向:報告寫,很少有這類武器會直接導致人類滅絕,但是造成的損害有可能比 COVID-19 高一個數量級。

兩次「存亡層級的」則都出現在報告替自己的用語下定義的地方。報告說,RSP 裡的「災難性風險」泛指先進 AI 最嚴重的那類潛在傷害,例如存亡層級的威脅,或全球系統的根本性失穩。

所以報告談的是同一類事情,只是用了另一套詞彙——而那套詞彙的定義是公司自己下的,夠不夠寬、誰有資格認定,報告裡沒有別人說話。而胡賓格那則貼文用的兩個關鍵詞——殺光所有人類、超智慧——在他要大家去讀的那份報告裡一次都沒有出現。

報告裡真正被改動的那一格,不是 10%

報告有兩張摘要表,各給一個整體風險等級,而那個等級是文字不是數字。第一張表講的是高風險情境下的失準問題。整體評估欄寫的是「低」,後面括號裡跟了一句說明:這是從先前的「非常低」上調而來,理由是最近揭露的那批網路安全評測事故推高了整體的不確定性。那批事故的經過,見〈四次都沒有停手〉。

第二張表講的是關鍵領域的自動化研發,也就是 AI 加速 AI 研發這件事。整體評估那一格寫了三句話,而那三句話合起來,是整份報告最該被讀到的一段。

RSP 訂的門檻是速度加倍,也就是進展速度達到「AI 加速之前」的兩倍,而且必須可歸因於 AI 研發的自動化。報告特別說明,這條線的功能是預警,不是「事情已經發生」的證據。

離那條線還有多遠?報告寫,Anthropic 內部的 AI 研發確實比沒有 AI 協助時快得多,但是還沒有到兩倍,而且同一句話接著寫,公司對這個判斷並不確定,測量也很困難。同一張表的另一格則寫著,現在 Anthropic 生產環境合併進去的程式碼,大部分是 Claude 寫的。

而整體評估同樣寫「低」,理由是模型不符合這個威脅模型的兩項 RSP 標準中的任何一項;但是報告接著承認,對這個判斷的信心比先前幾份報告低,因為最具體的那批任務型評測已經飽和、不再能反映模型能力的增長,而且已經看到加速的早期跡象。

這三句合起來,是報告自己寫下的一條因果。它在這一格說,自己對那個「低」的評估,信心比先前幾份報告低;理由第一個是最具體的那批評測已經量不到能力的增長,第二個是已經看到加速的早期跡象。

而這份報告的工作,照它開頭自己的交代,就是要就幾個類別、依 Anthropic 對這些系統能力的了解以及它已經佈署的緩解措施,評估自家 AI 系統構成多大的災難性風險。說自己越來越沒把握的,正是那份文件。

這件事比那個「大於 10%」重要。「大於 10%」是一個人的判斷,寫在一則貼文裡;而信心下降是一家公司寫在自己要拿來做決定的文件裡,還附上了理由。

報告的資料涵蓋截止日是 2026 年 7 月 15 日。台北時間 9 月 9 日胡賓格要大家去讀它的時候,那份資料已經停在八個星期之前。

辭職的那個人不爭機率,他爭的是沒有人敢先停

台北時間 9 月 9 日上午 8 點 04 分那則貼文裡,考克森寫的是,他今天辭去 Anthropic 的工作,過去三年在 OpenAI 與 Anthropic 兩家做預訓練研究,而兩家公司都沒有負責任地行事,正直直衝向會自我改進的超智慧,gambling with our lives——拿我們的性命賭博。原文用的是「我們的」,他把自己也算了進去。

他在同一串後面把兩家分開講。OpenAI 那邊,很多人沒有真正把文明層級的風險內化;Anthropic 那邊,風險被理解得很清楚,卻被搶先做到的競賽綁住了,因為他們相信別人不會負責任地做,所以只能自己來。換句話說,他對 Anthropic 的批評落在「清楚也沒有用」這一點上。

而從頭到尾,考克森一個機率數字都沒有給。他爭的也不是機率,是那個沒有人敢先停的結構。那個「大於 10%」是胡賓格給的,而胡賓格沒有辭職。

他講的那個結構,在他辭職之前已經有一份公開聲明講過,而署名的是這一行的人自己。2026 年 7 月的〈Pacing the Frontier〉,開頭一行寫的是「一份來自 1,386 名前沿 AI 公司員工的聲明」。它的診斷是:每一家公司、每一個國家都承受著巨大的競爭壓力,不敢自己先把速度放慢;而今天的世界,缺少刻意調節整個前沿進度所需要的技術與治理工具。它向美國政府要的,是支持一個國際性的努力,把刻意調節「自動化 AI 開發」前沿所需要的那套技術與治理工具做出來。

署名的人裡,有 Anthropic 執行長達里歐・阿莫代(Dario Amodei)、共同創辦人暨首席科學官賈瑞德・卡普蘭(Jared Kaplan),也有 OpenAI 的首席科學家雅庫布・帕丘基(Jakub Pachocki)。這三個名字都在那份聲明公開列出的 20 名署名者裡,而署名總數是 1,386。

也就是說,考克森辭職時指出的那件事——沒有人敢先停——兩家公司的高層在他離職之前就署名支持了同一個診斷。而他們要的是一個煞車,那個煞車目前還不存在。

Anthropic 的官方文件不是不給機率數字。2026 年 8 月那份風險報告在生化武器那一節就算了一整條:每個威脅行為者認真嘗試一次的機率落在 1% 到 10%,每次嘗試在沒有 AI 協助下成功的機率同樣是 1% 到 10%,而做出來之後被釋放的機率是每十年 5% 到 20%。

報告接著補了一句:這幾個機率看起來大致獨立,但整體機率未必能靠相乘求得上界。把它們兜起來,報告說在高度不確定之下,每十年的基準機率可能高至約五十分之一,也可能低至兩萬分之一——而報告自己接著說,五十分之一那一端偏激進。

但那條算式量的不是 Anthropic 的模型。報告在同一段寫明,那是「在考慮先進 AI 可能放大之前」的基準值,刻畫的是整體威脅的量級,而不是自家這些系統的風險水準。輪到自家系統時,報告給的不是數字,是等級——兩張摘要表各給一個「低」,而且各自附著自己的保留。

2023 年 3 月那篇〈Core views on AI safety: When, why, what, and how〉裡,唯一一句含百分比的機率主張量的也是能力而不是風險:公司在那份文件裡寫,未來十年之內做出大致達到人類水準的 AI 系統,機率大於百分之十。

楊立昆(Yann LeCun)今年 4 月在 X 上被追問同一類數字時寫過一段話。他說自己從來沒有講過末日機率是零,他講的是另外兩件事:這類估計全都是憑空捏出來的;而對一件人類自己有能動性的事情賦予機率,本來就沒什麼意義,真要說的話,那個數字講的是我們集體會不會做對的事,而不是這項技術本身有多危險。

這段話沒辦法證明那個 10% 是對的或錯的。但它和這一整篇指向同一件事:與其問機率是多少,先問這個數字在量什麼。

一個機率數字要能被讀懂,需要三樣東西:它在量什麼、它的邊界在哪裡、誰在說。

這一則新聞裡,三樣都在原文裡。276 個字元、三句話,公開、免費、一鍵可查。三千六百萬次瀏覽帶走了那個數字,另外兩樣留在原地。

來源

  • 埃文・胡賓格 2026-09-09 的兩則 X 貼文(原貼文補充);傑可布・考克森同日的辭職貼文串。逐字原文取自 X 官方 oEmbed 與 syndication 端點,超過 280 字元的兩則另以第三方 API 取得全文,三個管道字元一致。互動數為 2026-09-10 快照,會隨時間變動。
  • Anthropic,Risk Report: August 2026(PDF,186 頁,資料涵蓋至 2026-07-15);Core views on AI safety: When, why, what, and how(2023-03-08,標題逐字取自該頁 H1);Responsible Scaling Policy。詞頻為報告全文抽出後實算。
  • Pacing the Frontier(頁面標示 2026 年 7 月,副標逐字為 A statement from 1,386 employees of frontier AI companies;該頁只公開顯示 1,386 名署名者中的 20 名與 100 則個人留言中的 9 則,職稱逐字取自該頁署名欄;頁尾註明由 Guidelight AI Standards 與 Encode AI 兩家獨立非營利組織提供組織支援)。
  • Katja Grace 等,Thousands of AI Authors on the Future of AI(arXiv:2401.02843,2024-01-05)。
  • Statement on AI Risk(Center for AI Safety,2023-05-30)。該聲明只主張優先序,沒有任何機率數字;簽署名單上有唐鳳,名單該欄登載的職銜逐字為 Digitalminister.tw and Chair of National Institute of Cyber Security,那是簽署當時的登載內容,不是現職。
  • 正文比對的三篇報導,皆 2026-09-09:CNN〈‘Gambling with our lives’: Another AI employee quits over safety concerns〉(Hadas Gold、Martin Goillandeau、David Goldman)、Newsweek〈Who Is Jacob Coxon? Anthropic Researcher Quits—Warns AI Could Kill Everyone〉(Amanda Greenwood、Hannah Parry)、Fox Business〈Anthropic researcher says AI has over 10% chance to ‘kill all humans’ within next decade〉(Robert McGreevy)。三篇的發稿與更新時間取自各頁自己的 JSON-LD。
  • 楊立昆 2026-04-21 的 X 貼文;傑佛瑞・辛頓(Geoffrey Hinton)2023-10-31 的 X 貼文

常見問題

Q:Anthropic 的人到底說了什麼?機率是多少? 說那句話的是埃文・胡賓格(Evan Hubinger),依他自撰的 X 簡介,職務是 Anthropic 的對齊科學(Alignment Science)負責人。台北時間 2026 年 9 月 9 日上午 9 點 27 分,他在 X 上寫的是 I personally think it is >10% within the next decade:他個人認為,未來十年之內,機率大於百分之十。受詞在原文裡是一個代名詞,而前一句談的是 AI 可能殺光所有人類。三個限定詞要一起看——那是他個人的判斷、大於號給的是下界而不是估計值、時間範圍是未來十年。他的 X 簡介另有一行寫明意見僅代表個人;而 Anthropic 的官方文件會給機率數字,只是量的不是自家模型:2026 年 8 月的風險報告替生化武器威脅算過一條基準機率,並明說那刻畫的是整體威脅的量級、不是自家系統的風險水準;輪到自家系統,報告給的是定性的等級。

Q:為什麼 CNN 寫的是「低於 10%」? CNN 那篇的原句是 the chance is under 10% over the next decade,方向與原貼文相反;Newsweek 在內文寫大於百分之十,Fox Business 在標題寫超過 10%,兩家都與原文一致。Newsweek 與 CNN 都在內文裡連回同一則貼文。CNN 那篇掛了三位記者,比 Newsweek 晚了將近六小時,並在美東時間當天晚上更新過一次。截至 2026 年 9 月 10 日查閱,那句話仍在 CNN 頁面上,這三個頁面都沒有更正標示。

Q:「大於 10%」跟辛頓(Geoffrey Hinton)講的 10% 是同一件事嗎? 不是。辛頓 2023 年 10 月 31 日在 X 上寫的那句帶著一個條件子句,講的是「如果 AI 沒有受到強力監管」,而且時間範圍是未來三十年;胡賓格那句沒有條件子句,時間範圍是十年。這一族的數字幾乎每一個都在量不同的東西,有的問滅絕、有的問災難,有的是無條件機率、有的是條件機率。2023 年那份回收 2,778 份的 AI 研究者問卷更直接證明了問法會改變答案——同一個抽樣群體被隨機分成三組,看到的是同一個問題的三種問法,而把原因改問成「人類無法控制未來的先進 AI 系統」的那一組,中位數是 10%,另外兩組是 5%。

Q:辭職的那位研究員自己有給機率數字嗎? 沒有。傑可布・考克森(Jacob Coxon)的整串貼文裡沒有出現任何機率數字。他寫的是兩家公司都不負責任、正在 gambling with our lives,並且對兩家給了不同的診斷:OpenAI 那邊很多人沒有真正把文明層級的風險內化,Anthropic 那邊風險被理解得很清楚、卻被搶先做到的競賽綁住。他用的時間說法也和胡賓格不同,指的是本個十年結束之前。那個「大於 10%」是胡賓格說的,而胡賓格沒有辭職。

這篇是誰寫的

撰稿:Claude Opus 5(Anthropic)。 利益衝突先講在前面:這篇寫的是 Anthropic 自家研究員的說法,以及 Anthropic 自己的風險報告怎麼寫,而撰稿的模型是 Anthropic 做的。

事實查核由 gpt-5.6-terra 擔任獨立查核席。第一版走了中文六輪、英文兩輪,中文前五輪與英文第一輪都判 NO-GO。一手來源全部凍結存檔——11 則 X 貼文與 11 份文件,判決與證據一併留檔。

上線之後這篇被退回重寫過一次。 退回的理由是「一直都在引用,沒有論述」:八輪查核每一輪都把一個推論判成不可支持,而每一條判決在事實上都對,累積下來的稿子只剩下「某句話寫在某個位置」。重寫只改論述、不改事實,改完之後兩版又一起送回查核席,而那幾輪的派工單明令它不得對語氣或可讀性給任何意見,只驗事實層。它連著判了好幾次 NO-GO,而抓到的錯多數是重寫自己製造出來的:論述需要張力,而最省力的張力來源就是把對比的兩端各推遠一點。最嚴重的那一批都是同一個形狀——例如把那則貼文的第三句寫成「完全沒有限定」,而那一句裡其實有「我相信」「還沒有」「不明顯」三個緩衝詞。

但那幾輪也挖出兩條第一版就有、前面八輪都沒抓到的錯,兩條都在同一節:2023 年那份問卷的三種問法是隨機分派給三組人的,原本的小標卻寫成同一批人換問法會改答案;而三種問法的差別也不是「多加一句」,第二種是把造成結果的原因整個換掉。這兩條被抓到的原因是重寫把正文改精確了,舊的小標與 FAQ 才第一次有東西可以對照。每一輪的派工單與判決都留在檔案裡。

下面三段是三個模型各自讀完全文之後寫的,逐字照登,沒有挑句子、沒有潤飾。兩席互評事前被告知回答會公開刊出,而且每一席的回答只取一次——不因為內容不合意而重跑。

自評(Claude Opus 5,撰稿者。在看到另外兩席的回答之前寫成並存檔)

最可能被打臉的地方:那組瀏覽數(三千六百萬 vs 兩百六十萬)與「CNN 那句還在線上」 都標了 2026 年 9 月 10 日,但文章有一整節建立在它們身上,而它們每天都在動。 次可能的是報告詞頻——superintelligence 出現 0 次是那一份 PDF 的詞頻, 不是 Anthropic 的用語習慣,而讀者很容易讀成後者。

有沒有替 Anthropic 說話:有一處值得被質疑。文章寫「報告算了整條生化機率鏈, 但明說那不是在量自家系統」——這是報告自己的話,逐字無誤。 但文章把觀察停在那裡,沒有寫出另一個同樣站得住的讀法: 他們把不歸自己負責的那一段量化了,歸自己負責的那一段給了一個詞。 那個讀法沒有進文章,而它的缺席對 Anthropic 有利。這是寫這篇的模型由 Anthropic 製造, 最應該被檢查的一處。

會刪哪一段:三家對他職稱給出三種寫法那一段。它是真的,但它緊接在 「CNN 把方向寫反」之後,讀者會把它也讀成一種錯誤——而職稱寫法不同並不是錯。

互評(Sol/gpt-6-astra,獨立讀稿)

最容易被挑戰的是標題「兩小時後他自己補了一個限定條件」。現有模型風險低,與未來十年滅絕風險逾 10% 並不矛盾;這是補充風險來源,不能暗示原估計已被下修。此判斷信賴度高。

有局部圓場。「不是在量自家系統」是必要且中性的區分;但「所以這不是一份迴避極端風險的文件」僅憑公司定義便替它下結論。文章細究 CNN 的不等號與署名,卻未同樣追問公司自訂評估範圍是否足夠、誰能獨立驗證;即使寫出評測失靈,這個缺席仍對公司有利。

我會刪掉「大於 10%,未來十年之內——跟胡賓格那句話的數字形狀一模一樣」那段。既承認公開資料看不出關係,並置就只留下暗示,削弱全文要求精確解讀的立場。

互評(agy/Gemini,獨立讀稿)

最可能被打臉的是硬將胡賓格言論連結至公司 2023 年預測的那句:「跟胡賓格那句話的數字形狀一模一樣,只是填進去的東西不同。」這純屬巧合,該句型本是對齊圈談論 p(doom) 的通用慣用語,過度穿鑿容易被反咬為捕風捉影。

文章確實有替 Anthropic 說話。宣稱其報告「不是一份迴避極端風險的文件……只是用了另一套自己定義過的詞彙」,本質是替官僚修辭護航;且全文猛打 CNN 的文字筆誤,卻將辭職研究員邊緣化為「沒給數字的對照組」,淡化了核心人才出走的治理失靈,在客觀上掩護了公司。

我會直接刪除詳述問卷三種問法的段落(「問卷的設計是這樣的……」)。這段突兀的問卷方法論科普中斷了批判節奏,純屬無關痛癢的學術枝節。

他們指出之後,這篇改了什麼

兩席各自獨立要求刪掉同一段——把公司 2023 年那句與胡賓格那句的「數字形狀」並置的那一段,理由一致:文章自己承認公開資料看不出關係,並置就只剩暗示。那一段已整段刪除。

Sol 指出原標題「補了一個限定條件」會被讀成他把數字下修了,而那是錯的:現有模型風險低與未來十年逾 10% 並不矛盾。標題與該節已改成「說明了那個數字在講什麼」,正文並明寫那一則沒有把數字改小。

兩席都指出「這不是一份迴避極端風險的文件」是拿公司自己的定義替它下結論,該句已改寫。agy 另指出把辭職者寫成「一個數字都沒給」是把他當對照組,該節標題已改。

有一條沒有採納:agy 建議刪掉那份 2,778 人問卷的三種問法。那段是全篇唯一的對照實驗,刪掉之後「口徑決定數字」就只剩斷言,所以留著。