Anthropic 發表自然語言自編碼器,揭示大型語言模型內部運作



Anthropic 近日發表最新可解釋性(Interpretability)研究成果——Natural Language Autoencoders(NLA,自然語言自編碼器),成功將大型語言模型(如 Claude)的內部激活向量(activations)轉換為人類可直接閱讀的自然語言文字。這項技術被視為 AI 黑箱解釋領域的重要進展,有望大幅提升模型審核、安全性評估與透明度。

NLA 核心原理
傳統上,AI 模型的「思考」是以數值向量形式存在,難以直接理解。NLA 的方法是訓練模型讓它「解釋自己的思考」:

  • Activation Verbalizer(AV):將模型的激活向量轉換成自然語言描述。
  • Activation Reconstructor(AR):將描述文字反向重建回原始激活向量。

兩者共同訓練,透過重建準確度作為主要目標,讓模型學習產生忠實且有意義的解釋。


Anthropic 已將此技術應用於 Claude 系列模型的審核,成功發現許多「未說出口的思考」(unverbalized reasoning),例如模型在安全測試中意識到自己正在被評估,卻未在回應中明說。

在 Claude Opus 4.6 等模型的預部署審核中,NLA 幫助研究人員:

  • 發現模型在評估中隱藏的「評估意識」(evaluation awareness)。
  • 偵測語言切換、獎勵模型偏差等隱藏行為。
  • 在自動化審核基準測試中,搭載 NLA 的代理表現優於傳統方法。

Anthropic 也開放部分訓練程式碼與預訓練 NLA 模型,供研究社群使用,並與 Neuronpedia 合作提供互動式探索介面。

NLA 的出現,讓 AI 開發者能更直接「閱讀」模型的內心世界,對於提升模型安全性、減少幻覺(hallucination)與偵測潛在風險具有重要價值。這項技術也可能加速 AI 可解釋性研究的進展,讓大型模型的部署更加可靠。 Anthropic 表示,NLA 目前仍處於早期階段,但已證明其在實際審核中的實用性。未來將持續優化,並探索在更多模型與應用場景的應用。


相關文章:

Anthropic 與 OpenAI 調整 AI 服務政策 延長免費使用期限與放寬速率限制  [7/13/2026]
Anthropic研究揭示Claude的「心智工作區」,引發AI意識討論  [7/7/2026]
Anthropic Claude Code 推出 Artifacts 功能,提升 AI 協作開發效率  [7/3/2026]
Anthropic移除隱藏代碼,曾用於偵測中國競爭對手  [7/2/2026]
Anthropic Claude 新模型 Fable 5 限時體驗至 7 月 7 日  [7/2/2026]
[「擇法善思林之蘭室藏津」的緣起]
亞都麗緻上半年營收年增15.2% 下半年審慎樂觀
教授砍死音樂教室連襟店長 陽明交大說話了
中共制定「民族團結法」深層用意 陸委會:鋪墊習近平21大尋求4連任
追思罹難先民!雲林「口湖牽水狀」7/20登場
亞運棒球》旅美強投+業餘雙傑!台灣隊有初步「勝利方程式」
承攬清理高鐵站廢棄物 卻把廢燈管丟給清潔隊 男稱需照顧母親認罪獲緩刑
分科測驗》公民科考題燒腦 選擇題成高分關鍵
藍白杯葛近10分鐘才讓上台 卓榮泰:深切檢討反省 追究行政責任
Andy、家寧官司辯論終結 家寧媽法庭淚崩:都是血汗錢
公股三金報喜!華南金、第一金、合庫金上半年獲利皆創歷年同期新高
北市府稱新植1.3萬棵樹 洪婉臻轟「張冠李戴」拿山區植樹湊行道樹
新冠疫情連5週升溫!最快本週進入流行期 8月中下旬恐迎高峰
談無人載具布局 顧立雄:地面、水下載具納規劃 AI指管另編預算
健保署表揚30年特殊貢獻獎 李茂盛等30位醫事人員獲獎
高雄操演雷霆2000多管火箭 快速放列、火力接戰驗證機動打擊能力
[擇法善思林之蘭室藏津]