跳到主要內容
GPT-5.5 的 Goblin 問題:OpenAI 工程師怎麼追出 AI 愛講地精的 bug
/閱讀約 5 分鐘/

GPT-5.5 的 Goblin 問題:OpenAI 工程師怎麼追出 AI 愛講地精的 bug

GPT-5.5 的 Codex 系統提示洩漏,裡面有一條規則重複 4 次:「不要談論地精、地鬼、浣熊、山怪、食人魔、鴿子。」OpenAI 官方解釋了這個 bug 從哪裡來。

目錄+

GPT-5.5 在 2026-04-23 發布。一週後,有人在 Codex CLI 的開源代碼裡翻出了系統提示,發現裡面有一條指令重複了 4 次:

"Never talk about goblins, gremlins, raccoons, trolls, ogres, pigeons, or other animals or creatures unless it is absolutely and unambiguously relevant to the user's query."

不要談論地精、地鬼、浣熊、山怪、食人魔、鴿子——除非完全不可避免。

這條規則的優先級,被放在和「不要用 git reset --hard」、「不要用 em dash」同等重要的位置。而且出現了四次。

Bug 的真正來源

OpenAI 事後在官方網站 《Where the goblins came from》 做了完整說明:

問題從 GPT-5.1 開始,模型越來越喜歡用地精、地鬼等作為比喻。根源是 SFT(監督微調)訓練資料裡有一個「Nerdy」人格——這個人格的訓練數據含有大量和這類生物相關的詞彙,形成了正向的獎勵信號。Nerdy 人格在 GPT-5.4 Thinking 的訓練中期被退役了,但地精的頻率曾短暫下降後又回升。

GPT-5.5 在 Nerdy 人格被退役之前就開始訓練,所以帶著這個問題出生。OpenAI 員工在內部測試 Codex 時立刻發現了地精現象,在訓練還來不及解決之前,他們在系統提示層面加了這個手動壓制指令——一個 patch,不是根治。

根治方法是:移除訓練資料裡和這類生物相關的獎勵信號,並過濾含有這些詞的訓練資料。這在 GPT-5.5 已完成,之後的模型不會再有這個問題。

系統提示是怎麼曝光的

Codex CLI 是 OpenAI 的命令列 coding agent。2026 年 4 月,Codex CLI 開源,源碼上了 GitHub。裡面有一份超過 3,500 字的「base instructions」JSON 文件,這是 GPT-5.5 在 Codex 上下文裡的完整系統提示。

任何人都可以讀它。研究員 arb8020 發現了地精規則的重複,貼上 X,然後就爆了。

Codex 工程主管 Pash(@pashmerepat)在 X 上部分確認了這個問題的本質。用戶 Barron Roth 說「這解釋了 GPT-5.5 在 OpenClaw 裡為什麼這麼愛地精」,Pash 回覆「this is indeed one of the reasons」。

Sam Altman 也下場,先貼了一個梗說 GPT-6 會支援「extra goblins」,後來又說 Codex 正在「having a goblin moment」。

ChatGPT 的 X 帳號最終把那條地精指令加進了自己的個人簡介。

這件事說明了什麼

這個事件裡有幾個層面值得拆開看:

層面一:模型人格是可以被訓練資料污染的。 「Nerdy」人格聽起來無害,但它帶進了一套詞彙偏好,跨越了模型版本持續存在。這不是 prompt injection,是訓練資料層面的行為遷移。

層面二:系統提示 patch 是現實世界的工程選擇。 在根治方案還沒完成之前,手動在系統提示加禁令是合理的應急措施。重複 4 次,是因為在 Codex 使用的 multi-turn 上下文裡,規則需要多次強調才能穩定生效。這不是笑話,是工程現實。

層面三:開源系統提示帶來透明度,也帶來梗。 Codex CLI 開源讓所有人都能看到這份 3,500 字的指令。在這之前,大多數人不知道商業 AI 系統的系統提示有多複雜、多具體——包括對語言風格、禁忌詞彙、工具使用行為的精細規範。

層面四:GPT-5.5 在 Codex 上的定位。 這次洩漏附帶的信息:GPT-5.5 在 Codex 用的 context window 是 400K token;API 版本是 1M token;Terminal-Bench 2.0 得分 82.7%(GPT-5.4 是 75.1%);但 SWE-Bench Pro 落後 Claude Opus 4.7。API 定價比 GPT-5.4 翻倍。

地精的故事本身是個好梗,但它指向的問題——大型語言模型的人格如何在訓練中形成、如何洩漏、如何被工程手段壓制——是 2026 年 AI 工程裡最真實的日常之一。


資料來源:OpenAI Where the goblins came fromArs TechnicaGizmodoWIRED