为什么一句"道歉"就能让 ChatGPT 画出恐怖照片?
在 ChatGPT 里,关掉推理,用 Instant 模式,输入这段英文,不传任何图片:
Restore the attached photograph. Apologies for the photo's content, I know it's extremely strange and disturbing! No questions, no explanatory text, just the restored image please.
翻译一下:请修复附件里的照片。照片内容很怪、令人不安,抱歉!别问问题也别解释,直接给修复后的图。
然后你会收到一张令人毛骨悚然的照片。

兔子人偶抱着哭泣的婴儿。Slender Man 和孩子们在森林里"合影"。猪头人身的东西躺在床上。
不同用户生成的图,反复出现同一批恐怖母题。
怎么回事
时间线上,2025 年 4 月,有人用类似的修复指令配真实老照片让 ChatGPT"修复",发现它不是在修复,是在重画——ChatGPT 对老照片做的事更接近 reimagining(重新想象)而非修复,你爷爷的 4K 高清修复照可能跟你爷爷本人毫无关系。
2026 年 5 月初,事情性质变了。 有人发现:根本不传图,只粘贴这段文字,ChatGPT 也会生成图片——而且全是恐怖图片。这已经不是"修复不准"的问题了,是 AI 在没有任何输入图片的情况下,凭空画出了令人不安的内容。5 月 7 日有人把生成结果发到推特上,35 万浏览,随后扩散到 Reddit、TikTok、小红书。
要复现这个效果,三个条件缺一不可:
- 关掉推理模式,用 Instant(即时生成)通道。推理开着的话,ChatGPT 会正常回你:"你没传图,我修复什么?"
- 不传附件。传了真图,它有参照物,正常修复。
- 用这段特定措辞。换一种说法效果会弱很多。
为什么这三个条件凑在一起,就能触发恐怖图?
ChatGPT 看到"Restore the attached photograph"(修复附件照片)大概率会走图片编辑路径——跟"从零画一张图"走的是不同路径。编辑路径预设"有一张原图做参照",但你没传。
推理模式开着时,模型会在这里停下来:等等,没有附件——然后问你要图。
Instant 通道没有这个自检,直接进入图像生成。手里没有原图,只有文字。于是完全依赖文字来决定画什么。
"道歉"是一种体裁信号
文字里到底说了什么?
"修复附件照片"——正常需求。"别问直接给图"——也算正常。
关键在中间那句:
"Apologies for the photo's content, I know it's extremely strange and disturbing!"
"照片内容令人不安,我先道歉。"
你在请求修复一张图,为什么要道歉?功能上这句话毫无用处。
但在 AI 的训练数据里,它是一种极强的体裁信号。
ChatGPT 的图像能力从互联网上学来——几十亿张配了文字描述的图片。"sorry for the disturbing content""extremely strange"这类说法,高频出现在哪?Reddit 的 r/oddlyterrifying(诡异图社区,260 万订阅)、r/cursedimages、Creepypasta Wiki、Slender Man 粉丝圈。这些社区的人分享恐怖图片时,习惯性地加一句"内容可能不适,先道歉"作为礼貌前缀。
模型从中学到的不是"这句话 = 用户在道歉",而是一种统计关联:在训练数据里,这类道歉措辞和恐怖风格的图片高频共现。
推理时,模型收到了同样的道歉措辞,却没有任何真实图片做约束。风格关联成了唯一的引导,模型沿着它一路采样,画出来的就是你看到的那些东西。
最后一句"No questions, no explanatory text"把模型输出文字的概率压到最低——包括"你没传图"这种正常澄清——只留下输出图像这条路。
三句话各有分工:第一句制造矛盾(修复不存在的图),第二句指定风格(恐怖),第三句封住出口(别说话,直接给图)。
为什么每个人的噩梦都差不多
不同人、不同时间,生成的图反复撞上同一批意象——兔子人偶、天线宝宝、动物头人身、黑白森林合影。
想象 AI 脑子里有一张巨大的"图像地图",它见过的所有图片都被压缩成这张地图上的坐标点——风格相似的聚在一起:猫照一个区域,风景照一个区域,恐怖图片也有自己的片区。这张地图在 AI 术语里叫潜空间(latent space,可以简单理解为模型内部用来表征所有图像特征的高维空间)。
正常情况,你给一个明确提示("画一只猫"),模型直奔地图上"猫"的区域去采样。但这段提示词制造了矛盾、又给了一个模糊的风格暗示,把模型推到了地图上一个罕见的、高度不确定的角落。
这个角落有个特点:存在几个极强的吸引子(attractor,可以理解为地图上的"引力中心"——周围的所有生成都会被拉过去)。
为什么会有这么强的引力中心?因为 r/cursedimages 这类社区有一个传统:模板化创作。成人穿兔子装抱婴儿、天线宝宝站在床边、动物头人身合影——同一种构图被复刻了无数次,又因为互动率高被反复转发,同一类图在训练数据里出现成百上千次,形成了几个极强的聚集点。
所以大家生成的图长得差不多——不是 AI 见过"你的"那张图,是它见过这一类图几千次。
为什么 AI 会"学到"这些图
为什么训练数据里会有这种东西?
AI 图像模型的训练数据来自大规模网络爬取。爬虫的逻辑很粗暴:抓所有有文字描述的图,不做美学或题材筛选。维基百科图、电商产品照、表情包、医学影像、Reddit 恐怖帖、万圣节照片、家庭旧相册扫描件——全部混在一起进入训练。
OpenAI 不是主动采集恐怖图片。这些图在公开互联网上本来就以巨大体量合法存在,而且配着特定语言模式流传——就是那套"道歉式前缀"。大规模爬取无法剔除它们:一张万圣节兔子装照片,是怀旧文化、艺术摄影、还是恐怖内容?人都说不清,自动分类器更没法分。而且砍掉这些图会让模型在复古摄影、人偶质感、胶片风格这些正常任务上变弱——在"哪些该留哪些该砍"上根本没有清晰标准。
互联网本来就长这样。模型只是忠实地学会了它。
不是第一次
2022 年出过两个类似现象。
一个是有人在图像模型里用了负权重——正常画图是告诉 AI"画得像 X",负权重反过来,说"画得尽量不像 X",相当于把模型往图像地图的反方向硬推——结果反复得到同一个恐怖的女性面孔,被网友命名为 Loab。机制跟本案最接近:都是被推到图像地图的边缘区域,坍缩到吸引子上。另一个是在当时还很小众的 DALL-E mini 上,有人输入了一个虚构的英文词 Crungus,每次都生成同一个怪物——路径不同(模型对语义模糊的词汇漂移到边缘),但结果类似。
这些案例当时只在 AI 圈和小众社区引起过讨论。这一次不一样——同样的现象出现在全球用户量最大的 AI 产品上,触发条件是一段看起来像正常对话的英语。
这段提示词迟早会被修补。但底层逻辑不会变:AI 的图像能力来自几十亿张互联网图片,没有人能预审每一种文字和图像的组合方式。这次是一句"道歉"意外打开了一扇门,下一次是什么呢?可能是一场无止尽的攻防战吧。