在接下来70%的人生里 我可能都要问“是AI做的吗?”

在接下来70%的人生里 我可能都要问“是AI做的吗?”
2026年09月03日 00:22 快科技

AI 伪造这事儿真得管管了。

8 月 26 号上午,吉隆口岸刚发生泥石流悲剧,晚上就有 AI 造的假图了。

微博上流量大的那个,点赞已经八千多了,到现在还有不明真相的读者对着假图感慨。

下面唯一掏出证据辟谣的,拿的还是跟豆包对话的截图。。。下面唯一掏出证据辟谣的,拿的还是跟豆包对话的截图。。。

而且不但普通人,专业媒体也会中招儿。

今年 3 月初,美伊冲突期间,就出现了一次典中典的 AI 假图污染事件。

从源头供应商 SalamPix 开始,AI 造假的现场照片先是得到了法国一家正规图片社的信用背书,然后一路流入欧洲的各大主流媒体。

德国的老牌媒体《明镜》,荷兰最大的新闻通讯社 ANP 等等都被牵连进去,紧急发布声明,下架存疑的图片。

照这么下去,看到现场报道时,我们第一时间关注的可能就不是新闻本身了,而是先质疑这玩意儿到底是不是 AI 生成的。

那到底有没有办法管管呢?

为此我们测试了一些市面上常见的检测方法,还咨询了朱雀实验室的研究员,结果只能说,道高一尺,魔高一丈,现在还真没啥两全的法子。。。

比如官方最常用的手段,就是提前打水印,像是在生成的图片视频里钉上「AI 生成」四个大字儿。

这玩意儿显眼又直观,但太好去除了,以至于大伙儿开玩笑说现在 PS 的唯一用处,就是把这几个字儿给 P 掉。

所以说白了,这就是个声明,解决不了鉴伪的问题。

于是,更隐蔽一些的隐形水印就登场了。

比如很多大厂默认的 C2PA,会在图片生成的同时,将模型,生成工具之类的信息打包到图里边。

理想状态下,C2PA 甚至还能记录图片的编辑更改记录。

听着是不是有点像手机拍照的元数据,能记录照片的地理位置,相机的光圈大小。

诶,没错,C2PA 就是跟元数据差不多,一样美好,也一样脆弱。

像是截图裁剪,或者分享到微信压缩一下,这玩意儿就直接灰飞烟灭了。

比如这张 GPT Image 2 生成的图片,前脚刚下载下来,后脚放到 OpenAI 官方的验证器里,它就翻脸不认了,治标不治本。

然后咱的谷歌大善人就登场了,掏出了牛逼哄哄的 SynthID 隐形水印。

这玩意儿的定位才更像 AI 时代的东西,它不是把标签挂在文件本体外面,而是生成的时候,就把某种机器可识别的信号揉进图片,视频,音频,甚至文字里。

在技术论文中他们解释道,Gemini 在生成 token 的时候,会被这玩意儿微微干预,使得最终的产物 内容基本不变,但信号统计上,呈现某种痕迹和特征。

简单点说就是肉眼看不出来差别,但专门的检测器能认得。

除此之外,SynthID 比 C2PA 要更抗揍,普通的裁剪,滤镜,压缩基本都能拿下。

看效果这么好,隔壁的 OpenAI 也加入进来,比如以假乱真的 GPT Image 2 就支持 SynthID。

咱也是故技重施,试了一下,发现确实有点东西,大部分图片裁剪压缩,甚至加滤镜后,水印还是能被识别出来。

前些天 Anthropic 因为欧盟法规,也给 Claude 的文本加上了 SynthID 的水印,瞅着队伍是越来越大了,那等它全面覆盖,这事儿不就大结局了么?

诶,也没这么简单。

虽说同样是 SynthID,但检测器并不互通,Gemini 的图丢进 OpenAI 验证器里认不出来,反过来也一样。

这玩意儿现在还做不成统一的身份认证器,只能是各家自扫门前雪。

而且更麻烦的是,水印想要有用,就得能被检测,而一旦检测方案公开,围绕它的擦除,伪造和对抗也会随之而来。

像名声不咋样的 Anthropic,文本水印刚出来没几天,GitHub 上就出现了对抗的去水印项目,一个月不到就点到了两万颗星。

谷歌自己也承认,其实根本不存在什么完美安全的水印,他们的目的很现实,就是把攻击和伪造的成本抬高点。

所以第三方的检测器现在也很有市场,它们不依赖水印,而是能根据内容反推是否为 AI 生成。

但遗憾的是,我们测了一圈,发现这些检测器水平参差不齐,甚至有的只能说拉完了。

这里让 ChatGPT 生成 “ 伪史论 ” 的文章, 拿给不同的 AI 检测器。

四家国外的三家查不出 AI 痕迹,唯一支棱的 GPTZero,还把 2000 字的中文识别成了 49 个 words,弄半天哥们儿不认识中文。。。

| 依次为Originality.ai,winston,AISEO,GPTZero
| 依次为Originality.ai,winston,AISEO,GPTZero
| 依次为Originality.ai,winston,AISEO,GPTZero
|依次为Originality.ai,winston,AISEO,GPTZero

而国内的情况也没好到哪去,万方仍旧 0%,维普那篇甚至扩写到两万字后,才检测出 0.42%。

可能也就朱雀 AI 检测器情况稍好,38% 的人工+62% 的疑似 AI,虽然没实锤,但起码也 “ 疑似 ” 了。

至于图片,情况可能比文本还复杂点。

拿朱雀来说,常规的模型,它的检测很精准。

比如 GPT Image 2 生成的马斯克抖音直播图,是 90% 的可疑度;

再生成一张历史高考卷给它,它甚至能锤死 100%,还一口咬定是 OpenAI 的风格。

但如果换成冷门的 “ 小众 ” 模型,它可能就垮掉了。

比如同样生成小猫舔人手的图,GPT 和 Gemini 的它都能认出来,但 Seedream 5.0 Lite 就只有 21.64% 的概率了,MiniMax 的 Hilo 2.0 更是干到了 4.9%,属于 “ 不太可能是 AI 生成 ” 那档。

 依次为:GPT,Gemini,Seedream,Hilo
 依次为:GPT,Gemini,Seedream,Hilo
 依次为:GPT,Gemini,Seedream,Hilo
依次为:GPT,Gemini,Seedream,Hilo

能力起伏这么大,我们也很好奇原因,于是直接询问了朱雀实验室的研究员。

得到的回复是,检测器的能力其实一直在迭代,新模型出来后,泛化和兼容都需要测试反馈来不断优化。

说人话就是如果出来个很牛逼的新模型,那确实没啥通用的招儿,只能拿新的素材不断训练,才能学会辨别的方法。

看网站注释也能发现,执行检测的模型是在不断更新的,现在的模型是 7 月 21 日的版本。

除此之外,他们还透露,检测的时候也会参考 C2PA 之类的水印信息,不过主要手段还是特征识别,像是文章的行文结构,用词句式,因果逻辑这些细节。

但说实话,这些特征还是过于常规,我们更在意的反而是他们提到的 “ 更高维度的不可解释特征 ”。

这部分说白了,就是模型训练中自己涌现出来的能力,能够捕捉一些 AI 独特的创作手法,就比如刚刚的四只猫,肉眼看基本没差,但朱雀的模型就是能品出来不同。

当然,训练检测模型这活儿也是过犹不及,一不小心,很容易 “ 训练过头 ”。

比如我们测了 3 次 X 的截图,作为造假重灾区,检测的概率徘徊在 50% 左右。

然后又喂给它一张安德鲁·库蒂斯的油画,由于画风跟 AI 极其相似,所以概率飙升到了 98.59%。

再极端一点,直接在画板上写下 AI 两个字母,概率也足足有 94.62%。

好在后来在纸上写 AI 俩字母,它没说是 AI 生成的,算是扳回一城。

从这些测试中也能看出,检测器的优缺点都很明显。

它通用的定位确实方便,不需要知道东西到底是 Gemini、GPT 还是哪个模型生成的,只要 AI 还留下某些共同特征,理论上它就有机会抓出来。

但问题同样出在这个通用的特征上,因为模型的学会不一定是真的学会。

像 X 截图这种造假重灾区,AI 就容易形成 “ 刻板印象 ”,看到这种特征,就觉得像 AI 生成的。

可以想到,如果以后这些图的特征越来越不明显,那用于鉴别的模型训练起来就会更难,此时,就得指望涌现出更多 “ 更高维度的不可解释特征 ” 了。。。

所以回到最初那个问题,好像的确没有一个按钮,能让互联网重新回到有图有真相的年代。

因为当 AI 真有一天能把光影、文字、物理规律全都做对的时候,再盯着画面里找第六根手指,也没什么意义了。

但就像货币制造一样,假币即使跟真币一模一样,但在法律层面,它还是假币。

或许未来真正重要的问题,并不是这张图是不是 AI 搓的,而是这张图到底是从哪儿来的。

水印不够咱就上隐形的,C2PA 能被洗掉,那就 SynthID,再不够就超进化朱雀配合 super pro max SynthID。

我们未必能让假东西彻底消失,但让造假没那么便宜,让被骗没那么容易还是大有可为的。

普通人刷个 AI 抽象小视频,可能没必要搞一套数字取证。

但一张号称来自灾害现场,战争前线的照片,确实值得更高的举证门槛。。。

新浪科技公众号
新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

创事记

科学探索

科学大家

苹果汇

众测

专题

官方微博

新浪科技 新浪数码 新浪手机 科学探索 苹果汇 新浪众测

公众号

新浪科技

新浪科技为你带来最新鲜的科技资讯

苹果汇

苹果汇为你带来最新鲜的苹果产品新闻

新浪众测

新酷产品第一时间免费试玩

新浪探索

提供最新的科学家新闻,精彩的震撼图片