过去理解中共网络审查,有一条清楚的地理边界。

人在中国境内,搜索引擎看不到六四,社交平台删除政治敏感内容,新闻机构收到宣传指令;离开中国网络防火墙以后,至少原则上能够重新接触被屏蔽的信息。习近平时代把这套系统发展得越来越精密,但它仍然依赖一个前提:北京能够控制平台、服务器或者用户所处的信息环境。

生成式人工智能正在破坏这条旧边界。

《华尔街日报》8月13日公布的调查测试了ChatGPT、Claude和Gemini等美国AI系统处理中文敏感政治问题的表现。报道发现,在一些涉及中国政治和威权领导人的中文问题上,模型可能出现类似中国受审查聊天机器人的回避、自我审查或叙事偏差。调查把原因之一指向训练数据:模型学习的中文互联网本身已经长期经过中国审查和宣传体系筛选。

这件事的危险性并不在于某一个模型偶尔答错习近平的问题。大型语言模型本来就会产生事实错误,不同语言训练数据质量也存在巨大差异。真正值得警惕的是一种结构性可能:当一种语言的大规模公开信息已经被国家长期删减和重写,全球AI再把这些数据当成人类知识样本吸收,审查就可能从“删除信息”升级为“塑造机器认识世界的原料”。

中共不需要拥有美国AI公司,也不需要命令一家硅谷企业删除六四。只要中文网络上能够长期存活的政治信息本身已经严重失衡,训练模型面对的语料库就天然带有这种失衡。

这是一种过去没有出现过的宣传优势。

传统宣传需要受众观看新华社、央视或者《人民日报》。算法时代的宣传污染不要求受众知道信息来自哪里。一个荷兰学生、一名美国研究人员或者海外华人只需要用中文向AI提问,答案可能已经在概率模型中继承了中国互联网多年审查留下的结构性空白。

当然,这不能被夸大成“美国AI已经被中共控制”。《华尔街日报》的测试揭示的是值得系统研究的偏差风险,而不是证明北京能够直接操纵这些模型。美国AI公司拥有自己的安全训练、检索系统和后训练机制,不同模型表现也并不一致。

但正因为如此,解决办法也不能只是要求模型“反中共”。

真正可靠的技术答案应该是训练数据透明度、来源多样化、跨语言事实校准,以及在政治敏感问题上让模型能够接触未经北京审查的中文历史档案、学术研究、国际媒体和第一手证词。

习近平政府多年来投入巨大资源控制中国人能够看见什么。今天出现的新问题是:十几年之后,被控制过的信息环境正在成为下一代人工智能的学习材料。

防火墙过去阻止中国人看见世界。

如果全球AI企业不认真处理中文训练数据污染,它留下的下一项遗产,可能是让世界的机器也学会用防火墙以内的方式理解中国。

人工智能 #网络审查 #习近平 #中共宣传 #信息战 #观点评论

MEMBER DISCUSSION

文章讨论

已验证会员可围绕报道公开交流,并自行管理自己的内容。