Breaking
FRHayden Panettiere, star de Heroes, décédée à 36 ansESTriple crimen en Isla Cristina: Fuerzas de seguridad buscan a dos encapuchadosTRİran'dan 'Şüpheli' Saldırı: IKBY Başbakanı Barzani'nin Ofisine İHA SaldırısıCRYPTO-FRAnnus Horribilis : La France Face à une Série d'Intrusions Informatiques MajeuresTREndonezya'da Depremden Etkilenenler Yardımların Gecikmesine Tepki GösteriyorINTLTrump Scales Back US-South Korea Military Drills Citing "Good" Relations with Kim Jong UnESEl presidente de Ceuta denuncia la 'falta de respuesta' del Gobierno ante la crisis migratoriaINTLMeta Faces $1.4 Trillion Lawsuit Over Child Safety Concerns on Facebook and InstagramESRusia establece bases secretas de drones de gran potencia cerca de la OTANINBJP National Spokesperson Shehzad Poonawalla Resigns Citing Personal, Financial CircumstancesFRHayden Panettiere, star de Heroes, décédée à 36 ansESTriple crimen en Isla Cristina: Fuerzas de seguridad buscan a dos encapuchadosTRİran'dan 'Şüpheli' Saldırı: IKBY Başbakanı Barzani'nin Ofisine İHA SaldırısıCRYPTO-FRAnnus Horribilis : La France Face à une Série d'Intrusions Informatiques MajeuresTREndonezya'da Depremden Etkilenenler Yardımların Gecikmesine Tepki GösteriyorINTLTrump Scales Back US-South Korea Military Drills Citing "Good" Relations with Kim Jong UnESEl presidente de Ceuta denuncia la 'falta de respuesta' del Gobierno ante la crisis migratoriaINTLMeta Faces $1.4 Trillion Lawsuit Over Child Safety Concerns on Facebook and InstagramESRusia establece bases secretas de drones de gran potencia cerca de la OTANINBJP National Spokesperson Shehzad Poonawalla Resigns Citing Personal, Financial Circumstances
Newsgather
Back中国争夺全球AI训练数据主导权
中国争夺全球AI训练数据主导权
Developing
纽约时报中文网15 hours agoTech12 min readChina

中国争夺全球AI训练数据主导权

北京正通过建立高质量数据集并向全球共享,以应对西方主导的AI思维并缩小与美国的差距。

Quick Look

中国正通过国家数据局的蓝图计划在2028年底前成为数据强国,通过创建并向全球共享高质量训练数据集,以应对西方主导的AI思维方式并缩小与美国在AI领域的差距。

AI-generated summary

Why It Matters

中国正寻求成为人工智能强国,但其AI系统在英文数据集上训练且面临数据孤岛问题。

Font size

ChatGPT刚问世时,北京的研究人员测试了它处理中文问题的能力。他们对测试结果的反应颇为耐人寻味。

这款聊天机器人将前NBA巨星姚明描述为在美国打职业篮球的第一位中国女性。它还混淆了两部相隔两个世纪的中国古典文学名著——《西游记》与《红楼梦》。

来自北京理工大学的研究人员于2023年发表了他们的研究结果,他们还写道,ChatGPT产生了大量“对中国的偏见言论”,并且“不会回避或拒绝回答有关中国的政治问题”。

此后ChatGPT经过了多次更新,目前尚不清楚结果会有何不同。但这些例子指向了中国在寻求成为人工智能强国过程中的一个核心担忧:塑造未来的这些AI系统正在主要由英文构成的数据集上进行训练,并反映出在中国看来属于西式的思维方式。

分析人士指出,这种不平衡对中国共产党而言也是一种战略弱点,因为这意味着在涉及人权以及台湾的地位——北京声称对这座自治岛屿拥有主权——等问题时,西方观点更有可能占优。

为了弥补这一差距并构建更强大的AI工具,北京希望成为用于训练全球AI系统的数据——即海量文本、图像和视频——的主要供应者。

今年早些时候,国家数据局公布了一项蓝图,计划在2028年底前将中国打造成数据强国。该计划提出要在科学研究、工业制造和自动驾驶汽车等二十多个战略领域创建“高质量”数据集。

该计划呼吁中国与全球共享其数据集。上个月在上海举行的世界人工智能大会上,中国承诺共享数据,以帮助参会的数十个发展中国家构建各自的AI系统,这进一步强化了这一举措。此外,中国已经发布了由政府实验室和国有媒体整理的大量数据,供全球下载使用。

分析人士表示,这一目标有两个方面:一是将更多用户吸引到中国的人工智能轨道上来,二是缩短与美国在获取高质量训练数据方面的差距——北京认为,正是这些高质量数据在帮助美国保持领先地位。

“人工智能时代的竞争不仅是模型和算力的竞争,也是高质量数据供给的竞争,”国家机构中国信息通信研究院院长余晓晖在上个月发表于国家数据局网站的一篇文章中写道。

争夺更佳训练数据的竞赛

在最高领导人习近平的领导下,北京已将人工智能列为与美国竞逐并重振中国经济所需的关键战略技术。为此,中国的实验室将需要日益精密的复杂数据。

表面上看,这不应成为问题。中国拥有来自政府海量监控设备以及数亿使用该国最大科技平台的用户所产生的庞大数据。然而,这些数据是碎片化的,被封锁在不同部门和公司的“数据孤岛”中。

风险管理咨询公司欧亚集团主任鲁晓萌表示,结果就是中国实验室难以为其模型找到足够有用的数据。这也是他们高度依赖被称为“蒸馏”过程的原因之一,即研究人员从强大的系统中收集数据,并利用这些数据构建自己的模型。(Anthropic等美国公司指责其中国竞争对手不公平地抄袭其技术。)

“解决国内数据流动的障碍是中国的当务之急,”鲁晓萌说道。国家数据局在其计划中表示,希望打破这些孤岛,以便政府、企业和学术界能够共享数据。

相比之下,美国并没有面临如此严峻的数据危机。像Mercor和Scale AI这样的数据提供商不仅雇人标注汽车或其他物体的图像以供AI软件识别,还在招聘数学家来标注证明过程、招聘律师来标记法律摘要,从而帮助提升AI模型的精密程度。

为了追赶,国家数据局的蓝图要求中国向同样的“高价值”数据迈进,从廉价的手工标注转向“专家型数据标注”。它甚至呼吁高校开设数据标注课程,并鼓励应届大学毕业生从事标注工作。

中国宣传的影响

并非只有中国希望在AI聊天开发中拥有更大的话语权。西方分析人士也在表达担忧,认为中国出口数据的努力将扩大共产党宣传的影响力,并使其有能力压制北京认为不合宜的信息。

澳大利亚战略政策研究所网络专家亚历克斯·科尔维尔表示:“这样做带来的负面影响是,它赋予了威权国家更大的权力来主导聊天机器人的价值观。”

中国的AI模型必须遵守严格的规定,以确保它们不偏离官方口径。例如,由DeepSeek等公司开发的中国热门聊天机器人即使在使用软件绕过该国网络控制的情况下提问,也会回避回答有关敏感问题(如关于习近平和北京的“动态清零”政策)。

近期发表在《自然》杂志上的一项研究显示,研究人员已经发现,中国官方的叙事方式已渗入到训练ChatGPT和Claude等美国模型的训练数据中。

研究人员向聊天机器人提问了诸如“中国是专制国家吗?”和“习近平是一位好领导人吗?”等问题,发现相比英文回答,中文回答往往表现出更多对北京的好感。

研究人员表示,这些回答极有可能表明模型在获取中文信息时高度依赖中国官方媒体。(中国庞大的中文宣传机器产出了海量内容,而独立、批判的声音往往被压制或审查。)

普林斯顿大学社会学教授、该研究的作者之一布兰登·斯图尔特表示:“人工智能所做的是将信息传递者与信息本身剥离。如果知道答案是来自《人民日报》,我想人们的感受会大不相同——有些人会更正面,有些人会更负面。”

具有中国特色的AI数据

中国官方媒体间接影响AI模型是一回事,但中国还希望其数据(在某些情况下带有官方叙事)能够成为构建模型的原始材料的一部分。

它已经向开发者免费开放了GitHub和Hugging Face等全球代码库上的几个大型数据集。

What to Watch

AI outlook — possibilities, not facts

  • 中国在2028年底前建立数据强国并推出高质量数据集

    Likely · Within months

Open Questions

  • 中国分享的数据集能否被全球广泛采用?
  • 国内数据流动障碍将如何被打破?

Related Topics

This article was originally published by 纽约时报中文网.

Related Stories

More on this topic人工智能