大模型拼到今天,已不只是比谁的芯片更快、参数更多。谁能把本国语言里的知识、经验和真实场景整理成高质量数据,谁才更可能做出真正“听得懂人话”的 AI。
作者声明:该图片由AI生成
AI 也有“母语偏见”
主流大模型长期吃的是英文互联网。阿里研究院2024年的一项统计显示,英文约占全球网页内容的60%,中文仅约1.3%,但中文使用者超过10亿。
这会带来一个很现实的问题:同一个模型,用英文提问时答案更完整、更有技术细节;换成中文,尤其是专业问题,输出可能更空、更泛,甚至照搬英文语境。
模型不是天然懂所有语言。训练数据里哪种语言的技术资料、新闻记录、社区讨论和专业文本更丰富,模型就更擅长在哪种语言里思考和回答。
芯片之外,中国在补另一块短板
美国对先进芯片和技术的限制仍在加码,算力当然重要,但数据成了更能长期积累、也更难被复制的一层能力。
中国正在推进中文语料库、战略语言资源数据库和“数字中文”建设,目标是在2027年前形成更系统的国家级语言资源体系。官方数据也显示,多数中国大模型的训练数据中,中文已占六成以上,部分模型达到八成。
这不是简单抓网页、堆文本。医学、法律、制造、金融、科研和新闻等领域的高质量资料,才是让模型能干活、少胡说的关键燃料。
真正稀缺的,是整理过的知识
英文互联网的优势,是几十年自然积累下来的论文、百科、代码社区和公开讨论。中文世界并不缺知识,缺的是可合法获取、格式统一、标注清楚、能直接用于训练的数据。
一份杂乱的网页抓取数据,和一套经过版权确认、事实核验、专业标注的行业语料,价值完全不同。前者能让模型“会说”,后者才可能让模型“会做”。
新闻机构、出版机构、行业协会、企业和高校手里的内容,未来都会成为 AI 时代的新型基础设施。
作者声明:该图片由AI生成
数据越重要,规则越不能缺位
中文数据要成为优势,绕不开版权、隐私、数据安全和技术标准。谁能用、如何授权、怎样脱敏、标注规则是否统一,都决定了数据能否形成长期资产。
如果只追求数量,模型会被低质、重复甚至错误内容喂坏;如果规则过于割裂,优质内容又难以流动。数据治理的目标,不是把知识锁死,而是让合规、可信、可追溯的数据真正被用起来。
AI 竞争最后比的,未必只是实验室里的模型分数。它更像一场长期的语言工程:把一门语言里最有价值的知识整理出来,让模型能理解它、调用它,再服务于说这门语言的人。