中国 AI 为什么追得这么快?美媒找到一批关键人物
8 月 25 日,据《华尔街日报》报道,中国 AI 模型近年来快速缩小与美国头部模型的差距,其背后并非短期突然出现的技术突破,而是清华大学等高校长期形成的人才网络,以及开源技术、人才回流和更高算力效率等因素共同推动的结果。报道认为,以智谱 AI 联合创始人唐杰、月之暗面创始人杨植麟以及 DeepSeek 创始人梁文锋等人为代表的一批研究者,构成了中国这一轮 AI 追赶的重要力量。
《华尔街日报》称,中美两国多名行业人士认为,中国最好的 AI 模型目前与美国最先进模型的能力差距已经缩小至数月。今年 6 月,马斯克曾预测中国要到 2027 年第一季度才能追上 Anthropic 的顶级模型,唐杰随后回应称,“不会需要那么久”。
报道将中国 AI 人才体系的形成追溯至 20 多年前。2005 年,图灵奖得主姚期智在清华大学创办“姚班”,培养计算机领域的顶尖人才。与此同时,唐杰长期在清华从事数据挖掘和机器学习研究,其实验室后来成为中国 AI 人才的重要来源之一。杨植麟曾师从唐杰,在清华研究机器学习算法,随后赴卡内基梅隆大学攻读博士,回国后创办月之暗面。
这种高校与创业公司的人员流动逐渐形成了一张 AI 人才网络。2018 年,中国进一步放宽科研人员创业及科研成果商业化限制,次年唐杰从清华实验室孵化出后来发展为智谱 AI 的公司。早在 OpenAI 于 2020 年发布 GPT-3 后,智谱就将开发同等级模型作为目标。
不过,相比美国 AI 企业,中国公司长期面对资金和先进芯片不足的问题。杰富瑞测算,在相关时期内,中国科技公司的投入规模不到美国同行的五分之一。在这一背景下,提高算力利用效率成为中国 AI 企业追赶的重要路径。
DeepSeek 是其中的代表。报道提到,DeepSeek 通过多头潜在注意力机制(MLA)降低模型运行中的内存消耗,并较早在中国采用混合专家模型(MoE),以减少对芯片算力的需求。这些技术成为 2025 年初“DeepSeek 冲击”的重要基础,当时其推出的低成本开源模型引发美国科技股震荡,也迫使中国同行重新审视技术路线。
中国 AI 企业之间的技术交流也进一步加快了迭代速度。月之暗面后续模型采用了 DeepSeek 使用或验证过的 MoE 及 MLA 变体,而 DeepSeek 也采用了月之暗面优化过的训练技术。不同团队通过论文、开源模型和技术实践相互借鉴,形成了与封闭模型路线不同的技术扩散机制。
与此同时,人才回流也成为另一条技术路径。腾讯招募了曾在 OpenAI 工作的两名清华毕业生,字节跳动则引入曾供职于谷歌的中国研究人员。报道认为,美国 AI 公司的技术进展、海外人才回流以及中国本土研究网络,共同加快了中国 AI 公司的追赶速度。
但算力仍是中国 AI 企业面临的主要制约。梁文锋今年 5 月表示,芯片而非人才,是中美 AI 公司之间最关键的差距。阿里巴巴、智谱等头部实验室研究人员称,他们获得的高端芯片数量往往只有 OpenAI、谷歌同行的五分之一。






