🔑Andrew Ng 的两个判断:开源正确性与人才缺口

在 Andrew Ng 与 David S. Goyer 的对话中,有两个判断对 AI4Science 的格局分析具有锚点意义。

判断一:中国的开源路径是正确的。Ng 原话:"one thing that I would not have guessed few years ago was that China would end up being much more open in the way it innovates in AI compared to the United States… China has played its hand really well leaning into the open-source openweight ecosystem." 他进一步解释:中国公司将模型作为 open weight 发布("published on the internet free for anyone to use including American companies"),这"rapidly increases the rate of diffusion of knowledge within your companies or within your ecosystem"。结果是"China leads the world in openweight models",全球(尤其是非洲等地区)广泛采用中国模型,形成软实力。

判断二:美国的人才生态正在被恐惧叙事侵蚀。Ng 指出少数 AI 公司通过游说"灭绝论""抢工作论"来推动监管壁垒,目的是保护封闭权重的商业价值。代价是"a lot of these narratives has been very damaging for America… kids turned off AI, people wanting to not use these wonderful technologies"。他举了一个真实案例:一位高中生听说"AI 与人类灭绝有关"后主动退出了 AI 相关职业路径——"she made a terrible career move"。对比之下,"in China, you hear a lot of stories being told about some young entrepreneur that worked really hard and built a solar farm and used that to power data centers"——正面的 AI 叙事激励年轻人投身其中。

这两个判断合在一起指向一个结构性结论:在 AGI 的下一程,开源路径的正确性 × 人才生态的健康度 = 长期竞争力。而 AI4Science——将 AI 用于蛋白质设计、药物发现、基因组学、材料科学——是 AGI 落地中最硬核、最需要长期投入、最依赖跨学科人才的赛道。在这个赛道上,中国的结构性优势正在积累。

📉美国封闭路径的结构性困境

要理解中国的优势,先要看清美国封闭路径的困境。Ng 在对话中揭示了三个层面的问题。

层面一:监管游说抑制创新扩散。美国少数头部 AI 公司投入巨资游说联邦和州级监管,目标是"make it difficult for anyone to publish their AI models on the internet free for anyone to use"。Ng 明确指出这是"regulatory capture attempts"——用监管捕获保护封闭权重的商业护城河。代价是开源模型发布面临法律不确定性,创新扩散被人为减缓。

层面二:恐惧叙事侵蚀人才供给。Ng 的数据:"I am hiring as many highly AI enabled software engineers as I can find… we just can't find enough of them." 不是没有需求,而是供给被恐惧叙事压缩。他对比中美叙事差异:美国讲"Terminator scary AI stories",中国讲"young entrepreneur built a solar farm to power data centers and met the true love"。结果是美国年轻人"self-selected out of AI career",中国年轻人涌向 AI。

层面三:封闭权重阻碍科学复现与迭代。这一点 Ng 没有直接展开,但在 AI4Science 领域尤为致命。科学研究的基石是可复现性。当 Nesso-1、Boltz-2、Diff-Switch 等模型开源代码与权重时(如 Valence Labs 发布 Nesso-1 的明确动机:"开源仅用公开数据训练的模型,刻意排除接触专有化学与靶点的预测优势"),全球研究者可以复现、改进、组合。而封闭模型(如某些闭源 affinity 预测服务)只能黑箱调用——无法审计训练数据偏见、无法验证边界条件、无法在内部数据上微调。在药物发现这种高风险、强监管的领域,黑箱模型难以获得监管信任。

📈中国开源路径为何在 AI4Science 上"正确"

Ng 说中国"played its hand really well",但未深入解释为何开源路径在 AI4Science 上尤其正确。这里结合技术路径做具体分析。

3.1 AI4Science 的本质要求开源

AI4Science 与通用 LLM 有一个根本差异:它的输出要被科学验证。一个语言模型可以凭流畅度赢得用户,但一个蛋白质结构预测模型必须通过实验验证——pLDDT 分数、X-ray 对齐、结合 assay。这意味着:

3.2 开源加速知识扩散——Ng 的核心洞见

Ng 指出 open weight 模型"rapidly increases the rate of diffusion of knowledge within your companies or within your ecosystem"。这在 AI4Science 中的体现尤为明显:DeepSeek、Qwen 等开源模型的发布,使中国每一个高校实验室、每一个生物技术初创公司都能以极低成本获得前沿基座模型,在其上构建科学应用。对比之下,美国研究者要么支付高额 API 费用(GPT-4/Claude),要么等待少数开源模型(Llama 系列,但 Llama 的开放程度受限于 Meta 的商业策略)。

Ng 还提到一个被忽视的事实:"all the American teams read tons of the Chinese research papers and learn from them… Tons of the techniques used by leading American teams now frankly were from research innovations learned from China." 知识流动是双向的,但中国在开源模型发布上的领先,使其技术影响力辐射全球——这正是 AI4Science 所需的"全球协作验证"模式。

3.3 开源是科学软实力

Ng 用了一个精准类比:"just as storytelling we've seen in Hollywood is an important source of soft power… AI is a key part of the supply chain of how we build a lot of software products." 在 AI4Science 领域,谁的模型被全球实验室采用,谁就定义了科学工作流的默认范式。AlphaFold2 之所以成为结构生物学的基础设施,不仅因为准确,更因为开源。中国的 DeepSeek、Qwen 正在成为通用 AI 的基础设施;在 AI4Science 专用模型上(如蛋白设计、分子生成),中国有机会复制这一路径——发布高质量开源科学模型,使其成为全球实验室的默认工具。

🧬技术路径映射:从蛋白设计到药物发现的中国卡位

结合本站已解读的技术路径,可以清晰看到中国在各关键环节的卡位与机会。

AI4Science 环节当前领先者开源状态中国机会
蛋白结构预测AlphaFold3(DeepMind/Google)权重不开源开源替代(如 Boltz-2、Chai-1 已开源;中国团队可贡献改进版)
蛋白骨架生成RFdiffusion(Baker Lab)、Proteina部分开源扩散模型+元动力学(如 Diff-Switch 思路)的开源实现
序列设计(逆折叠)ProteinMPNN、Caliby、DynamicMPNN开源多态逆折叠、ligand-aware 设计的开源改进
结合亲和力预测Nesso-1(Recursion)、Boltz-2开源粗粒度共折叠的中文社区优化;内部 assay 数据微调
分子生成与对接DiffDock、GenMol(NVIDIA)部分开源开源分子生成模型;虚拟筛选流水线整合
科学基座 LLMGPT-4、Claude(闭源)闭源DeepSeek、Qwen、InternLM 等开源基座 + 科学指令微调
蛋白质语言模型ESM-2 / ESM Cambodian(EvolutionaryScale)部分开源开源蛋白语言模型;替代 MSA 的嵌入方法

这张表的关键启示:AI4Science 的多数关键环节已经是开源的或正在开源化。这意味着中国的开源路径与 AI4Science 的技术需求天然契合——不需要"追赶闭源 SOTA",而是"在开源基础上做组合创新与领域微调"。

具体到药物发现流水线:Nesso-1 证明"粗粒度共折叠 + 公开数据训练"即可达到甚至超越 Boltz-2 精度,速度更快 10 倍。Diff-Switch 证明"扩散模型 + 元动力学"可自动生成蛋白质开关骨架。这些方法的核心算法都是公开的,中国团队完全可以在 DeepSeek/Qwen 等开源基座上,结合国内丰富的临床数据与实验能力,构建端到端的 AI4Science 流水线——这正是 Nesso-1 报告强调的"大规模微调在连续数据流上变得可行"的方向。

🎓人才偏向性:恐惧叙事的代价与拥抱叙事的红利

Ng 在对话中反复强调人才问题,这是 AGI 竞争中最被低估的变量。

5.1 美国的人才流失正在发生

Ng 的观察:"a lot of these narratives has been very damaging for America… kids turned off AI." 他举了一个令人痛心的例子:一位高中生因听说"AI 与人类灭绝有关"而主动退出 AI 职业路径。对比之下,"in China, you hear a lot of stories being told about some young entrepreneur that worked really hard and built a solar farm and used that to power data centers and because they did so well, they met the true love and guess what the young kids therefore are motivated to do."

这不是个例。Ng 进一步指出:"we're just not producing enough highly skilled software developers that know how to use AI that know AI engineering." 需求侧旺盛("I am hiring as many highly AI enabled software engineers as I can find"),供给侧被恐惧压缩——这就是美国 AI 人才市场的结构性矛盾。

5.2 中国的人才涌向 AI

中国的情形恰好相反。几个结构性因素驱动人才偏向 AI:

5.3 人才偏向性的复利效应

人才优势不是线性的,而是复利的。更多人才 → 更多开源模型 → 更低的参与门槛 → 更多人才。Ng 描述的美国困境是反向复利:恐惧叙事 → 人才退出 → 供给不足 → 企业无法扩张 → 影响力下降 → 更多恐惧叙事。

在 AI4Science 中,这种复利效应更强,因为跨学科人才的培养周期更长(需要同时掌握生物学与机器学习),先发优势更难被追平。中国如果在未来 3-5 年内培养出大批"生物+AI"交叉人才,这将成为难以被复制的护城河。

🏗️六个结构性优势点

综合以上分析,中国 AI4Science 在 AGI 时代拥有六个结构性优势点。

优势一:开源生态的正反馈飞轮

DeepSeek、Qwen、InternLM 等开源模型的全球采用,形成"发布 → 全球使用 → 反馈改进 → 再发布"的飞轮。Ng 指出这"rapidly increases the rate of diffusion of knowledge within your ecosystem"。在 AI4Science 中,这个飞轮可以扩展到科学专用模型:发布开源蛋白设计模型 → 全球实验室使用 → 发现边界条件失败 → 改进 → 再发布。每一次循环都加深中国模型在全球科学工作流中的嵌入度。

优势二:人才供给的结构性富裕

正面叙事 + 政策导向 + 开源降门槛 + 跨学科培养,共同驱动人才涌向 AI。中国每年 STEM 毕业生数量远超美国,且 AI 方向的偏好正在强化。在 AI4Science 最稀缺的"跨学科人才"上,中国的高校体系正在规模化产出。

优势三:数据基建的规模与多样性

AI4Science 的核心瓶颈正在从算力转向数据。中国在临床数据(三甲医院电子病历规模)、基因组数据(华大基因等测序能力)、化合物库(药明康德等 CRO 的化合物合成与 assay 数据)上具有规模优势。Nesso-1 报告坦承"仅用公开数据训练的模型在真实药物化学上零样本泛化是 formidable 挑战"——而中国如果能在合规框架下将内部数据用于微调开源模型,将直接填补这一泛化缺口。

优势四:算力部署的工程效率

Ng 在对话中提到一个中国叙事:"young entrepreneur built a solar farm to power data centers"——这不仅是故事,更是现实。中国在数据中心建设、绿电配套、国产 AI 芯片(华为昇腾等)上的工程化能力,使算力部署成本持续下降。AI4Science 的训练与推理需要大量算力(如 AlphaFold3 的多链复合物预测、Nesso-1 的大规模筛选),算力成本优势直接转化为实验通量优势。

优势五:从开源到产业化的短路径

中国的高校-产业协同链条正在缩短。开源模型发布后,国内 CRO、药企、生物技术公司可以快速在其上构建应用——因为有本地化支持、中文文档、合规框架明确。对比之下,美国闭源模型的 API 调用需要企业将专有数据发送给模型提供商,在药物发现这种数据敏感性极高的领域,这构成采用障碍。

优势六:全球南方的默认范式

Ng 指出"for a lot of nations that want an open alternative they're adopting Chinese models… in nations such as Africa the Chinese DeepSeek and a handful of other Chinese models are adopted very widely." 在 AI4Science 领域,全球南方(东南亚、中东、拉美、非洲)的实验室同样需要低成本、可本地部署的科学模型。中国开源模型天然适合这一市场——不要求高额 API 费用、不要求将数据出境、可本地微调。这使中国有机会成为全球南方 AI4Science 基础设施的默认提供者。

🗺️后续路径走向:三个阶段与四个抓手

7.1 三个阶段

阶段一(2026-2027):基座覆盖与工具链完善。在 DeepSeek/Qwen 等通用基座上,构建 AI4Science 专用工具链——蛋白质语言模型、分子生成模型、亲和力预测模型的开源实现。目标是覆盖本站已解读的所有关键环节(结构预测、骨架生成、序列设计、亲和力预测、分子对接),每个环节都有可用的中文开源模型。这一阶段的关键是"有"——先建齐工具箱。

阶段二(2027-2029):数据飞轮与领域微调。在工具链完善的基础上,将中国丰富的临床/基因组/化合物数据用于微调开源模型,形成"数据飞轮"——更多数据 → 更准模型 → 更多采用 → 更多数据。这一阶段的关键是"准"——在特定治疗领域(如肿瘤、罕见病、中药现代化)上建立超越通用模型的专有精度。Nesso-1 的"内部 assay 微调"路径正是这一阶段的范式。

阶段三(2029-2031):端到端流水线与 AGI 科学引擎。将各环节模型组合为端到端流水线——从靶点发现到候选化合物筛选到 ADME 预测到临床试验设计,全链路 AI 辅助。这一阶段的关键是"通"——打通从基础研究到临床应用的转化链条,使 AI4Science 从"辅助工具"升级为"科学引擎"。这也是 AGI 在科学领域的真正落地——不是替代科学家,而是使每位科学家都能调用相当于一个研究团队的计算能力。

7.2 四个抓手

抓手一:发布高质量开源科学模型。效仿 Nesso-1 的路径:仅用公开数据训练,开源代码与权重,不依赖专有嵌入。在蛋白设计(如 Diff-Switch 式骨架生成)、亲和力预测(如 Nesso-1 式粗粒度共折叠)、分子生成(如 GenMol 式 SAFE 表示生成)上,发布中国团队的开源实现。关键:每个模型都要附带可复现的 benchmark 脚本,使全球实验室能一键验证。

抓手二:建设 AI4Science 数据共享平台。在合规框架下,建设跨机构的科学数据共享平台——蛋白质结构、化合物 assay、临床基因组数据。参考 BindingDB/ChEMBL 的模式,但纳入中国独有的数据源(如中药成分数据库、中国人群基因组数据)。这是 Nesso-1 报告点出的关键瓶颈:"仅用公开数据训练的模型零样本泛化有限"——更多高质量数据是唯一解。

抓手三:培养跨学科"双语"人才。既懂生物学/化学/医学、又懂机器学习的"双语"人才是 AI4Science 的最稀缺资源。抓手包括:扩大"强基计划"中 AI+生物交叉方向;建设校企联合实验室(如药明康德+高校 AI4Science 实验室);举办跨学科竞赛(如蛋白质设计竞赛,参考 CASP/CASP16 模式但面向中国学生)。

抓手四:构建全球南方 AI4Science 联盟。Ng 指出中国模型在全球南方的广泛采用是软实力。在 AI4Science 上,可以主动构建联盟——向东南亚、中东、非洲的实验室免费提供开源科学模型、培训、算力券。这既是科技外交,也是数据回流渠道(合作实验室贡献本地数据,丰富训练集)。

⚠️仍需补齐的短板(诚实评估)

在阐述优势的同时,必须诚实面对短板——否则优势会变成自满。

📄参考信息

对话来源:Andrew Ng and David S. Goyer, "Creativity, Intelligence, and What We're Building" — 公开对话记录(SRT 字幕,约 10200 词,2026 年)。文件:sources/[English (auto-generated)] Andrew Ng and David S. Goyer Creativity, Intelligence, and What Were buil.srt

核心引述(Andrew Ng):

· "China has played its hand really well leaning into the open-source openweight ecosystem… China leads the world in openweight models."

· "It rapidly increases the rate of diffusion of knowledge within your companies or within your ecosystem."

· "All the American teams read tons of the Chinese research papers and learn from them."

· "A lot of these narratives has been very damaging for America… kids turned off AI."

· "We're just not producing enough highly skilled software developers that know how to use AI."

· "In China, you hear a lot of stories being told about some young entrepreneur that worked really hard and built a solar farm to power data centers."

技术路径参考(本站已解读文章):

· Nesso-1:粗粒度共折叠实现开源结合亲和力预测的十倍加速 — Valence Labs / Recursion,开源粗粒度亲和力模型

· Diff-Switch:用扩散模型+元动力学从头设计蛋白质开关 — UBC / Cambridge,开源骨架系综生成

· ESM Cambrian 全文深度解析 — EvolutionaryScale,蛋白质语言模型替代 MSA

· 潜空间全景综述 — arXiv 2604.02029,NUS/复旦/清华等 16 机构

中国开源模型实例:

· DeepSeek(深度求索)— 开源 LLM,全球广泛采用

· Qwen(通义千问,阿里巴巴)— 开源多模态模型系列

· InternLM(书生·浦语,上海 AI 实验室)— 开源基座模型

· GLM / ChatGLM(智谱 AI)— 开源对话模型

AI4Science 关键国际工具(对标参考):

· AlphaFold2/3(DeepMind)— 蛋白结构预测,AlphaFold2 开源、AlphaFold3 权重不开源

· RFdiffusion(Baker Lab)— 蛋白骨架生成,开源

· ProteinMPNN / Caliby / DynamicMPNN — 序列设计,开源

· Boltz-2 — 全原子共折叠亲和力预测,开源

· CASP16 / OpenBind Consortium — 国际评估基准