AI 正把生物安全推向攻防竞赛
近期围绕 AI 安全的讨论再次升温:除了网络安全,生物安全也被视为需要重点关注的领域。Radical Numerics 联合创始人 Eric Nguyen 的观点是:提升生物能力的模型,也可能成为生物防御不落后的关键工具。
从基因组语言模型到功能性病毒
Eric Nguyen 在斯坦福期间长期推动基因组语言模型(Genomic Language Models, GLMs)的研究。早期,这一方向并不容易获得生物学界认可:
- 许多人怀疑模型能否真正理解生物序列;
- 模型生成结果是否可验证并不明确;
- 其应用价值一度被认为不明显。
后来,他参与推动了 Evo 的开发,并为 Arc Institute 的 Evo 2 作出贡献。随后,另一支由 Arc Institute 与 Stanford 研究人员组成的团队使用相关模型生成了完整噬菌体基因组,并将其合成为具有功能的病毒。
这一进展说明,AI 在生物序列生成上的能力已经不再停留于“预测片段”或“辅助注释”,而是开始触及更完整的基因组设计问题。正因如此,生物安全的攻防问题也变得更加现实。
为什么长上下文对生物 AI 很重要
DNA 与自然语言不同。自然语言有庞大的词汇和复杂语义,而 DNA 的字母表极小,主要由 A、C、T、G 四种字符构成。但它的挑战在于序列极长:
- 平均人类基因约 6 万个碱基;
- 较长序列可达到约 230 万个碱基;
- 整个人类基因组约 30 亿个碱基。
因此,生物语言模型的关键能力之一是长上下文建模。只有能处理足够长的序列,模型才可能捕捉远距离调控关系、结构约束和更高层级的基因组组织信息。
据介绍,约三年前,长上下文模型方面的创新已经使这类生物建模成为可能,甚至早于主流前沿 AI 实验室大规模建设百万级上下文窗口模型。
生物安全为何像一场 AI 军备竞赛
文章提出的核心判断是:AI 会同时提升生物设计能力与生物防御能力。风险在于,如果攻击能力进步更快,而检测、归因、验证和响应工具落后,防御方就会处于被动。
这与网络安全领域有相似之处:
- 攻击方可以利用模型自动化探索大量路径;
- 防御方需要同样高效的工具来发现、分析和阻断风险;
- 若只有少数机构掌握防御能力,整体生态可能难以及时响应。
在生物领域,这种不对称可能更加敏感,因为模型生成的对象不是代码,而是可能影响真实生物系统的序列、结构或实验假设。
Radical Numerics 的方向:生物推理与多模态感知
Radical Numerics 关注的方向包括“生物链式思维”和多模态感知。这里的重点并不是简单生成序列,而是让模型更好地理解生物系统中的因果关系、结构约束与实验反馈。
可概括为三个目标:
- 跟上生物防御竞赛:当生成能力提升时,防御工具也需要快速升级。
- 辅助设计新基因组:模型可以在序列空间中提出候选方案,但必须经过严格验证。
- 获得生物学洞见:通过模型分析长序列和多模态数据,帮助研究人员发现潜在规律。
需要谨慎看待的边界
这类技术的价值与风险同时存在。它可能帮助研究者更快理解基因组、设计治疗工具或监测生物风险;也可能降低某些复杂生物操作的门槛。
因此,真正的问题不只是“模型是否足够强”,还包括:
- 生成结果如何验证;
- 哪些能力应被限制或审计;
- 防御工具是否能跟上前沿模型;
- 生物学家、AI 研究者与安全团队如何协作。
从这次讨论看,生物安全正在成为 AI 安全议题中的核心部分。随着模型从文本、代码扩展到基因组与实验数据,防御能力也必须从传统监管转向更主动、更技术化的体系。
