今天,我们正式发布了 SynthID Bio——这是一种为 AI 设计的蛋白质(生命的基本组成单元)添加水印并进行检测的方法。
我们相信,这是人类首次成功合成出既具备功能、又带有水印的 AI 设计蛋白质。这不仅是 @GoogleDeepMind 研究团队取得的一项非凡工程成就,更是我们在迈入生物学研究变革时代之际所必需的一道关键防线。
生成式 AI 正在帮助科学界设计全新的生物实体,例如借助 AlphaProteo 和 RFDiffusion 等系统设计功能性蛋白质,甚至设计噬菌体。这项强大的技术有望推动我们开发更有效的疾病疗法,但同时也存在被滥用的风险。例如,AI 生成的蛋白质可能会绕过基因合成公司使用的生物安全筛查机制,还可能污染共享的科学数据库。
多年来,我和我在 Google DeepMind 的团队一直致力于确保 AI 模型的安全性,并开发了多种解决方案来追踪生成式 AI 输出内容的来源。基于这些研究,我们推出了 SynthID——这一业界领先的方案能够在不影响质量的前提下,为图像、视频、音频和文本等 AI 生成内容嵌入不可感知的水印。目前,SynthID 已为超过 1000 亿张图片和视频、以及总时长超过 6 万年的音频添加了水印,并被 OpenAI、NVIDIA 和 Kakao 等多家重要行业合作伙伴采用。
将 SynthID 应用到生物领域是一项重大挑战。在图像、视频和音频领域,“不可感知”意味着要考虑人类的感知能力,避免出现视觉瑕疵或声音失真。但生物学截然不同。蛋白质序列不只是一串文本:它是必须在自然界中发挥作用的物理实体,会产生真实的生物学影响。只有当生成的分子保留原有功能时,水印才有意义。对蛋白质而言,这意味着它必须像未加水印的版本一样正常折叠、与细胞受体结合,并与其他分子相互作用。
借助 SynthID Bio,我们实现了有效的水印嵌入,同时保留了生物活性。我们开发了相关技术,既能对蛋白质序列添加水印,也能对其三维结构预测结果添加水印。大量测试表明,经 SynthID Bio 处理的分子在生物环境中以及针对真实治疗靶点时均能正常发挥作用。在湿实验(wet-lab)中,带水印的结合蛋白也达到了与无水印版本相当的成功率,证实了我们的系统完全符合预期。
我希望 SynthID Bio 能成为追溯 AI 生成设计的关键验证层。通过自动标记 AI 生成的蛋白质,它可以帮助合成服务商简化目前拖慢重要研究进度的缓慢人工安全审查流程。
SynthID Bio 还将有助于保护公共科学资源。像 AlphaFold 这样的突破依赖于干净的公共数据库(如 Protein Data Bank),而这些数据库正面临被海量 AI 生成预测数据污染的风险。通过过滤掉这些错误分类的内容,SynthID Bio 能够确保我们的共享数据库和未来算法保持准确,避免混入被误标的预测数据。
我们正在持续改进 SynthID,并将其扩展到更多生物模态。作为早期成果之一,我很高兴地分享:在与斯坦福大学和 Arc Institute 的 Hie 实验室 的合作中,我们已经将 SynthID Bio 扩展应用于为 Evo 2 设计的噬菌体基因组添加水印。细菌培养环境中的初步实验显示,我们的水印方法能够保留噬菌体的功能。这是一个重要的早期里程碑,也是一次极具前景的技术概念验证,我们期待尽快向科学界分享更多细节。
制定有效的生物来源标准应当是一个协作过程。正如我们在 AlphaFold 数据库上的工作一样,我们正与科学界和生物安全界携手合作,共同开发这些技术。作为第一步,我们将发表方法论文、开源代码和体外(in vitro)数据,并向研究社区开放模型权重,以便充分发挥这项工作在生物安全方面的价值。
我们正步入一个新时代:生物学正在从一门观察性科学,转变为一门我们可以负责任地进行工程的学科。单靠水印无法彻底解决生物安全问题,但它是迈向更安全、更具韧性世界的重要一步。我始终认为,衡量进步的标准不应仅仅是我们能建模的生物结构的复杂度或其潜在影响力,还应包括我们在引导这些不断发展的能力时所展现出的远见与责任感。
阅读我们的博客:https://deepmind.google/blog/introducing-synthid-bio/ 和技术论文:https://www.nature.com/articles/s41586-026-10965-y





