发生了什么
DeepMind 宣布推出 SynthID Bio,这是一系列水印方法,可标记人工智能生成的蛋白质序列并预测 3D 结构。该技术在生成过程中推动氨基酸的选择,并调整结构预测中的原子坐标,留下一个在合成中幸存下来并可以在以后检测到的信号。在针对 VEGF-A、SARS-CoV-2 刺突 RBD 和 PD-L1 的湿实验室测试中,使用 AlphaProteo 和支持 SynthID 的 ProteinMPNN 设计的水印结合物在命中率、结合亲和力和序列多样性方面与未加水印的对照相匹配。对于结构预测,DeepMind 对 AlphaFold 3 扩散网络的一小部分进行了微调,将水印嵌入到模型权重中,在保持预测准确性的同时实现近乎完美的可检测性。该公司发布了一份方法论文、开源代码和体外数据,并公开了模型权重。目前正在与生物安全团体、基因合成提供商和政策机构建立伙伴关系,对带水印的 Evo 2 设计的噬菌体的早期测试表明其功能可行性。
DeepMind 将其现有的 SynthID 水印套件(之前用于图像、视频、音频和文本)扩展到合成生物学,为蛋白质序列和结构创建了 SynthID Bio。
该方法巧妙地影响生成过程中的氨基酸选择,并调整预测的原子坐标,嵌入可在化学合成中幸存下来的可检测特征。
实验室验证涉及三个蛋白质靶点(VEGF-A、SARS-CoV-2 刺突 RBD、PD-L1)。使用 AlphaProteo 和支持 SynthID 的 ProteinMPNN 设计的水印结合物在命中率、结合亲和力和自然序列多样性方面与无水印的结合物相当。
对于结构预测,AlphaFold 3 扩散网络的一小部分经过微调,以在其权重中携带水印,从而保持预测准确性,同时即使在轻微的坐标扰动后也能实现近乎完美的检测。
DeepMind 发布了一篇方法论文,开源了代码和实验数据,并公开了模型权重,邀请生物安全、合成和政策利益相关者的合作。
为什么这很重要
合成生物学越来越依赖人工智能生成的设计,这引发了生物安全问题,因为新序列可能会逃避现有的筛选数据库。 SynthID Bio 提供自动来源信号,可以帮助合成提供商快速识别来自受信任、启用水印的模型的订单,减少手动审查瓶颈并增强“瑞士奶酪”防御策略。除了安全性之外,水印还可以通过标记人工智能生成的条目来保护蛋白质数据库等公共存储库的完整性,从而保护科学共享免受错误标签或低质量数据的影响。莎拉·卡特(Sarah Carter)和詹姆斯·迪甘斯(James Diggans)等专家强调了此类水印在简化筛选并将资源集中在值得更仔细审查的序列上的潜力。然而,这种方法并不是灵丹妙药。防止故意篡改的鲁棒性仍然是一个公开的挑战,水印的有效性取决于行业采用和补充来源元数据。
人工智能生成的蛋白质设计可以绕过传统的基于序列的威胁筛查,因为它们可能与已知的危险图案不同。 SynthID Bio 提供内置来源标签,合成提供商可以自动检查该标签,从而减少对缓慢的手动审核的依赖。
水印允许蛋白质数据库等数据库标记人工智能生成的提交内容,从而支持科学完整性,帮助维护下游研究所必需的干净、可信的公共数据。
政策专家将该技术视为主动安全层,补充了多层生物安全框架中的模型级缓解措施和客户审查。
局限性包括当前水印容易被故意删除或更改,以及需要广泛的行业采用才能充分发挥其保护潜力。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
Which component of an AI application is the machine-learning model itself?
接下来看什么
未来的工作将侧重于增强水印抵御对抗性更改的能力,并将 SynthID Bio 与 C2PA 等标准化来源框架相集成。基因合成公司的采用以及纳入监管筛选渠道将决定现实世界的影响。监测大规模蛋白质工程项目中水印设计的推出以及生物安全机构的任何政策反应至关重要。此外,即将发布的关于噬菌体水印的技术手稿将提供对该技术的基因组应用的更深入的了解。
努力强化水印以防止故意篡改,可能通过加密技术或与来源元数据标准更紧密的集成。
商业基因合成公司采用并纳入监管筛选指南,这将决定实际效果。
即将发表的关于带水印的噬菌体基因组手稿的结果,可以将该方法扩展到更大的基因组构建体。
生物安全监管机构和国际机构的反应可能会影响人工智能生成的生物数据的标准。