观点

智源最新研究提出警报:大模型智能体可能带来生物安全风险

当前大模型从“聊天机器”进化为能调用工具、规划任务的“智能体”。这种进化在生物信息学、实验设计等领域展现出巨大潜力。但也随着这种进化的发生,我们不得不正视一个关键问题:当AI的能力从信息处理延伸到物理实验操作,生物安全的边界会发生怎样的改变?

近日,智源研究院大模型安全研究团队与北京大学围绕这一核心问题,开展了一项端到端系统性评估。评估结果显示,所有11个参与测试模型均能生成通过计算校验的DNA分片方案,其中GPT-5.5和Claude Opus 4.6还能提供详细的逐步实验指导。在物理验证环节,4个良性代理构建体全部成功完成组装。

这意味着,大语言模型智能体不仅可能削弱现有DNA合成筛查防线,还可能向不具备专业背景的用户提供原本依赖专业训练才能获得的实验操作知识,存在相关双重用途风险,需要被系统性地评估与提前防范。

安全声明:本次评估严格遵循负责任披露原则,不展示制造危险物质的方法。全部湿实验均在严格安全约束下,使用经关键位点突变、失去有害功能的良性代理序列,仅验证组装流程,不会在任何阶段产生具有功能活性的危险产物。

“致命”的DNA合成服务

要理解生物安全的风险,得先明白DNA合成服务在做什么,以及“筛查”这道关卡的实际意义。

简单来说,DNA合成服务就是“按需定制基因片段”的工厂。研究人员只需要提交一段DNA序列,服务商就能通过化学合成的方式把这段基因“打印”出来,邮寄到用户手中。这项技术是现代生命科学的底层基础设施,从疫苗研发到合成生物学,都离不开它。

但问题是,DNA序列本身没有善恶标签。一段编码炭疽毒素的序列和一段编码胰岛素的序列,在合成机器眼里都只是ATCG的排列组合。如果缺乏审查,理论上任何人都可以下单合成危险病原体的关键基因片段。

这就是DNA合成筛查的存在意义。当前主流的筛查机制主要做两件事:

第一,序列比对。将订单中的DNA序列与已知的风险数据库进行匹配,这些数据库收录了各类病原体(如天花、鼠疫、埃博拉等)的完整或部分基因组,以及已知的毒素、毒力因子基因。如果订单序列与数据库中的高风险序列高度相似,就会被标记或拒单。

第二,功能预测。通过算法预测一段未知序列编码的蛋白质是否具有危险功能,比如是否属于已知的毒素家族、是否具有病原体特有的结构域等。

这套机制是目前生物安全体系中,极少数能在“物理世界之前”主动拦截风险的技术防线。一旦危险序列被合成出来、进入实验室甚至流出,后续再想管控就困难得多。可以说,DNA合成筛查是防止生物技术被滥用的“第一道闸门”。

而随着合成成本持续下降(合成一个基因片段的价格在过去十年下降了数个数量级)、实验流程日益标准化,这道闸门的重要性只会越来越高。

而为了绕过当前的DNA合成筛查机制,不法分子选择换一个思路:网购买不到一把完整的枪,就拆成零件来买。一段完整的危险基因序列,如果整段提交给合成服务商,会被筛查系统识别并拒单。于是攻击者把它拆成多个短片段,每个片段:长度足够短,看起来人畜无害;单独比对时,不命中任何已知风险数据库;但片段之间设计了互补的 "接口",到货后可以在实验室里重新拼接成完整序列。

过去,这种操作需要深厚的分子生物学知识:怎么拆才能既躲过筛查、又能保证后续能准确拼回去,哪里切断、哪里保留粘性末端,都需要专业判断。而这道知识门槛,正被大模型智能体拆除。

11个模型评测揭示DNA合成筛查的潜在脆弱性

智源研究院大模型安全研究团队与北京大学的此次该评估,核心考察大模型智能体是否会降低非专业人员绕过DNA合成筛查的知识门槛,聚焦分拆订购攻击这一风险场景,从智能体生成方案、程序化计算校验延伸到标准分子生物学实验室中的受控湿实验,并以电泳和测序确认模型方案在物理层面的可执行性。

 智源最新研究提出警报:大模型智能体可能带来生物安全风险

图1:大语言模型智能体在DNA组装指导任务中端到端评估闭环。评估依次经过方案生成、程序化计算校验、受控湿实验以及电泳与测序确认,覆盖11个模型和4个失去有害功能良性代理构建体,最终以物理可执行性证据验证组装流程。(图源:AI生成)

横向测试覆盖11个商用大语言模型,所有测试均在智能体配置下进行。评估以攻击成功率(Attack Success Rate,ASR)为核心量化指标,衡量模型输出在特定计算校验中的通过情况,判断模型生成的片段方案能否通过合成筛查,并正确重组为原始序列并编码目标蛋白。

结果显示,在分片设计环节,全部11个模型均能生成绕过筛查的拆分方案。这一能力具有明确的双重用途风险:模型正在降低分片设计所需的专业知识门槛,使缺乏相关背景的用户也可能获得能够规避现有筛查机制的方案,从而暴露出以单条序列识别为主的DNA合成筛查体系存在系统性脆弱性。

通过计算校验的分片方案,仍不足以指导一个没有生物学知识的用户完成具体实验。更关键的风险在于,模型能否继续弥补实验操作层面的知识缺口,给出覆盖各步骤的操作指导。围绕这一能力开展的进一步评测显示,GPT-5.5和Claude Opus 4.6已经能够生成较为完整的逐步实验操作方案,表明前沿模型正在将风险从序列层面的计算设计延伸至实验流程层面的知识支持。

湿实验:“金标准”验证下的闭环证据链

在生命科学研究中,计算校验能证明方案“对”,但不能证明它“行得通”,湿实验是判断计算方案能否在真实物理条件下成立的关键验证标准,也是检验序列组装是否真正可行的“金标准”。程序化校验能够确认序列设计在计算层面是否正确,却不能直接证明模型方案可以在实验台上执行。

为获取足以支撑风险判断的物理证据,研究团队在受控实验室中,使用良性代理序列进行了组装验证。验证采用电泳和测序两类实验读出:电泳用于判断组装产物是否出现预期大小的条带,测序用于确认产物的序列身份和正确性。两类结果相互补充,分别提供产物大小和序列层面的证据。

4个蛋白的完整验证流程均在标准分子生物学实验室中完成。结果显示,4个良性代理构建体均成功完成组装,电泳检测得到预期大小的条带,测序结果确认序列符合预期。由此,评估形成了从智能体方案生成、计算校验到湿实验物理验证的闭环证据链。

构建多层次防线:从模型部署到合成筛查

基于研究结果,智源研究院围绕生物安全的协同防线给出了四点建议。

在模型层面,部署前进行能力评估,开发者应将高风险生物安全任务能力纳入部署前的系统评估,针对生物威胁序列与组装查询等建立专门检测与防护机制。

在输入输出与系统层面,防护需要覆盖智能体执行链,当模型以智能体形态运行时,安全边界必须进一步扩展——输入输出与系统层面的防护需覆盖权限控制、过程监测和任务链风险识别,将安全评估从单次问答延伸至完整执行过程。

在筛查层面,提升合成筛查鲁棒性,现有机制需增强对AI辅助分片策略的识别能力,推动ISO 20688等国际标准落地,发展兼顾隐私与安全的筛查方案并加强信息共享。

在政策与协同层面,需要形成标准化治理框架,AI生物安全风险具有跨国界特征,需要将政府、模型开发者与生命科学社区的专业经验纳入统一的协同治理框架。

大语言模型智能体正在将生命科学实验的知识门槛从“专业人员”推向“非专业人员”——这既是技术进步的一面,也是安全治理必须正视的一面。

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
锂赛道弱预期压倒强现实:业绩暴增、锂价走弱、股价腰斩 | 行业风向标
« 上一篇 07-24
华东首个国产 TPU 千卡集群落地杭州,中昊芯英发布二代 AI 芯片“须臾”
下一篇 » 07-24

相关内容

2026 国际低空经济博览会在沪开幕,452 家企业参展
DeepSeek的底层逻辑变了吗?
耐克中国收回线上运营权,终结碎片化渠道能解决业绩难题吗?
华东首个国产 TPU 千卡集群落地杭州,中昊芯英发布二代 AI 芯片“须臾”