生物药FTO专利检索:序列比对与侵权风险判断实操指南

发布时间:2026/9/12 16:13:48
生物药FTO专利检索:序列比对与侵权风险判断实操指南
做生物药研发的朋友对 FTO 这三个字母应该不陌生。我接触过不少项目团队候选分子做到药理药效很满意了送 CMC 之前一查发现核心序列早就落进一张权利要求里了。那种感觉就像房子盖到二层突然被告知地基是别人家的地。生物药里的 FTO 专利检索和化学药完全是两套玩法。化学药看结构通式看 Markush 权利要求用关键词加分类号基本能扫出个轮廓生物药的核心是序列是 SEQ ID NO是 CDR 区是一长串氨基酸之间的关系。光靠关键词检索你会发现漏得离谱。所以这行的基本功是把序列比对当成检索的锚点再往后做侵权风险评估。这篇文章我不讲教科书理论按实操走一遍思路。适合三类人看药企 IP 部门的同行、研发做到一定阶段需要自检的项目负责人以及刚转入生物医药专利领域的代理人。读完你至少能理清一套可落地的流程序列怎么提、比对怎么做、命中之后怎么判断风险、报告怎么写才不挨骂。1. 生物药FTO到底查什么先分清底层逻辑1.1 小分子FTO和生物药FTO检索思路差在哪小分子药物的权利要求核心是化学结构。无论写马库什通式也好写具体化合物也好侵权判断时核心是比对结构是否落入通式范围。检索时用结构式检索、关键词加 IPC 分类号组合基本上能把大部分风险专利捞出来因为化合物结构的表达是相对封闭的化学命名有规则分类号也相对集中。生物药完全不是这个逻辑。一个抗体药物权利要求里经常出现的是包含 SEQ ID NO: 1 所示的重链可变区、其 CDR 分别如 SEQ ID NO: 2~4 所示、与 SEQ ID NO: 5 具有至少 90% 同一性的多肽这类表达。序列的表达不像化学结构式那么精确穷举同源变体、保守取代、人源化改造后的序列都可能被一张权利要求涵盖。如果不做序列比对你只拿关键词搜要么什么都搜不到要么搜出大量不相关的专利然后又漏掉最关键的那几张。还有一个容易被忽略的差别生物药的外围专利特别密。序列权利要求只是核心周边还有表达载体权利要求、宿主细胞权利要求、纯化工艺权利要求、制剂配方权利要求、适应症用途权利要求。所以生物药 FTO 从来不是比对完序列就完事比对只是打通了第一关后面还要把链路的其他环节一并排查。1.2 项目哪个节点必须触发FTO检索我见过两种情况一种是什么时候都不查最后撞到枪口上另一种是立项第一天就要求做全套 FTO结果数据还不稳定做出来的结论过两个月就作废了。这两种都不对。FTO 检索应该在合适的节点滚动推进而不是一锤子买卖。我的经验是至少有三个节点必须触发。第一个节点是候选分子初步锁定的时候。这时候序列已经基本定下来药理药效数据开始跑投入还不算大。这个阶段的 FTO 可以做得稍微粗一点主要看核心序列有没有踩到明显的高风险专利目的是用低成本淘汰掉最危险的分子。很多团队在这一步省掉了等到 IND 申报前才来做一旦发现问题前期全部白做非常痛。第二个节点是 IND 申报前。这个阶段的 FTO 必须完整、严谨覆盖核心序列、相关平台技术、生产细胞株、制剂和用途还要看目标国家的专利状况。我通常建议在正式提报前 6 个月启动留出时间处理风险专利的评估和规避设计。第三个节点是进入新市场或者扩展适应症的时候。同一个分子去不同国家做临床试验和上市FTO 结论是不同的因为专利有地域性。扩展新适应症也可能触发新的用途权利要求风险别拿老报告应付新场景。2. 用序列比对评估侵权风险参数和工具怎么选2.1 为什么序列比对比关键词检索更靠谱回到基础逻辑。FTO 要回答的核心问题是我这个分子的序列会不会落入别人有效专利的权利要求范围这个问题的判断依据是序列的相似程度而不是分子叫什么名字。比如一个抗体专利里并没有写PD-1 抗体这种关键词只写了一串 SEQ ID NO 和 CDR 序列你用关键词搜根本搜不到但序列比对一跑结果直接撞上。序列比对的关键是把候选序列和专利数据库里的序列做相似性搜索找出同一性高的专利序列再回到专利文本读权利要求。这个逻辑本质上是在用序列空间做检索而不是用文字空间做检索。生物药的权利要求核心就是序列限定所以序列比对自然成为 FTO 里最高效的手段。当然这不意味着关键词检索完全没用。实际工作中序列比对用来抓核心序列风险关键词检索用来补充抓外围风险比如包含抗某靶点抗体的药物组合物用于某疾病治疗的抗体这类用途限定就必须靠关键词和分类号来查。两种方法配合使用才能把风险面覆盖完整。2.2 免费库和商业库搭配覆盖度才够看真正做过生物药 FTO 的同行应该知道公共数据库能做的事情其实是有限的。但我不建议一上来就否定免费渠道初筛阶段完全可以靠它们跑通流程只是要清楚边界在哪里。公共免费层面主要能用到的是 NCBI 的专利序列库、WIPO Patentscope 里的序列信息、EPO 的线上查询工具以及各个专利局公开的全文数据库。NCBI 上可以选择专利patented序列数据集跑 BLAST宿主上会返回专利号、序列标识这个信息量足够做初步判断。需要注意公共库的专利序列收录并不完整尤其一些比较早的专利或者某些语言的专利序列化提取质量参差不齐漏检是常态不是例外。商业库层面通常用的是专门的生物序列检索平台比如 SequenceBase、GenomeQuest 这类它们会从全球主要专利局数据库里批量提取序列格式统一更新也比较及时还能做多序列批处理和家族去重。商业平台也不是全知全能但覆盖率比公共库好很多关键时候能救命。我的建议是平时维护一个标准检索流程初筛用免费库跑一旦进入 IND 申报前阶段至少在商业库里拉一遍完整的序列检索。这里有个细节需要提醒大家很多人在 NCBI 上跑完专利库看到结果不理想就觉得安全了。这个想法非常危险。专利序列比对结果依赖于数据库里到底收录了什么而公共库对专利序列的覆盖存在明显的灰区。要记住检索没命中不等于风险不存在只能说明在你检的这个数据库范围里没有发现明显命中。2.3 同一性阈值、E值、覆盖度参数就是风险边界序列比对里最常被问到的问题就是阈值设多少同一性到多少应该警觉这个问题没有标准答案因为权利要求写法不同对应的敏感度也不同。如果权利要求写的是包含 SEQ ID NO: 1 所示序列的抗体这种限定严格序列比对命中同一性极高时风险才大。如果写的是与 SEQ ID NO: 2 具有至少 95% 同一性那你要把阈值压到 95% 以下一点点都不行。如果写的是 CDR 区序列那对短序列尤其是 CDR1、CDR2、CDR3 的比对要格外小心同一性阈值要放得更宽一些因为 CDR 本身很短两三个氨基酸差异就可能让同一性从 90% 掉到 70%但它仍然可能构成等同侵权。我自己的经验值为参考不构成绝对标准具体情况要看权利要求上下文全长抗体序列同一性 85% 以上必须重点分析CDR 区序列同一性 70% 以上就要警觉单链抗体、融合蛋白这类嵌合序列看分段命中情况关键功能域命中比全长同一性更重要E 值方面初筛用 1e-5短序列要放宽到 1e-2 甚至更低因为短匹配的 E 值天然会高。还有一个容易忽略的参数是 coverage也就是比对覆盖度。有时候全长序列同一性只有 60%但其中某个 CDR 区 100% 命中这就不能只看全长数据了。反过来全长同一性有 90%但差异位点全落在框架区CDR 完全不一致风险等级反而要下调。序列比对里最重要的问题不是整体像不像而是关键功能区域有没有被覆盖。3. 完整跑一遍候选抗体FTO实操记录3.1 序列集合整理别漏掉CDR和恒定区以一个典型的 IgG 型候选抗体为例我来说说怎么整理序列集合。很多人一上来就把整个重链和轻链全长丢进 BLAST这是不够的。首先序列集合至少要拆成以下几类重链全长、轻链全长、重链可变区 VH、轻链可变区 VL、HCDR1/2/3、LCDR1/2/3、Fc 区以及如果有修饰的铰链区和可变区分别单列。为什么这么拆因为专利权利要求里对序列的引用粒度非常不一样有的引全长有的引 VH/VL有的单独引 CDR。如果你只比全长短序列命中容易被掩盖掉。把序列拆到 CDR 粒度能有效规避这个问题。我实操时会用 Biopython 之类的工具批量处理把每个序列整理成规范 FASTA 格式命名带上项目代号、分子类型、序列区域和版本号。这个习惯非常重要。有一次我处理一批 bispecific 抗体序列因为命名不规范比对结果里分不清哪条序列是哪个结构的后面全是混乱的又重跑了一遍。序列集合管理做不好后续所有工作都在沙子上盖楼。同时序列集合里要包含用于对照的模板序列。比如人源化改造前的鼠源亲本序列、种系序列这些序列有助于判断某专利的序列覆盖范围到底是针对人源化序列还是鼠源序列对后续分析很有帮助。3.2 分轮检索先专利序列库再全文库序列准备阶段完成后开始检索。我一般采取分轮策略。第一轮先跑专利序列库的 BLAST。以 NCBI 为例选择专利蛋白数据库对每个序列挨个做 blastp。对于大序列全长链跑常规模式对于小片段 CDR调短序列模式或者手动指定参数避免被默认过滤条件吃掉短命中。如果你在商业平台上操作这一步就是把 FASTA 文件批量提交平台会自动返回专利号列表和序列命中细信息。第二轮把命中结果里的专利号全部提取出来去重形成候选专利清单。这一步非常关键因为一个专利族可能对应多个专利号同一序列也可能命中多个不同专利。清单去重后按命中片段的同一性和覆盖度排序优先读高风险专利。第三轮用关键词在专利全文库里补充检索。序列比中管的是序列权利但 FTO 覆盖的范围更广。我会针对靶点名称、适应症、给药方案、制剂组成、细胞株、表达载体、纯化方法等分别设计检索式在目标地区的专利数据库里做全文检索把外围风险补进来。三轮检索做完再汇总为风险专利清单进行逐篇分析。这样的流程能保证不漏也方便追溯。3.3 命中之后的侵权判断看权利要求的具体限定序列比对命中以后真正的重头戏才开始读权利要求做侵权风险判断。举个例子候选抗体序列和某专利中的 SEQ ID NO: 5 同一性达到 88%。这个数字看着挺高但你要去看这条权利要求到底怎么写的。如果权利要求写的是一种分离的抗体其包含与 SEQ ID NO: 5 具有至少 95% 同一性的氨基酸序列那 88% 就不落入字面侵权范围接下来要评估的就是等同侵权风险。如果权利要求写的是包含 SEQ ID NO: 5 所示 CDR或者包含由 SEQ ID NO: 5 编码的 CDR那就必须看 88% 的同一性落在哪里差异位点是在 CDR 上还是在框架区。我的做法是画权利要求要素拆解表也就是 claim chart。每一列是权利要求的技术特征每一行是用候选分子对应特征做的比对说明。这样能很清楚地看出哪些特征完全对应哪些存在差异差异是否构成实质性改变。很多 IP 新人容易在这里犯一个错误看到同一性高就下高风险结论看到同一性一般就下低风险结论而忽略了功能限定和结构限定之间的复杂关系。同一个序列一个权利要求限定结合特定抗原表位另一个只限定包含该序列风险评估结论可能完全不同。除此之外还要看专利状态专利是否授权、是否有效、是否还在保护期、在哪些国家有效。如果只是一件公开但未授权的申请风险要往后放如果授权但已经快到期风险窗口也就变短了。3.4 FTO报告怎么写得让研发一眼读懂FTO 报告的受众通常是研发负责人、项目负责人甚至管理层他们不是专利律师最关心的是三件事能不能做、能不能晚点再做、要是不能做怎么办。所以报告写得透彻比写得厚更重要。我的报告结构一般是四块。第一块是结论摘要按分子区分标注高风险、中风险、低风险只留两到三句话说明核心原因。第二块是检索过程说明序列版本、数据库范围、检索日期都写清楚强调时效性。第三块是命中专利和权利要求分析附上 claim chart 和必要的序列对齐信息。第四块是建议动作比如进一步技术比对、设计规避方案、请求律所出具法律意见、或者和专利权人谈许可。有一条经验我特别想分享报告里不要只写存在高风险这种结论就结束。研发看到这种话基本是崩溃的因为他们不知道下一步该怎么办。我会把高风险专利拆到具体权利要求指出到底是哪些序列区域有冲突是 CDR 还是恒定区有没有办法通过替换几个残基来规避。给出方向性的规避思路哪怕只是初步建议研发就能顺着往下走。这是 FTO 工作最有价值的部分。4. 常见检索漏点与排查技巧实录4.1 同义突变和保守取代造成的盲区做 DNA 层面比对的人会发现一个头疼的问题有时蛋白序列同一性很高但 DNA 层面 blastn 命中的分数不高甚至完全比对不上。原因是遗传密码冗余同一个氨基酸可以由多个密码子编码DNA 序列五花八门。如果你的候选序列是用 DNA 形式保存的检索时不要只跑 blastn一定要加跑蛋白层面的比对也就是把 DNA 翻译成氨基酸再跑 blastp。必要的情况下把 DNA 比对换成 tblastx在翻译层面同时比对六个阅读框避免漏掉。保守取代也是常见盲区。一个专利权利要求如果写的是包含一个或多个保守氨基酸取代的变体意味着同一性稍低但仍然可能属于保护范围。比如某些抗体框架区的序列同一性跌到 80% 以下但替换的残基在理化性质上高度相似仍可能被认定属于说明书支持的范围。这种情况下只做序列同一性计算是不够的要看专利说明书里对保守取代的定义和落点。4.2 比中不等于侵权没比中不等于安全这条听上去像废话但实操中翻车次数最多的就是这一条。比中不等于侵权。序列命中很可能是某专利里的现有技术背景序列、纯化标签序列、或者其他与权利要求保护范围无关的区域。比如你比到了一个融合蛋白的接头序列但权利要求里明确限定的是完整的融合蛋白结构你的候选分子只是恰好用了类似的接头这样的命中不会直接构成侵权。解读命中的第一步是先搞清楚这条序列在权利要求里扮演什么角色是限定的核心还是描述性的存在。没比中不等于安全。漏检的风险主要有三个数据库覆盖不全、权利要求中的同源变体表述覆盖了你但序列比对没体现、以及外围权利要求根本没有序列限定。比如某些权利要求用竞争性结合同一表位这种功能限定来定义抗体序列比对完全可能没问题但如果你的抗体和某专利的抗体结合同一个表位照样可能被主张侵权。所以序列比对是 FTO 的必要条件不是充分条件功能限定和外围专利必须靠其他检索手段补上。4.3 翻完序列再看这些权利要求别等撞了才知道很多团队做完序列比对就收工了这是 FTO 里最大的一张漏斗。漏掉的东西里最常见的是以下几类表达系统相关专利。CHO 细胞表达系统、某些启动子元件、信号肽序列都存在大量有效专利。你用的宿主细胞如果恰好覆盖在某个专利权利要求里即使抗体序列完全原创生产工艺上依然可能踩雷。这类风险序列比对是查不出来的要单独做关键词和分类号检索。制剂相关专利。生物药制剂配方也是一个高风险区pH 缓冲体系、表面活性剂、稳定剂的组合如果有人已经把包含特定缓冲液和表面活性剂的抗体液体制剂写成了权利要求你的处方设计就可能落进去。制剂专利往往和序列没关系序列 FTO 做完还要单独做制剂 FTO。联合用药相关专利。如果你的研发目标涉及联合用药比如抗体加小分子抑制剂、双抗组合方案那么组合相关的权利要求也必须纳入排查。这种权利要求经常用包含治疗有效量的 A 和 B 的药物组合这种写法单独看 A 和 B 都没有问题组合起来反而出风险。4.4 地域、期限有效性和专利家族最后核一遍最后一道关是地域和有效期限的核查。这项工作听起来琐碎做不好却会让前面的所有工作白费。同一件专利在不同的国家“命运各异”有的国家授权了有的国家还在审查中有的国家已经驳回了还有的国家虽然授权但被第三方无效过一部分权利要求。所以 FTO 判断必须按国家逐个拆。比如一件美国专利有保护但如果你的目标市场主要在中国和欧洲这件美国专利对你当前的推进计划影响就没那么大。当然全球布局的企业可能还是会在意因为跨国申报迟早要覆盖到不同区域的市场。专利有效期的计算也要小心。专利期限不是简单地从申请日算二十年就完了很多国家有期限调整或者补偿制度。一些生物药专利经过补偿后实际保护期会延长。如果计算有效期时没有考虑这些情况风险评估就会产生偏差。我一般会在报告里标注本结论基于检索截止日的法律状态后续需在关键节点重新核查。在整个专利检索和侵权风险评估的过程里我最深的体会是FTO 检索拼的不是某个单一工具或者单一数据库的神通拼的是流程的系统性和判断的严谨度。序列比对帮你找到可能的雷权利要求解读帮你确认雷在哪个范围地域和时效核查帮你判断这个雷还有多久会爆。这几年做生物药 FTO 案例越多我越觉得前期投入特别划算。研发团队多付出一周时间做 FTO 初筛可能就避免半年后整个项目方向性的返工。对于 IP 从业者来说FTO 报告也不是交完就结束的文件它会随着项目的推进不断迭代。我给自己定的习惯是每次序列版本更新都顺手跑一遍初筛比对哪怕只是简单记录差异也能让最后集中处理的时候轻松不少。希望这篇实操梳理能给同行和研发伙伴一点参考。