如何将人工智能设计的肽提交给 CDMO: 交接手册

如何将人工智能设计的肽提交给 CDMO: 交接手册

如何将人工智能设计的肽提交给 CDMO: 交接手册

生成人工智能从根本上改变了肽的从头发现. 深度学习架构(从 RFdiffusion 和 ProteinMPNN 到 AlphaFold3 和 ESM3)现在可在几分钟内生成数万个候选结合序列. 然而, 持续的瓶颈威胁着计算药物发现管道: 这 AI 到工作台的切换.

如何将人工智能设计的肽提交给 CDMO: 交接手册

计算模型通过骨架几何形状评估肽, 预测结合能, 和结构性信心. 合同开发和制造组织 (CDMO), 相比之下, 通过固相化学评估相同的序列, 溶剂溶解度, 保护基团动力学, 和纯化率. 当计算命中作为没有物理上下文的纯 FASTA 文本字符串传输到 CDMO 时, 合成失败率急剧上升.

最近的 金斯瑞与 Tamarind Bio 合作 凸显重大产业转变: 将基于云的人工智能设计平台直接连接到外包湿实验室验证服务. 将 Tamarind Bio 的分子设计模型套件与 GenScript 的自动化实验室功能集成到 Tamarind Assay Portal 中,开创了数字到物理工作流程的先例.

如何将人工智能设计的肽提交给 CDMO: 交接手册

利用这种自动化连接, 生物技术R&D队, 主要研究人员, 和过程化学家需要标准化的提交协议. 本手册概述了技术要求, 硅过滤器中的预合成, 故障模式缓解措施, 以及必要的验证分析,以降低人工智能设计的肽序列移交给 CDMO 合作伙伴的风险.


1. 超越 FASTA 文件: 基本 CDMO 提交元数据

提交简单的线性氨基酸字符串 (例如, ACDEFGHIKLMNPQRSTVWY) CDMO 是合成延迟和意外分析失败的主要原因. 生成模型经常引入不寻常的主干拓扑, 致密的疏水斑块, 或标准固相肽合成的非天然二硫键连接 (统计软件) 协议无法自动处理.

确保化学翻译准确, 完整的提交包必须包含四个不同的元数据支柱.

如何将人工智能设计的肽提交给 CDMO: 交接手册

人工智能设计输出 (PDB / JSON)

  1. 设计出处 & 模型上下文 (模型架构, 种子, LDDT, PAE)
  2. 计算评分指标 (结合ΔG, 现在, 溶剂化能)
  3. 化学 & 结构性限制 (常闭封盖, 环化, 非规范 AA)
  4. 目标规格 & 使用案例 (纯度≥98%, 数量, 无菌要求) 标准化 CDMO 工单包

药丸 1: 设计起源和生成环境

CDMO合成工程师需要了解序列是如何生成的. 模型来源揭示了内在的结构假设:

  • 模型架构和版本: 指定序列是否源自 RFdiffusion, AlphaFold-多聚体, 蛋白质MPNN, ESM折叠, 或集成模型.
  • 发电参数: 记录随机种子数, 温度设置, 和设计偏差 (例如, 强制疏水界面填料).
  • 每个残留物的置信度分数: 包括本地 pLDDT (预测的局部距离差异测试) 整个序列的分数. 具有低 pLDDT 区域的序列 (< 70) 通常对应于在纯化过程中表现不可预测的柔性环或未折叠片段.

药丸 2: 计算评分指标

  • 预测对齐误差 (PAE): 提供靶标结合肽的界面 pAE 值,以突出显示关键的接触残基.
  • 结合自由能 (ΔG): 包括计算出的静电和范德华界面分数.
  • 溶剂可接触表面积 (现在): 详细疏水性与. 极面暴露.

药丸 3: 化学和结构限制

  • 终端修改: 明确定义 N 端封端 (例如, 游离胺, 乙酰化, 焦谷氨酸) 和 C 端封端 (例如, 游离酸, 酰胺化).
  • 环化架构: 指定环肽的精确原子连接——头尾酰胺键, 侧链与侧链内酰胺桥, 或特定的半胱氨酸二硫键对.
  • 非规范残基: 详细了解所有 D-氨基酸, β-氨基酸, N-甲基化残基, 或翻译后修饰 (例如, 脂化, 磷酸化, 聚乙二醇化).

药丸 4: 目标规格及应用范围

  • 所需的纯度水平: 原油, ≥85% (筛选), ≥95% (体外生物测定), 或≥98% (活 / IND支持研究).
  • 数量规模: 毫克级 (1–10 mg 用于初始结合筛选) 高达克/公斤规模 (试生产).
  • 无菌要求: 指定材料是否需要按类别制造 100 洁净室环境可防止细胞检测过程中的内毒素和生物负载污染.

标准化提交文件架构

简化数字化摄入, 以三种标准化格式准备数据:

如何将人工智能设计的肽提交给 CDMO: 交接手册
文件格式 主要信息内容 CDMO 运营目的
禁食 / 纯文本 单字母AA代码, 序列号, 终端修改 初始自动序列解析器和长度验证
PDB / 毫米CIF 3D 原子坐标, 骨干二面体, 二硫键 结构导向, 3D 空间约束验证
JSON 有效负载 型号出处, pLDDT/PAE 阵列, 计算肉汁, 等电点, 目标规格 有计划地纳入 CDMO 企业资源系统
CSV / TSV批次 多候选表 (ID, 顺序, 纯度, 规模, N 项, C项, 修改) 高通量合成工单批量处理

对于小费: 始终包含 3D 坐标文件 (.pdb 或者 .cif) 与环状或多二硫键肽的线性序列一起. 在选择固体支持树脂之前,自动化 CDMO 解析器使用 3D 文件来确认半胱氨酸配对图.


2. 预合成硅分类过滤器

生成模型主要针对目标结合亲和力进行优化. 在这样做的过程中, 它们经常产生化学上不可能或极难合成的非物理序列. 发出采购订单之前, 通过多参数计算机筛选级联对候选人进行筛选.

原始 AI 命中池 (10,000 候选人)

筛选 1: 肉汁亲水性 (-0.5 到 +0.2) 通过滤波器 2: 净费用 & 等电点 (|净费用| ≥ 2 在pH值下 7.4) 通过滤波器 3: CamSol 固有溶解度评分 (> -1.0) 通过滤波器 4: TANGO β-折叠聚集倾向 (< 5%) 通过综合就绪候选池 (100 高收益热门歌曲)

1. 肉汁 (亲水性总平均值)

GRAVY评分计算所有氨基酸的亲水性值的总和除以序列长度.

  • 最佳范围: -0.5 到 +0.2.
  • 高风险门槛: 分数超过 +0.4 表明严重疏水性. 这些肽在 SPPS 过程中倾向于聚集在树脂上,并且表现出可忽略不计的水溶性.

2. 等电点 (等电点) 和净费用

肽在其 pI 附近携带最小的净电荷, 导致自缔合和沉淀.

  • 规则: 计算生理 pH 值下的净电荷 (酸碱度 7.4). 确保净电荷至少 +2 或者 -2. 如果净电荷介于 -1 和 +1 并且该序列包含疏水性斑块, 在非结合末端插入增溶赖氨酸或谷氨酸 (例如, 添加 KDK 或 EEE 标签).

3. CamSol 固有溶解度评分

CamSol 评估局部氨基酸疏水性, 收费, 和二级结构倾向.

  • 临界点: 正分数表明内在溶解度高. 以下序列评分 -1.0 应标记为序列优化或专门的增溶手柄.

4. TANGO 聚合倾向

TANGO 计算未折叠肽段形成分子间 β-折叠聚集体的倾向.

  • 临界点: 显示 TANGO 聚合分数的任何序列片段 > 5% 代表链伸长期间树脂上聚集的高风险.

5. 序列基序扫描

在提交之前标记并修改有问题的序列模式:

  • 连续疏水运行: $> 3$ 连续疏水残基 (例如, 旅游局, LLL, FIW, 国际青年联合会) 触发快速 β-片层堆积.
  • 天冬酰亚胺倾向二肽: 总干事, DS, 和, 和 DN 基序在基本 Fmoc 脱保护条件下进行侧链环化,形成天冬酰亚胺副产物.
  • 多个半胱氨酸簇: 未受保护的半胱氨酸间隔少于 2 氨基酸使选择性保护基团去除变得复杂.

定量合成前筛选框架

分类指标 通过范围 警告 / 警告范围 失败 / 重新设计范围 主要故障风险
肉汁指数 -0.5 到 +0.2 +0.2 到 +0.4 $> +0.4$ 树脂上聚集, 水不溶性
净费用 (酸碱度 7.4) 收费 ≥ 2
卡索尔评分 $> 0.0$ $0.0$ 到 -1.0 $< -1.0$ 低动力学溶解度, 沉淀
探戈分数 < 1% 1% 到 5% > 5% β-片层堆积, 不完全耦合
疏水运行 ≤ 2 连续的 $3$ 连续的 $> 3$ 连续的 严重截断和缺失杂质

3. 关键风险领域: 人工智能肽在替补席上失败的地方

综合执行将数字模型转化为物理物质. 了解 SPPS 的基本物理化学使 R&D 团队预测 CDMO 瓶颈并共同制定风险缓解策略.

要点: 超过 70% 人工智能设计的肽合成失败源于树脂上的链间聚集. 生成模型对疏水性堆积进行过度索引,以最大化预测的结合能, 在固相合成过程中无意中创建了自组装成不溶性 β-折叠的序列.

风险 1: 树脂上的聚集和不完全偶联

在 SPPS 期间, 附着在固体支持树脂上的生长肽链可以形成内部- 和分子内氢键β-折叠. 据最近 树脂上 β-片层聚集研究, 疏水性氨基酸成分直接驱动树脂孔内二级结构崩溃.

这种聚集限制了溶剂膨胀并阻止哌啶试剂进入 N 端 Fmoc 基团. 结果:

  1. Fmoc 脱保护动力学减慢: 通常需要的脱保护周期 3 分钟延长至 30+ 分钟或部分失败.
  2. 删除序列累积: 在随后的偶联步骤中未反应的氨基仍然存在, 产生 N-1 和 N-2 缺失杂质的复杂混合物,几乎不可能通过反相 HPLC 分离.

台架观察: 在人工智能生成的具有疏水性延伸的结合物的高通量合成运行中 (>3 连续疏水残基), 实时 Fmoc 脱保护 UV 监测通常显示残留物 8-12 后效率急剧下降. 在这些位置掺入假脯氨酸二肽可恢复基线反应动力学并消除截短的缺失杂质.

聚集树脂状态:

[树脂珠] (疏水性 β-片层堆积) Fmoc-胺 (被阻止) x (哌啶难以接近)

溶剂化的 / 破坏状态:

[树脂珠] [假脯氨酸 / 异酰基手柄] Fmoc-胺 (裸露) ► (完全脱保护)

风险 2: 偶联过程中的外消旋作用

生成式 AI 模型不考虑激活过程中的立体化学稳定性. 高温微波辅助 SPPS 加速偶联反应,但显着增加特定氨基酸的外消旋风险:

  • 半胱氨酸: 在碳二亚胺活化过程中对碱催化的 α-碳外消旋化高度敏感.
  • 组氨酸: 咪唑侧链进行分子内碱催化, 导致L-D立体异构化.
  • 天冬氨酸: 碱基介导的激活促进 D-天冬氨酸形成以及天冬酰亚胺重排.

风险 3: TFA 裂解和脱保护副反应

使用三氟乙酸进行整体脱保护 (三氟乙酸) 从侧链保护基团中释放反应性碳正离子 (例如, 叔丁基, 特鲁特, 铅). 富含色氨酸的序列, 酪氨酸, 或蛋氨酸:

  • 游离碳阳离子重新连接到色氨酸的吲哚环或甲硫氨酸的硫醚上.
  • 清道夫鸡尾酒不足 (美东时间, TIS, 水, 苯酚) 导致不可逆的烷基化副产物污染最终产品.

风险 4: 二硫键配对和氧化歧义

从头设计的肽 2, 4, 或者 6 半胱氨酸残基提出了主要的折叠挑战. 4-半胱氨酸肽不受控制的空气氧化可产生三种不同的二硫键区域异构体:

平行线 (半胱氨酸_1-半胱氨酸_2, 半胱氨酸_3-半胱氨酸_4) 与. 反平行 (半胱氨酸_1-半胱氨酸_4, 半胱氨酸_2-半胱氨酸_3) 与. 交织在一起 (半胱氨酸_1-半胱氨酸_3, 半胱氨酸_2-半胱氨酸_4)

如果人工智能模型假设特定的本机折叠, DMSO/水中的简单空气氧化经常产生非天然拓扑异构体或可溶性低聚物.

风险 5: 反相 HPLC 中的分析歧义

疏水性人工智能的成功往往会产生广泛的影响, 分裂, 或标准 C18 分析 HPLC 柱上的拖尾峰. 出现这种峰变宽的原因是肽在流动相中以多个缓慢相互转换的构象异构体的形式存在, 或者因为疏水序列部分聚集在柱固定相上. 没有正交质谱分析, 这些分裂峰经常被误解为合成失败而不是可逆构象平衡.


4. 推荐的验证协议: 降低人工智能与工作台交接的风险

将计算预测与物理可交付成果联系起来, CDMO 必须采用专门的合成策略和分析表征套件.

原始AI序列输入

CDMO 可行性预筛选 高聚集风险? ► 掺入假脯氨酸 / 异酰基肽多二硫键图谱? ► 正交保护基团 (Trt/Acm/MMT) 高疏水性? ► 聚乙二醇化增溶手柄的合成 & 在线过程分析技术 (拍) 实时 Fmoc 脱保护 UV 监测 微裂解 LC-MS 步骤间检查 正交分析表征套件

  1. 反相高效液相色谱法 & 电喷雾质谱 / 飞行时间飞行时间 (大量的 & 纯度)
  2. 圆二色性 (光盘) 光谱学 (二级结构)
  3. 动态光散射 (动态LS) (单体验证)
  4. 埃尔曼分析 & 埃尔曼液质联用仪 (二硫键配对)

“困难”AI 序列的高级合成策略

当人工智能设计的序列在预合成分类期间触发警告阈值时, 经验丰富的 CDMO 部署量身定制的化学策略:

  1. 伪脯氨酸二肽: 插入 X aa-Ser, X aa-苏氨酸, 或 X aa-Cys 恶唑烷二肽,每 5-6 个残基,在树脂伸长过程中破坏 β-折叠二级结构.
  2. 异酰基肽技术: 将肽键暂时转化为酯键 (O-N酰基转移). 酯键在合成过程中破坏了 β-折叠堆积; 随后暴露于中性pH值 7.4 缓冲区快速触发, 定量 O 至 N 酰基迁移以恢复天然酰胺主链.
  3. 正交二硫键保护基团: 使用正交保护基团,例如三苯甲基 (特鲁特), 乙酰胺甲基 (阿克姆), 和单甲氧基三苯甲基 (MMT)——逐步施力, 定向二硫键形成而不是依赖热力学空气氧化.
  4. 预综合聚合预测建模: 先进的 CDMO 利用 预综合聚合预测模型 优化树脂装载密度, 选择低负载量 PEG 基树脂 (例如, 化学矩阵), 并动态调整流动合成温度.

正交分析验证套件

验证分析 分析技术 质量目标 / 验收标准 运营价值
纯度 & 大众身份 反相高效液相色谱法 (C18/C4) + 电喷雾质谱 / 飞行时间飞行时间 单主峰; 目标纯度≥ 95% 或≥ 98%; 单同位素质量在 ± 以内 0.5 和 确认全长序列同一性和缺失序列的存在
二级结构 圆二色性 (光盘) 光谱学 远紫外光谱 (190–260 纳米) 匹配预测的 α 螺旋 (208/222 纳米最小值) 或β-折叠 (218 纳米最小值) 验证物理肽折叠是否与 3D 模型匹配
聚合状态 动态光散射 (动态LS) / SEC-MALS 水动力半径 (Rₕ) 对应于单体状态; 多分散指数 (PDI) $< 0.15$ 确保肽在基于细胞或生物物理结合测定之前不聚集
二硫键连接性 埃尔曼分析 (DTNB) + LC-MS/MS 图谱 游离硫醇含量 < 0.05 mol SH/mol 肽; Cys-Cys 对的明确碎片离子 确认完全氧化和正确的二硫键配对拓扑

5. 操作手册: 成功执行 CDMO 交接

实施人工智能肽提交, 右&D 组织应制定标准化的五步交接工作流程.

步 1: 导出计算设计包 (PDB, 禁食, JSON, 分数)

步 2: 应用硅胶分类过滤器 (肉汁, 等电点, 卡索尔, 探戈) 步 3: CDMO技术预筛选 & 可行性审查步骤 4: 中试合成 & 在线过程分析控制步骤 5: 完整的分析发布 & QC 证书验证

步 1: 导出完整的数字设计包

编译所有计算输出 - 包括 PDB 坐标文件, FASTA序列, 模型来源 JSON, 和每个残基 pLDDT 阵列 - 进入单个提交档案.

步 2: 执行计算机分类筛选

使用 GRAVY 筛选候选者, 等电点, 卡索尔, 和探戈规则. 消除不可合成的异常值并用所需的化学修饰注释边界候选物 (例如, 增溶标签, N-末端乙酰化).

步 3: CDMO 可行性审查和化学计划

将过滤后的包提交给您的 CDMO 合作伙伴. CDMO合成工程团队评审:

  • 树脂选择 (聚苯乙烯与. 聚乙二醇化学基质).
  • 偶联化学 (步, DIC/氧化酶, 或 PyBOP).
  • 困难图案的保护策略.

步 4: 具有过程控制的中试规模合成

对于新颖的从头支架, 进行小规模试点合成 (1–5 毫克) 具有大规模生产前实时 UV 监测 Fmoc 脱保护动力学和微裂解 LC-MS 分析的功能.

步 5: 分析质量控制放行和洁净室包装

根据正交验证套件验证最终材料. 确保用于细胞培养或临床前模型的纯化肽在 Class 中进行处理 100 超无菌环境,保证零内毒素污染.


与专门的 CDMO 合作开发人工智能设计的肽

随着生成人工智能模型不断扩大治疗性肽的结构景观, 成功最终取决于合成化学的物理执行. 虽然通才供应商将定制肽视为商品目录项目, 复杂的 AI 热门产品需要配备先进合成技术的专业 CDMO 合作伙伴, 预综合可行性过滤, 和严格的质量控制.

在为人工智能设计的序列选择制造合作伙伴时, 评估平台功能——例如访问广泛的修改套件, 超无菌洁净室, 和灵活的放大选项——确保计算设计无缝过渡到物理验证. 右&寻求将数字设计与实验室执行联系起来的研发团队可以咨询专业平台,例如 MOL Changes 定制肽合成服务 旨在降低人工智能与工作台交接风险的技术可行性评估.

技术可行性检查: 根据合成可行性参数评估您的计算候选组合, 咨询 MOL Changes 技术团队 进行全面的综合前审查.

管理员头像

Xiaoxia Chen

新药研发&D 技术员 核心专长: 目标发现, 构效关系 (SAR) 分析, 肽-药物缀合物 (PDC), 以及抗衰老和代谢肽的开发.

轮廓: 陈晓霞领导了多种代谢和肿瘤靶向肽药物的早期发现和临床前研究. 她不仅精通肽库的高通量筛选,还擅长利用人工智能辅助计算生物学进行肽序列从头设计. 现在, 她领导的团队致力于下一代多功能激动剂的深入研究和开发 (比如双- 或三靶点减脂肽) 和高活性组织修复肽.

事实已核实 & 编辑指南
审阅者: 主题专家
分享这篇文章
搜索 Whatsapp 服务 产品