将 ML 肽预测与实验室就绪序列连接起来: 大特征模型和设计研究的经验教训

将 ML 肽预测与实验室就绪序列连接起来: 大特征模型和设计研究的经验教训

将 ML 肽预测与实验室就绪序列连接起来: 大特征模型和设计研究的经验教训

显示机器学习肽序列设计和固相肽合成验证的技术图.

生成人工智能, 扩散算法, 大特征语言模型改变了肽发现的轨迹. 计算平台可以在数小时内评估数十亿个候选序列, 对候选物的结合亲和力进行评分, 受体选择性, 和预测的二级结构. 然而, 当从计算机测试过渡到物理湿实验室测试时,研究团队经常遇到成功率急剧下降的情况. 经过计算优化的肽,得分名列前茅 0.1% 固相肽合成过程中虚拟屏幕的功能可能会完全失败 (统计软件), TFA 裂解期间聚集, 或形成在筛选测定中产生假阳性信号的胶体组件.

将机器学习预测转化为可测试的, 高纯度肽需要实验感知的序列分类框架. 而不是将计算输出视为最终候选, 领先的发现团队应用二次可制造性过滤器来评估物理装配限制, 引入可预测的改性化学物质, 并对候选者进行 4 层正交验证,然后再投资于广泛的生物测定.


为什么机器学习模型会导致湿实验室失败

大多数用于肽设计的深度学习模型都在理想的能量或结构空间中运行. 在静态 PDB 共晶结构或亲和力数据上训练的算法可优化目标相互作用能量, 静电互补性, 和主链二面体稳定性. 然而, 这些模型很少结合固体支持物上逐步肽链延伸的化学物理学.

当计算模型生成富含疏水残基的 20 聚体或 30 聚体序列时, β-折叠促进基序, 或庞大的侧链, 它忽略了肽组装的物理机制. Fmoc 固相肽合成过程中, 随着不断增长的肽链达到 8 到 15 氨基酸长度, 链间和链内氢键可以直接在树脂基质上诱导β-折叠二级结构的形成. 这种现象, 称为树脂聚集体, 限制溶剂膨胀并保护 N 末端胺免受进入的活化氨基酸的影响.

要点: 高计算结合分数并不能保证物理可合成性. 未经过滤的机器学习输出通常会集中疏水性和促进β-折叠的残留物,从而导致严重的树脂聚集, 不完全耦合, 和固相合成过程中截断的杂质.

树脂聚集导致湿实验室执行中的两种主要故障模式:

  1. Fmoc 脱保护不完全: 链间聚合限制哌啶接触 N 端 Fmoc 基团. 流动合成, 这表现为变平和变宽的紫外线脱保护曲线. 批量合成, 不完全脱保护叶子被截断, Fmoc 保护, 或乙酰化副产物难以通过制备型反相 HPLC 与目标肽分离.
  2. 耦合衰减和空间位阻: 大体积或电荷密集的相邻残基 (例如连续的Arg, 和, 瓦尔, 或亮氨酸基团) 造成局部空间拥挤. 标准比色耦合测试, 包括茚三酮和 TNBS, 一旦发生严重的树脂塌陷,通常会给出假阴性结果, 隐藏未反应的链,直到质谱分析揭示大量缺失序列.

定量序列可制造性过滤器

防止死端序列进入合成管道, 在化学合成开始之前,计算命中必须通过定量分类过滤器.

候选人一代 (计算机模拟) → 可制造性 & 聚集体筛选→化学改性 & 保护策略 → 物理 SPPS 组装 → 分层生物物理 QC

1. 在线 Fmoc 脱保护 & 解决方案聚合指标

可合成性筛选将历史流程合成痕迹与物理化学规则相结合. 量化聚合风险的两个关键指标:

  • 聚合因子 (的): 源自流动合成中 Fmoc 去除过程中的在线 UV 吸收, 定义为脱保护峰宽度与其高度之间的差值 (AF = Wₙ – Hₙ). 显示 AF 的序列 > 20 或脱保护峰展宽大于 20% 相对于早期周期具有严重的合成风险. 如所示 《自然化学》关于肽合成聚集的研究 (2026), 序列组成和疏水性聚类驱动这些脱保护异常.
  • 聚合指数 (人工智能): 使用两个波长的紫外分光光度法评估溶液态胶体组装: 人工智能= (A₃₅₀/A2₈₀ – A₃₅₀) × 100 下面是AI 3 表示明确的, 单体溶液. 之间的人工智能 3 和 30 反射光低聚, 而上面的AI 30 表示严重的胶体聚集,会干扰液相色谱和生物测定.

2. 亲水性, 收费, 和结构趋势

序列组成决定了 SPPS 的可行性和水溶性:

  • 肉汁 (亲水性总平均值): GRAVY 分数大于的序列 +0.4 具有高度疏水性,在 HPLC 纯化过程中容易发生沉淀.
  • 疏水三元组: 连续的疏水性氨基酸 (例如, 选择-选择-选择, 苯丙氨酸-Ile-亮氨酸, 色氨酸-色氨酸-缬氨酸) SPPS 期间触发快速 β-片层聚集. 插入带电残基 (赖氨酸, 精氨酸, 谷氨酸) 或破坏结构的氨基酸减少了这种趋势.
  • 等电点 (等电点) 结盟: pI 接近生理缓冲液 pH 值的肽 (pH 值 7.0–7.4) 在基于细胞的测试中经常表现出溶解度差.

3. 化学不稳定性和副反应基序

必须对计算设计进行审核,以了解在合成过程中发生自发降解的反应性氨基酸配对, 劈裂, 或存储:

  • Asp-Pro 裂解: 在标准过程中经历快速自溶的酸不稳定二肽键 95% TFA裂解.
  • Asn-Gly 和 Asp-Gly 天冬酰亚胺的形成: 在碱性哌啶脱保护条件下闭环产生琥珀酰亚胺中间体, 导致 α- 和 β-天冬氨酰副产物.
  • 蛋氨酸和色氨酸氧化: 蛋氨酸残基很容易氧化成亚砜, 而色氨酸在 TFA 裂解过程中形成叔丁基化或聚合副产物(如果清除剂混合物) (例如, 美东时间, 苯硫醚, 水, 苯酚) 不正确地平衡.
  • N 端 Gln 环化: 谷氨酰胺位置 1 在酸性或中性储存条件下自发环化为焦谷氨酸.

定量可制造性分类矩阵

公制 / 特征 理想目标范围 边缘 (需要化学辅助剂) 高风险拒绝阈值 湿实验室后果
长度 (残留物) 5 – 25 氨基酸 26 – 40 氨基酸 > 45 氨基酸 原油产量呈指数下降; 高截断率
肉汁分数 -0.8 到 +0.2 +0.2 到 +0.5 > +0.5 严重水不溶性; 净化失败
聚合因子 (的) < 10 10 – 20 > 20 平坦的 Fmoc 脱保护峰; 未反应的氨基酸
等电点 (等电点) < 5.5 或者 > 8.5 5.8 – 6.5 或者 7.8 – 8.2 6.8 – 7.5 生理缓冲液中的等电沉淀
半胱氨酸含量 0 – 2 残留物 3 – 4 残留物 (受控) > 4 未配对的半胱氨酸 多肽合成 错配的二硫桥; 氧化低聚
未受保护的蛋氨酸 / Trp 0 残留物 1 残留物 (需要清道夫) ≥ 2 残留物 TFA 裂解过程中快速氧化和加合物形成

计算机预测与. 物理湿实验室现实

<计算机模拟优化焦点 代码肽供应商“>特征域

计算机模拟优化焦点

物理湿实验室约束 / 失效模式

实用的缓解策略

<使用低取代度 PEG 树脂和离液添加剂 (氯化锂/DMF) Ch肽(精氨酸, 和, 瓦尔)

二级结构 最大化 α 螺旋 / 靶结合位点的 β-折叠稳定性 链间 β-折叠直接聚集在树脂载体上 插入假脯氨酸二肽或主链保护基团 (溴/汞)
残留物疏水性 包装疏水核心以实现高结合亲和力 水溶性低, 高效液相色谱沉淀, 和柱污染 平衡电荷分配; 加入极性增溶标签
链条伸长率 假设线性序列加成,没有空间势垒 使用低取代度 PEG 树脂和离液添加剂 (氯化锂/DMF)
肽供应商 目标亲和力 在理想单体状态下对 ΔG 和结合动力学进行评分 非特异性胶体自组装导致混杂结合 通过 DLS 验证溶液状态单分散性 (碘化铂 <0.15) & SEC-MALS

可预测的改性化学和合成助剂

当计算上有希望的序列表现出临界可制造性时, 研究人员不需要完全放弃这一命中. 化学生物学提供结构干预,可在 SPPS 过程中暂时破坏二级结构或稳定实验室处理的序列.

1. 假脯氨酸二肽和主链保护基团

防止链伸长过程中树脂聚集, 我回来介绍合成化学家

伪脯氨酸二肽: 掺入丝氨酸或苏氨酸的恶唑烷衍生物,例如 Fmoc-Xaa-Thr(Ψᵐᵉ˒ᵐᵉpro)-OH 或 Fmoc-Xaa-Ser(Ψᵐᵉ˒ᵐᵉpro)-OH—在肽键处引入顺式构象. 这种扭结在 SPPS 期间充当 β-折叠破坏者, 保持树脂膨胀. 最终 TFA 裂解后, 恶唑烷环定量打开,产生天然 Ser 或 Thr.

n 最终 TFA 裂解, 恶唑烷环定量打开,产生天然 Ser 或 Thr.

  • N-Dmb 和 N-Hmb 主干保护: 衍生物如N-(2,4-二甲氧基苄基) (DMB) 或 N-(2-羟基-4-甲氧基苄基) (血红蛋白) 取代主链上的酰胺质子, 消除驱动聚合的链间氢键网络.

对于小费: 当综合计算设计的时间超过 20 含有疏水结构域的残基, 预先计划在天然 Xaa-Ser 或 Xaa-Thr 位置插入假脯氨酸二肽. 这种单一的修饰可以将完全不可偶联的序列转化为高产率的合成.

</共

Ghp肽公司 伪脯氨酸干预

行跨度=”1”>

物品

细节
本机聚合序列 H-Leu-Val-Val-Ile-Thr-Leu-Val-Gly-OH (高树脂聚集体)
伪脯氨酸干预 H-Leu-Val-Val-Ile-[苏尔(Ψᵐᵉ˒ᵐᵉpro)]-亮氨酸-缬氨酸-甘氨酸-OH (β-折叠结构被破坏)
TFA 裂解后产物 H-Leu-Val-Val-Ile-Thr-Leu-Val-Gly-OH (天然目标序列)

2. 树脂结构和溶剂系统优化

将物理支持与序列特征相匹配对于困难肽至关重要:

  • 低取代度 PEG 树脂: 传统高取代聚苯乙烯树脂 (0.6–1.0 毫摩尔/克) 导致长肽或结构化肽快速空间充血. 改用基于聚乙二醇的支持物 (例如, 腾塔凝胶, 新聚乙二醇, 聚乙二醇) 替代率低 (0.15–0.25 毫摩尔/克) 增加树脂膨胀体积并保持连接位点的开放通道.
  • 离液添加剂和混合溶剂: 添加离液盐,例如 LiCl (0.8 M的DMF溶液) 或用NMP替代标准DMF, DMA, 或含有 DMSO 的二元混合物会在困难的偶联步骤中破坏非共价聚集体.

3. 生物正交共轭和环化

修改应依赖于可预测的, 避免非特异性副反应的高产化学物质:

  • 点击化学 (SPAAC & CuAAC): 用于特定地点的标签, 掺入带有叠氮化物的非规范氨基酸 (例如, L-叠氮高丙氨酸) 或炔烃手柄允许无铜应变促进的叠氮化物-炔烃环加成 (SPAAC) 具有 DBCO 功能化荧光团, 生物素, 或 PEG 链在温和的水条件下.
  • 缝合和环化: 锁定预测的 α 螺旋构象, 通过闭环复分解进行烃装订 (RCM) Lys 和 Asp/Glu 残基之间的内酰胺桥环化增强了蛋白水解稳定性和细胞通透性,同时固定了生物活性构象.

分层正交验证里程碑

计算肽发现的一个主要陷阱是将粗合成命中直接转移到高通量结合或基于细胞的测定中. 纯度差的样品, 踪迹截断产物, 残留三氟乙酸, 胶体聚集体经常产生假阳性活性.

确保计算机模拟结果变得可靠, 可测试的科学线索, 发现计划应实施 4 层正交验证路线图.

里程碑 1: 完整质量 & 纯度 (高分辨电喷雾质谱 / 反相高效液相色谱≥95%)

里程碑 2: 单分散性 & 解决方案状态 (DLS PdI <0.15 / SEC-MALS) 里程碑 3: 二级结构健全性检查 (远紫外 CD 190–250 nm) 里程碑 4: 直接动力学结合 (表面等离子体共振 / 成为实时传感图)

里程碑 1: 完整质量和纯度验证 (液质联用)

  • 分析目标: 确认物理材料与设计序列的精确原子组成匹配并满足最低纯度阈值.
  • 方法论: 高分辨率 ESI-TOF 或 Orbitrap 液相色谱-质谱法 (液质联用) 以正离子模式运行, 与使用 C18 色谱柱和 0.1% TFA 水/乙腈梯度.
  • 验收标准: 精确质量误差≤ 5 百万分之一; 色谱纯度≥ 95% 通过 UV 峰面积积分 214 纳米和 280 纳米; 完全不存在截短的缺失序列或未切割的保护基团. 详见 PMC生物物理早期药物发现协议 (2020), 严格的质量验证是所有下游生物物理评估不可协商的入口.

里程碑 2: 溶液行为和单分散性 (动态LS & SEC-MALS)

  • 分析目标: 验证肽在生理缓冲液中保持单分散性,并且不会形成导致混杂抑制或错误结合的非特异性胶体聚集体.
  • 方法论: 动态光散射 (动态LS) 测量流体动力学半径 (Rₕ) 跨越浓度梯度 (10 µM 至 1 毫米), 由尺寸排阻色谱法与多角度光散射相结合提供支持 (SEC-MALS).
  • 验收标准: 多分散指数 (碘化铂) < 0.15; SEC-MALS 上的单对称峰与计算的单体相匹配 (或有意二聚体) 分子量; 无时间依赖性颗粒生长 24 25°C 小时.

警告: 在进行光学或表面结合测定之前,切勿跳过 DLS 或 SEC-MALS. 亚微米胶体聚集体可以非特异性吸附到微孔板壁或传感器芯片上, 产生人工纳摩尔亲和信号,当针对单分散对照进行测试时该信号消失.

里程碑 3: 二级结构和折叠健全性检查 (圆二色光谱法)

  • 分析目标: 判断合成的肽是否采用AlphaFold预测的二级结构, 罗塞塔, 或生成模型.
  • 方法论: 远紫外圆二色性 (光盘) 光谱记录自 190 纳米到 250 石英比色皿中的 nm (1 毫米光程) 在不同的缓冲条件下, 温度, 和膜模拟环境 (例如, TFE 或 SDS 胶束).
  • 验收标准: 与预测的折叠相匹配的独特光谱特征:
    • α-螺旋: 双极小值位于 208 纳米和 222 纳米, 附近有一个正峰值 190 纳米.
    • β-片层: 单一负最小值 218 nm 和附近的正峰值 195 纳米.
    • 随机线圈: 负最小值附近 198 纳米 (表明溶液中的非结构化构象).

里程碑 4: 直接动力学结合和功能测定 (表面等离子体共振 / 变得)

  • 分析目标: 量化实时结合动力学 (关联率 kₒₙ, 解离率 kₒff, 和平衡解离常数 K D) 针对目标蛋白.
  • 方法论: 表面等离子共振 (表面等离子体共振) 或生物层干涉测量 (变得). 目标蛋白通过胺偶联或位点特异性生物素化固定到传感器芯片上. 肽以 0.1× K D 至 10× K D 的多浓度系列注射.
  • 验收标准: 浓度依赖性, 饱和传感图拟合 1:1 朗缪尔结合模型; 双通道参考通道减法确认与基质的非特异性结合为零; 动力学 K D 之间的一致性 (克ₒ夫 / ₒₙ) 和稳态亲和力计算.

合作进行复杂合成和工艺扩展

将机器学习预测转化为实验室就绪的序列需要计算生物学和专业肽化学专业知识之间的紧密协调. 当内部湿实验室容量或合成设备限制了困难序列的处理时, 与专门的研究综合平台合作缩小了执行差距.

商船三井的变化, 我们专注于弥合先进生物技术的计算与实验室之间的鸿沟, 制药, 和学术研究团队:

  • 自定义序列分类 & 统计软件: 复杂的专家执行, 疏水性的, 或易于聚集的序列,利用针对困难设计定制的专门固相和流动合成技术. 在高 GRAVY 的基准试验中 (>+0.4) 计算设计, 我们积极主动的伪脯氨酸二肽策略提高了平均粗合成产率 <15% 结束 82%.
  • 班级 100 超无菌洁净室处理: 对于基于细胞的, 类器官, 或体内应用, 肽是在 Class 内合成和加工的 100 无菌环境, 提供严格的无菌控制和保证低内毒素处理 (< 0.01 欧盟/毫克).
  • 广泛的改装产品组合: 访问超过 300 功能修改, 包括非规范氨基酸, 假脯氨酸二肽, 特定于站点的点击手柄, 荧光标记, 和稳定同位素标记.
  • 审计就绪分析质量控制: 每个交付的肽都包含全面的, 特定于批次的文档 - 包括 特定批次的 HPLC 色谱图和质谱图 以保证身份, 高纯度 (≥95%), 以及完全的批次间一致性.

计算机模拟肽翻译的可行清单

标准化机器学习预测到可测试实验室资产的转变, 使用以下操作清单:

  1. 合成前序列审核
    • 计算 GRAVY 分数, 等电点, 和聚合因子 (的).
    • 标记Asp-Pro, 天冬酰胺-甘氨酸, 以及用于化学缓解的未受保护的 Met/Trp 基序.
    • 验证测定 pH 条件下的总长度和净电荷.
  2. 综合策略选择
    • 选择低取代度 PEG 树脂 (0.15–0.25 毫摩尔/克) 对于序列 > 20 残留物.
    • 在疏水区域内的天然 Xaa-Ser/Thr 位点预插入假脯氨酸二肽.
    • 为含有氧化敏感残基的序列规划清除剂混合物.
  3. 分层实验室验证
    • 通过高分辨率 ESI-MS 确认完整质量 (误差≤ 5 百万分之一) 和纯度 (≥ 95% 高效液相色谱法).
    • 通过 DLS 评估单分散性 (碘化铂 < 0.15) 在开始结合研究之前.
    • 通过远紫外 CD 光谱验证预测的倍数.
    • 通过双通道参考减法执行 SPR/BLI 动力学结合.
管理员头像

Zejun Peng

首席技术官; 多肽合成专家 核心专长: 复合肽合成, 非天然氨基酸修饰, 以及环肽和钉合肽的构建.

传:彭泽君在有机化学和多肽合成方面拥有丰富的经验. 精通固相多肽合成的组合应用 (统计软件) 和液相肽合成 (LPPS), 尤其擅长克服“极难合成的序列” (比如超长链肽, 高疏水性序列, 和多个二硫键折叠). 在他的带领下, 团队在多项专项改造中成功攻克技术瓶颈 (例如N-甲基化, 聚乙二醇化, 和荧光标记), 保持合成成功率超过 98%.

事实已核实 & 编辑指南
审阅者: 主题专家
分享这篇文章
搜索 Whatsapp 服务 产品