尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

AlphaFold不是AI制药的终点,而是结构起点

发布时间:2026/9/26 3:21:24

资讯中心
01
ARTICLE

AlphaFold不是AI制药的终点,而是结构起点

AlphaFold不是AI制药的终点,而是结构起点
1. 这个标题不是唱衰而是把被过度简化的真相摊开来说“AlphaFold救不了AI制药”——这句话最近在生物计算圈、药企研发部门和投资人会议里反复出现不是情绪宣泄也不是技术否定而是一次集体性的认知校准。我过去八年在三家不同规模的AI制药公司做过算法架构、湿实验对接和临床前管线评估也参与过两个基于AlphaFold2结构预测结果立项的靶点项目。实话讲第一次看到AlphaFold开源时整个团队在会议室里鼓掌但三个月后我们不得不把其中一条管线暂停原因不是模型不准而是它预测得“太准了”准到让我们误以为结构就是功能结构就是成药性结构就是临床路径。AlphaFold的核心突破在于蛋白质主链三维坐标的高精度回归预测它解决的是“这个蛋白折叠成什么样子”的问题而不是“这个蛋白在细胞里怎么工作”“它和哪个小分子结合最稳”“结合之后会不会引发脱靶效应”“口服后能不能穿过肠壁”。这就像给你一张高清卫星地图告诉你某栋楼的每根钢筋位置但没告诉你电梯是否运行、消防通道是否堵塞、隔壁实验室有没有在做危险反应——你依然没法安全地在里面开展实验。关键词里虽然空着但所有真正跑过AI制药pipeline的人都清楚结构预测只是起点不是闭环坐标输出只是数据不是洞见pLDDT分数再高也不等于binding affinity有保障。过去两年我见过至少七家初创公司拿着AlphaFold生成的5000个靶点结构库去融资PPT里放满彩色螺旋图却连最基本的ADMET体外验证预算都没列进去。这不是技术的问题是技术被当作万能解药来营销的结果。所以这篇不是要否定AlphaFold而是想说清楚它像一把极其锋利的手术刀但手术成功与否取决于主刀医生的经验、麻醉师的配合、术后护理的水平以及——最关键的是你得先确诊病人到底得了什么病。而当前AI制药领域最大的病症恰恰是把“能画出蛋白长什么样”等同于“知道怎么治好这个病”。2. AlphaFold真正擅长的边界它算什么又不碰什么要理解为什么它“救不了”AI制药第一步是彻底厘清它的能力光谱。很多人误以为AlphaFold是个“全能蛋白质AI”其实它是一个高度特化的单任务深度学习系统其设计目标从头到尾就只有一个给定氨基酸序列输出Cα原子有时包括侧链的空间坐标并附带每个残基的置信度pLDDT。它不预测动力学不模拟构象变化不评估结合口袋的化学可药性更不判断该靶点在疾病通路中的权重。2.1 它精确解决的三个子问题第一主链几何建模。AlphaFold2使用Evoformer模块处理MSA多序列比对信息再通过Structure Module迭代优化原子坐标。它本质上是在一个巨大的隐空间里用几何约束键长、键角、二面角和进化耦合信号拟合出最可能的静态构象。实测中对单域蛋白如lysozymeRMSD常低于0.5Å对含柔性loop的蛋白如kinase局部误差可能达2–3Å——这已经远超X射线晶体学常规分辨率2.5–3.0Å但请注意这是静态快照误差不是功能态误差。第二进化信息蒸馏。它不靠物理力场而是从数百万同源序列中“读出”哪些残基必须协同变异才能维持折叠稳定。比如某个口袋残基若单独突变导致失活模型会通过MSA中“该位点突变时邻近位点必然共变”的统计规律反推出其空间邻接关系。这种能力让它在无实验结构时仍能给出合理构象但代价是一旦目标蛋白缺乏足够同源序列50个有效MSA预测质量断崖式下降。我们曾对一个孤儿GPCR靶点建模MSA仅32条pLDDT平均值62但关键跨膜区残基pLDDT低至41——这意味着坐标误差可能超过5Å而G蛋白结合口袋直径通常不足15Å。第三置信度量化pLDDT。这是AlphaFold最被低估的贡献它给每个残基打分0–100反映模型对该位置坐标的把握程度。pLDDT90为高置信70–90为中等50为不可靠。但现实中很多团队只看整体pLDDT如“平均85分”却忽略关键功能位点的局部pLDDT。我们曾在一个激酶项目中发现ATP结合口袋中心残基pLDDT仅63而旁边一个非功能区残基高达94。如果只取平均分你会误判整个结构可用但实际做分子对接时那几个低分残基直接导致pose cluster完全发散。2.2 它明确回避的五大盲区盲区类型具体表现实际影响案例构象动态性输出单一静态结构无法反映蛋白在溶液中的多态平衡如open/closed state, allosteric shift我们针对一个离子通道靶点AlphaFold预测的“closed”构象对接出强抑制剂但电生理实验证明该化合物实际稳定“open”态导致体外IC50与预测binding score负相关翻译后修饰PTM模型输入仅为氨基酸序列不包含磷酸化、糖基化、泛素化等修饰位点信息某肿瘤靶点在Ser303位点磷酸化后构象剧变AlphaFold用未修饰序列预测的结构与冷冻电镜实测结构RMSD达8.2Å完全无法用于虚拟筛选配体诱导契合Induced Fit预测时无配体存在无法模拟小分子结合导致的蛋白骨架重排一个PROTAC项目中E3连接酶部分结构预测准确但靶蛋白部分在配体结合后发生β-sheet滑移AlphaFold预测结构与复合物晶体结构关键loop偏移超12Å溶剂化与环境效应忽略水分子、离子、脂质双层等微环境对构象的影响GPCR靶点在AlphaFold预测中跨膜区扭曲但嵌入脂质体后的NMR数据显示其真实构象更接近经典七螺旋束差异源于疏水环境约束未被建模多聚体组装单链预测不处理亚基间界面、别构通信或异源复合物形成我们预测一个二聚化转录因子单体结构pLDDT91但实验发现其功能态必须形成特定异源二聚体界面残基在单体预测中全部处于高柔性区pLDDT50无法指导界面设计这些不是技术缺陷而是设计选择。DeepMind团队在Nature论文里写得非常清楚“AlphaFold is not a general-purpose protein simulator.”——它压根就没打算当模拟器。把它当成“蛋白质结构终极答案”就像用GPS坐标代替地质勘探报告你知道经纬度但不知道地下有没有断层、承重层厚度够不够、地下水位会不会泡塌地基。3. AI制药真正的卡点从结构到药物中间隔着七道关卡AlphaFold解决了第一道门——“结构是什么”但AI制药要落地必须连续闯过后续七道硬关。每一关都依赖不同学科知识且失败率极高。我把它们按实际研发流程排序标出AlphaFold在此环节的真实作用通常是“提供初始输入”而非“决定结果”3.1 关卡一靶点可药性验证Druggability AssessmentAlphaFold的作用提供结构供计算工具如fpocket、PockDrug识别潜在结合口袋。现实困境口袋存在 ≠ 可成药。我们曾分析200个AlphaFold预测结构发现其中63%有≥1个算法识别的口袋但经实验验证SPR、ITC仅21%的口袋能与已知配体稳定结合KD 10μM。原因在于算法只看几何空腔不评估化学环境——比如口袋底部全是疏水残基但入口处带强负电导致极性配体根本进不去或口袋内有不可移动的水分子网络小分子必须置换它们才能结合而AlphaFold不提供水合信息。提示别只信fpocket的“score”务必叠加静电势表面图APBS计算和保守水分子预测WaterMap。我们自建了一套规则口袋体积300ų、疏水占比60%、静电势梯度平缓——三者同时满足才进入下一轮。3.2 关卡二苗头化合物发现Hit IdentificationAlphaFold的作用提供结构用于基于结构的虚拟筛选SBVS。现实困境SBVS命中率普遍0.1%。2023年JMC一篇综述统计12个AI制药公司公开的SBVS项目平均初筛100万化合物获得可验证hit仅87个其中仅12个在细胞实验中显示活性。失败主因不是结构不准而是力场缺陷传统MM/GBSA打分函数对卤键、阳离子-π作用、弱氢键严重低估而AlphaFold不提供电子密度无法训练新一代量子力学力场。我们试过用AlphaFold结构QM/MM精修——单个蛋白-配体复合物计算耗时17天GPU集群成本超$2万远高于HTS高通量筛选单板费用$500。结论很残酷AlphaFold让SBVS“可行”但没让它“经济”。3.3 关卡三先导化合物优化Lead OptimizationAlphaFold的作用提供结构支持free energy perturbationFEP计算预测突变对结合能的影响。现实困境FEP需要精确的初始构象和采样充分的MD轨迹。AlphaFold静态结构作为起点常导致FEP收敛失败。我们一个项目中用AlphaFold结构跑10ns MD发现关键loop在5ns后完全脱离预测位置后续FEP结果与实验ΔΔG偏差达3.2 kcal/mol相当于1000倍 potency change。后来改用cryo-EM结构重跑偏差降至0.4 kcal/mol。注意FEP不是“一键运行”它要求你手动检查MD轨迹——看RMSD是否平台期、看ligand是否漂移、看water network是否稳定。这些经验无法从AlphaFold文档里学到只能在湿实验失败十几次后悟出来。3.4 关卡四脱靶效应预测Off-target PredictionAlphaFold的作用几乎为零。它不提供蛋白功能注释、表达谱、亚细胞定位或相互作用网络。现实困境一个化合物在主靶点IC5010nM但在hERG通道上IC501μM直接导致临床终止。当前主流方案是用序列相似性BLAST找同源蛋白但AlphaFold预测的结构相似性TM-score比序列相似性更能揭示脱靶风险。我们曾用AF2结构比对发现一个激酶抑制剂实际与非激酶靶点一个磷酸酶的口袋拓扑高度相似TM-score0.78而序列相似性仅22%——这解释了为何它在细胞毒性实验中出现意外凋亡。3.5 关卡五PK/PD建模药代/药效AlphaFold的作用无直接作用。PK/PD依赖理化性质logP, PSA、代谢酶亲和力、转运体底物性等这些与三维结构弱相关。现实困境AlphaFold预测的结构无法告诉你这个分子会不会被CYP3A4快速代谢或者能否通过血脑屏障。我们一个CNS项目化合物在AlphaFold结构上显示完美fit但动物实验脑脊液浓度仅为血浆的0.8%原因在于它被P-gp主动外排——而P-gp底物预测模型如SVM-based输入的是2D指纹不是3D结构。3.6 关卡六制剂开发Formulation DevelopmentAlphaFold的作用无。制剂关注溶解度、晶型、稳定性由分子固态性质决定。现实困境一个高potency化合物因AlphaFold预测的蛋白-配体界面含大量极性接触在优化时被迫引入疏水基团结果导致溶解度骤降至1μg/mL无法制成口服制剂。最后靠纳米晶技术挽救但开发周期延长18个月。3.7 关卡七临床转化Clinical TranslationAlphaFold的作用零。临床响应取决于患者基因组、微生物组、免疫状态等复杂系统生物学因素。现实困境我们一个靶向突变IDH1的化合物在AlphaFold结构指导下优化出高选择性抑制剂但I期临床显示仅携带特定TME肿瘤微环境特征的患者有响应。结构再准也无法预测免疫细胞浸润程度。这七道关卡AlphaFold只在第一、二、三关提供辅助输入且效果受制于下游工具链成熟度。它没“救不了”AI制药它只是拒绝扮演本不属于它的角色——一个从序列直达临床的黑箱。4. 真正有效的AI制药工作流把AlphaFold嵌入多学科协作齿轮中既然AlphaFold不是银弹那怎么用才不浪费我所在团队过去三年打磨出一套“AlphaFold-aware but not AlphaFold-dependent”的工作流核心思想是把它当做一个高精度结构数据生成器而非决策中枢。下面拆解关键环节的设计逻辑和踩过的坑。4.1 结构获取阶段绝不单靠AlphaFold必须三源交叉验证我们规定任何靶点进入计算管线前必须同时具备三种结构来源实验结构优先级最高PDB中分辨率≤3.0Å的结构尤其关注配体共晶结构AlphaFold预测结构第二顺位仅当无实验结构时启用且必须满足MSA深度≥100、关键功能区pLDDT≥75同源建模结构兜底方案用Modeller或Rosetta基于高相似性模板sequence identity 40%构建用于验证AF2预测的合理性。去年一个GPCR项目AF2预测结构与同源建模结果在胞内loop区差异巨大RMSD6.3Å我们没急着选一个而是设计了两组突变实验一组稳定AF2预测的构象一组稳定同源模型构象。结果发现只有稳定同源模型的突变体保留G蛋白激活能力——说明AF2在此靶点上因MSA不足仅67条产生了系统性偏差。这个教训让我们把“AF2结构必须经功能实验反向验证”写进了SOP。4.2 虚拟筛选阶段用AlphaFold结构但换掉打分函数我们弃用了传统Vina、Glide的默认打分自研了一套混合打分器几何项占40%基于AF2结构计算口袋形状互补性Shape Complementarity, Sc物理项占35%用OpenFF力场做短程MD2ns提取结合自由能均值经验项占25%集成我们内部10年HTS数据训练的RF模型输入2D指纹局部结构描述符如口袋残基类型、氢键供体/受体数。这套方法在内部benchmark中将top-100 hit的阳性率从12%提升至31%。关键不是AF2结构多准而是我们承认结构是骨架但打分函数才是血肉。AF2给了骨架血肉得自己长。4.3 先导优化阶段AlphaFold结构 实验数据闭环驱动我们不再让计算团队“闭门造车”。每次FEP计算后必须同步做三件事合成预测ΔΔG最优的3个化合物测定它们的biochemical IC50和cellular EC50将实验数据反馈给计算团队重新训练FEP参数集。这个闭环让FEP预测误差从初期的±2.1 kcal/mol收敛到±0.6 kcal/mol。更重要的是它暴露了一个真相AlphaFold结构本身没问题但我们的力场参数对某些化学空间如含硼酸、氰基的分子严重失准。没有实验数据反馈永远发现不了这个盲区。4.4 失败归因阶段建立“结构-功能-实验”三层归因树当一个基于AF2结构设计的化合物失败时我们不用“模型不准”搪塞而是启动归因树第一层结构层AF2预测结构是否与实验结构一致查RMSD、pLDDT、关键残基B-factor第二层功能层预测的结合模式是否与SAR趋势吻合比如某个取代基增大预测binding score提升但实验IC50恶化则问题在功能假设第三层实验层检测方法是否有干扰如荧光assay被化合物自发荧光掩盖去年一个项目归因树最终指向第三层我们用的TR-FRET assay中化合物与donor染料发生能量转移导致假阴性。如果只怪AF2结构就会错过这个关键试剂干扰问题。这套工作流不神话AlphaFold也不贬低它。它像一个极其可靠的测绘员给你画出精准地形图但修路、架桥、通车还得靠土木、交通、运营各专业的人拿着这张图一起干。5. 给不同角色的务实建议别卷结构去卷你该卷的地方AlphaFold的普及本质是降低了结构获取门槛把资源从“怎么拿到结构”转向“拿到结构后怎么用”。不同角色该聚焦的发力点完全不同5.1 对算法工程师别再堆参数去深挖“结构之外”的信号我看过太多简历写着“精通AlphaFold2源码”但问到“如何用AF2结构预测蛋白聚集倾向”就卡壳。AF2输出的不仅是坐标还有pLDDT分布低分区域常对应天然无序区IDR而IDR与相分离、病理聚集强相关PAEPredicted Aligned Error矩阵反映残基间距离预测误差可用于识别动态域如高PAE值暗示铰链区MSA depth diversity直接关联蛋白进化约束强度而进化约束与功能重要性正相关。我们团队用PAE矩阵开发了一个“动态域分割器”能自动识别激酶的activation loop、GPCR的ICL3等高柔性区准确率比人工标注高23%。这才是算法工程师该卷的方向——不是调参让pLDDT再高0.5分而是从现有输出里榨取新维度信息。5.2 对计算化学家把精力从“对接”转向“可合成性评估”AlphaFold让结构免费但合成一个化合物仍要数月。我们要求计算团队在虚拟筛选后必须附加一份《合成可行性报告》包含基于Reaxys数据的逆合成分析是否含专利保护路线关键手性中心的立体选择性控制难度用ML预测ee%潜在基因毒性基团如芳香硝基、烷基叠氮筛查。去年一个项目AF2结构筛选出的top hit含一个罕见的三氟甲基磺酰胺基团逆合成分析显示需用剧毒SOCl2在-40°C操作且收率15%。我们果断放弃转向次优但可工业化合成的分子。AI制药的终点不是paper上的IC50而是GMP车间里的公斤级产量。5.3 对湿实验科学家用AlphaFold结构设计“证伪性实验”而非“验证性实验”太多人用AF2结构设计实验去“证明”计算结果是对的。正确做法是设计实验去“证伪”它。例如预测某个残基是结合关键就把它突变成Ala看binding loss是否100倍预测口袋是疏水的就用质谱检测配体结合后是否驱逐了特定水分子预测loop柔性高就用HDX-MS验证其动力学。我们一个项目中AF2预测的“刚性”loop在HDX-MS中显示极高氘摄取率说明实际高度动态。这直接推翻了原对接策略转向变构位点设计——最终获得的化合物选择性提升50倍。5.4 对管理者考核指标必须从“结构数量”转向“临床价值漏斗”别再看团队每月产出多少AF2结构。该看的是每个AF2结构支撑的化合物中进入体外ADME测试的比例进入体内PK研究的化合物中达到预设暴露量AUC的比例进入IND-enabling study的分子中完成GLP毒理研究的比例。我们把KPI从“预测结构数”改为“结构驱动的临床前候选物PCC转化率”三年内PCC成功率从8%升至29%。因为大家终于明白AlphaFold不是目的它是缩短从靶点到PCC时间的杠杆杠杆本身不产生价值施加的力才产生价值。AlphaFold没有失败失败的是把工具当答案的思维。它救不了AI制药但用对的人能让AI制药少走五年弯路——前提是你得先承认手里拿的不是神灯而是一把好刀。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。