ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

AlphaFold 蛋白质结构预测 完整指南:从一条氨基酸序列快速跑出三维结构

AlphaFold 蛋白质结构预测 完整指南:从一条氨基酸序列快速跑出三维结构 AlphaFold 蛋白质结构预测 完整指南从一条氨基酸序列快速跑出三维结构【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 是 DeepMind 开源的蛋白质结构预测工具输入一段氨基酸序列在 GPU 上跑几个小时就能拿到一份三维结构文件外加逐残基的置信度打分。这套代码把 AlphaFold v2 的完整推理流程搬到了你手里顺带覆盖了多链复合物建模AlphaFold-Multimer、v2.3.0 技术说明和 CASP15 预测基线集。想搞懂它值不值得折腾、本地怎么部署往下看。它到底解决了什么问题搞清楚一个蛋白长什么样传统路径只有三条X 射线晶体衍射、冷冻电镜、核磁共振。每一条都要数月甚至数年的反复试错还有不少蛋白天生不配合——结晶不出、样品不稳定实验就卡死在那儿。AlphaFold 把这件事变成了交作业模式输入一个 FASTA 文件里的氨基酸序列输出预测出的 3D 结构以及 pLDDT 置信度每个位置我有多确定的分数它在 CASP14 这类国际结构预测大赛里的表现直接改变了解析一个结构要排多久的队这个问题的答案——很多目标从排不上实验变成排队跑 GPU。技术原理拆开来看不用被深度神经网络吓到整个流程可以拆成四步每步都有对应的仓库模块可以翻代码。第一步让序列去翻进化史同一家族的蛋白在亿万年演化中互相抄改把待测序列和海量数据库BFD、UniRef90、MGnify 等里的序列两两比对、对齐成一张大表——这就是多序列比对MSA。哪些位置世代不变说明那儿的氨基酸动不得结构约束就来自这里。第二步到已知结构库里找参考PDB 里存着近 20 万个实验解析过的结构仓库会下载约 19.9 万个 mmCIF 文件。如果目标蛋白的某个片段和某个已知结构长得像就借来当地基只把没见过的部分交给模型猜。这一步在alphafold/data/templates.py里实现。第三步神经网络把结构拼出来MSA 加上模板信息一起喂进网络核心是大量注意力机制层——简单说就是让每个氨基酸看一眼全序列判断自己和谁离得近、谁和谁该成对。模型会反复回收recycling自己的输出再算一遍细节一轮比一轮扎实。几何模块alphafold/model/geometry/负责把坐标旋转、平移这些空间运算做得又快又稳。第四步结构再坐一会儿预测完的结构局部几何可能略有别扭alphafold/relax/模块会用 Amber 力场做弛豫优化relaxation相当于让结构在物理力场里回炉坐一坐把原子摆到更舒服的位置。v2.3.0 的升级值得一提训练数据截止日推迟到 2021-09-30多了约三成训练数据其中电镜结构翻了 4 倍、大于 2000 残基的大复合物翻了一倍训练裁剪从 384 残基扩到 640 残基训练时链数从 8 提到 20。也就是说越大的蛋白复合物新版越吃香。详见 docs/technical_note_v2.3.0.md。能用在哪些真实场景生物医学研究先拿结构再谈设计用它做什么把候选药物靶点的序列喂进去拿到三维结构观察口袋、结合位点、突变效应得到什么不用等实验结构就能开始做理性设计和虚拟筛选的初步判断多靶点筛选可以借 server/ 的 JSON 批量任务格式自动化结构生物学给实验当脚手架用它做什么对难结晶蛋白先跑预测拿预测结构去指导结晶条件优化、冷冻电镜模型搭建得到什么实验排障周期缩短复合物已知化学计量时用 AlphaFold-Multimer 直接预测多链组装注意官方提示多链模型仍在完善中稳定性暂不如单体版教学与入门零硬件门槛用它做什么仓库自带 notebooks/AlphaFold.ipynb 笔记本云端点一下就能体验简化版流程得到什么学生不用买 GPU 就能完整走一遍序列进、结构出的全过程理解 MSA、置信度这些概念30 秒上手路径最省力路线在线笔记本打开仓库里的 AlphaFold.ipynb按提示把序列贴进去即可——这是官方提供的简化体验版适合先验证思路。本地完整部署四步跑通正式部署要求Linux 一块 NVIDIA GPU磁盘需求较大完整数据库下载 556 GB、解压后约 2.62 TB官方建议 SSD也可以选精简数据库预设600 GB 即可。核心流程git clone https://gitcode.com/GitHub_Trending/al/alphafold cd alphafold bash scripts/download_all_data.sh 下载目录之后装好 Docker 和 NVIDIA Container Toolkit构建镜像最后用 docker/run_docker.py 指向你的 FASTA 文件发起预测--model_preset可切换monomer、monomer_ptm、multimer等模型--db_presetreduced_dbs可降配硬件。完整参数说明都在 README.md 的 Running AlphaFold 一节逐条查得很方便。它凭什么被选精度有实锤CASP14 夺冠级表现 CASP15 基线预测集docs/casp15_predictions.zip公开可对照预测置信度 pLDDT 随结构一起给出覆盖面广单体、多链复合物、带置信度头的模型三套预设并存v2.3.0 还专门强化了大复合物可裁剪的部署成本full_dbs/reduced_dbs两档数据库预设让 8 核 8G 的机器也能跑不必一步到位买 3TB 存储开放的生态代码 Apache 2.0、模型参数 CC BY 4.0文档和数据库下载脚本scripts/全在仓库里社区 issue 反馈活跃数据库下载动辄几百 GB劝退的是硬盘不是脑子。先用在线笔记本把流程跑通再决定本地部署的档位——花一个下午跑通第一个预测你会回来感谢自己。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进