人類體內約有 20000 個與疾病相關的蛋白質編碼基因,但目前只有約 10% 被現有藥物成功靶向。
在傳統實驗中,科學家們用“分子對接”來虛擬篩選藥物,這不僅耗時耗錢,也難以覆蓋如此龐大的靶點數量。長久以來,科學家們都在苦苦探索一種更高效、更魯棒的方法。
就在今天,清華大學聯合研究團隊給出了一個新的“解法”,創新地提出了“AI 對比深度學習”框架——DrugCLIP。
據介紹,該框架可實現超高速且高精度的虛擬篩選,其速度最高可比傳統分子對接方法快 10 萬倍,并在多項 in silico 基準測試中持續優于多種基線方法。相關研究成果已發表在權威科學期刊Science上。
![]()
論文鏈接:
https://www.science.org/doi/10.1126/science.ads9530
該論文的 5 位共同一作均來自清華大學,分別:Yinjun Jia、Bowen Gao、Jiaxin Tan、Jiqing Zheng、Xin Hong。通訊作者為:清華大學萬國數據教授&智能產業研究院(AIR)副院長蘭艷艷、清華大學生命科學學院助理教授張偉、清華大學生命科學學院副教授閆創業、清華大學化學系教授劉磊。
DrugCLIP是什么?
DrugCLIP 的核心創新點是將虛擬篩選重新定義為一種密集檢索(dense retrieval)任務。
具體來說,模型分別將蛋白結合口袋和小分子編碼成向量,并映射到同一個表示空間中,只需比較兩者的相似程度,就能判斷小分子是否可能與蛋白結合。
通過對比學習,模型拉近正樣本蛋白–配體對的表示,拉遠無關分子,從而在海量分子中快速篩出最有可能結合的候選者,使虛擬篩選從高成本計算轉向高效檢索。
![]()
圖|DrugCLIP 框架
1.訓練流程
在預訓練階段,研究團隊提出了 ProFSA 框架,從已有的蛋白結構中生成大規模合成數據。他們基于蛋白質數據庫 PDB 構建了約 550 萬對訓練樣本。
該框架將蛋白內部的短肽片段視作“偽配體”,其周圍區域視作“偽結合口袋”。由于蛋白內部相互作用與蛋白–小分子結合在物理機制上高度相似,這種方式可以在沒有真實配體的情況下,讓模型提前學習結合規律。
隨后,研究團隊對預訓練模型進行了微調,即使用真實解析的蛋白–小分子復合物進行聯合優化。考慮到虛擬篩選中往往無法獲得分子的真實結合構象,他們采用 RDKit 生成隨機構象進行數據增強,使模型更貼近真實應用場景。
最終,在實際篩選時,DrugCLIP 只需計算向量相似度即可完成排序,大幅提升了篩選效率,為超大規模藥物研發提供了現實可行的技術路徑。
2.GenPack 策略
在通過計算機模擬(in silico)和濕實驗(wet-lab)驗證 DrugCLIP 模型的有效性之后,研究團隊將其進一步應用于計算預測得到的蛋白質結構。但 DrugCLIP 對蛋白側鏈的誤差并不敏感,為了進一步釋放預測結構的潛力,研究團隊提出 GenPack(Generation-Packing) 策略。
GenPack 通過在固定蛋白骨架條件下生成候選分子,反向“引導”蛋白口袋進入更有利于結合的狀態,并在隨后進行結構精修。
借助這一策略,DrugCLIP 在 AlphaFold2 預測結構和 apo 結構上的活性分子富集能力均顯著提升,整體性能優于此前常用的基于物理模型的方法。
基于DrugCLIP的全基因組虛擬篩選
研究團隊使用 DrugCLIP 模型對來自 ZINC 和 Enamine REAL 數據庫的 5 億多種類藥小分子進行了大規模虛擬篩選。
整個過程共完成了超過 10 萬億次蛋白–配體打分計算,但僅在一臺配備 8 張 A100 GPU 的計算節點上、約 24 小時內完成,顯示出該方法在效率上的顯著優勢。
最終,他們構建了 GenomeScreenDB 數據庫,覆蓋近 1 萬個人類靶點、2 萬多個結合口袋,共收錄 200 多萬個潛在命中小分子。相關分子結構、對接構象及評分信息均已對外開放,開創了后 AlphaFold 時代藥物研發新范式。
![]()
圖|全基因組虛擬篩選結果的 t-SNE 可視化及示例。
實驗結果
實驗表明,DrugCLIP 速度最高可比傳統分子對接方法快 1000 萬倍。
在對包含約 264 萬個分子的 LIT-PCBA 數據集進行篩選時,傳統分子對接軟件 Glide-SP 需耗時約3 天,而 DrugCLIP 在順序計算模式下僅需 38 秒;在使用 GPU 并行計算時,完成相同計算量所需時間更僅為 0.023 秒。
![]()
圖|在 LIT-PCBA 數據集上的篩選速度對比。
在濕實驗中,DrugCLIP 針對去甲腎上腺素轉運體取得了15% 的命中率,并成功解析了兩種篩選得到的抑制劑與靶蛋白的復合物結構。對于甲狀腺激素受體相互作用因子 12(TRIP12)這一缺乏全配體結構和小分子結合物的靶點,DrugCLIP 僅依賴 AlphaFold2 預測結構便實現了17.5% 的命中率。
![]()
圖|濕實驗的實驗結果。
隨著 AlphaFold3、RoseTTAFold All-Atom 等新一代結構預測模型,以及結構–親和力聯合預測方法的不斷成熟,虛擬篩選正從“快速搜索”邁向“精準決策”。
研究團隊表示,在未來的研究中,將 DrugCLIP 等超高速虛擬篩選框架與新一代結構建模及親和力預測技術相融合,有望在整個人類基因組范圍內實現更深入、更系統的藥物發現研究,有助于構建更精確的“可成藥基因組”圖譜,為提高藥物研發的效率奠定堅實基礎。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.