癌症基因組學AI在乳腺癌與結直腸癌測試中達到p < 0.0001的顯著性水平

  |  

識別癌症驅動基因一直是生物學中最棘手的問題之一。如今,一種名爲RegNetAgents的全新框架正將多智能體人工智能應用於這一挑戰,實現了過去需要耗費大量人力在不兼容的數據集上進行人工篩選的自動化流程。對於從事癌症基因組學、人工智能和計算生物學交叉研究的研究人員而言,該方法代表着調控候選基因識別和排序方式的重大變革。

要點總結

  • RegNetAgents 是一個基於人工智能的多智能體框架,它能夠識別異質癌症網絡中的調控基因候選者,整合了腫瘤整體數據 (TCGA) 和單細胞數據 (GREmLN)。
  • 該框架應用於 11 個乳腺癌和 12 個結直腸癌焦點基因,產生了在統計學上顯著富集 OncoKB 註釋癌症基因的候選基因(所有 p <0.0001)。
  • 富集評分達到 Stouffer Z = 6.69(TCGA,乳腺癌)和 Z = 7.06(GREmLN,結直腸癌),在管家基因或非驅動對照基因集中未檢測到富集。
  • 該系統以 LangGraph DAG 工作流的形式實現,可通過統一的 Python API 和 MCP 客戶端訪問——作爲預計算網絡的下游層運行,而不是網絡推理引擎。
  • 擴展模塊評估致癌潛力、藥物可及性、臨牀相關性和網絡脆弱性,以支持假設生成。

爲什麼跨網絡分析會改變局面

癌症基因組學研究長期以來一直面臨着數據碎片化的問題。來自TCGA等大型項目的腫瘤羣體測序數據雖然能夠捕捉到數千名患者的羣體水平信號,但卻缺乏單細胞測序所提供的細胞分辨率。與此同時,像GREmLN項目構建的單細胞調控網絡則提供了羣體數據無法複製的精細基因水平信息。過去,研究人員不得不將這兩種數據分開處理。

RegNetAgents 直接彌合了這一差距。通過將 TCGA 衍生的腫瘤基因調控網絡與 GREmLN 的大規模單細胞調控網絡整合,該框架能夠同時對兩種數據類型進行統一的分析。對於給定的目標基因,系統首先對來自每個網絡的調控候選基因進行分類,然後根據證據一致性對其進行排序——標記出候選基因是否同時出現在兩個網絡中、僅出現在 TCGA 網絡中,或僅出現在 GREmLN 網絡中。這種跨網絡排序正是其強大解讀能力的來源。

初步分析的範圍涵蓋了11 個乳腺癌焦點基因12 個結直腸癌焦點基因,爲兩種研究最多的癌症類型提供了一個具體的測試平臺。

RegNetAgents 的實際功能

分類、過濾和作用方式分配

該框架的核心在於針對每個目標基因執行三個相互關聯的功能。首先,它進行雙網絡分類——對TCGA和GREmLN數據庫中出現的調控關係進行分類。其次,它利用OncoKB註釋(癌症基因重要性方面最權威的數據庫之一)篩選候選基因,以區分可能與癌症相關的調控因子和背景噪聲。第三,它爲每個腫瘤來源的調控關係分配作用模式,明確候選基因在該背景下是作爲激活因子還是抑制因子發揮作用。

這些步驟共同將原始網絡拓撲結構轉化爲可解釋的生物學意義——這在以前需要大量專家時間才能完成。

底層採用多智能體 LangGraph 工作流

RegNetAgents 的技術架構基於LangGraph DAG(有向無環圖)工作流,這是一種多智能體設計模式,它通過結構化的、查詢驅動的流程來協調各種專用 AI 智能體。該系統可通過統一的 Python API 和模型上下文協議 (MCP) 客戶端訪問,因此可以方便地部署到現有的計算生物學環境中。

至關重要的是,RegNetAgents 並非網絡推斷工具。它作爲預先計算的調控網絡的下游分析層運行,這意味着它解讀和分析現有的網絡數據,而不是從原始表達數據構建新的網絡。這種區別至關重要:它使系統保持專注、計算高效且易於解釋——同時將上游網絡構建的質量排除在其直接影響範圍之外。

性能:強烈的富集信號,清晰的控制結果

乳腺癌和結直腸癌分析統計結果不容忽視。在TCGA衍生候選基因中,OncoKB註釋的癌症基因富集程度分別達到了Stouffer Z評分6.69(乳腺癌,BRCA)6.95(結直腸癌,COAD) 。GREmLN衍生候選基因也顯示出類似的強度: BRCA的Z評分爲5.51COAD的Z評分爲7.06 ,所有結果的p值均低於0.0001。

這些數據更具說服力的原因在於對照組的表現。當對管家基因和非驅動對照基因集進行同樣的富集分析時,並未出現顯著的富集現象。這種特異性——癌症基因集中出現信號,而對照組中則無信號——表明該框架並非僅僅識別出廣泛的生物學噪聲,而是識別出了具有真正腫瘤學意義的候選基因。

擴展的評估層,以獲得更深入的洞察

除了候選基因的識別之外,RegNetAgents 中的一個擴展模塊還會對每個入圍基因進行更深入的評估。該模塊評估基因的致癌潛能、成藥性、臨牀相關性和網絡脆弱性——這四個維度共同決定了一個調控候選基因是否具有真正的轉化價值。一個基因可能在癌症網絡中高度富集,但卻不具備可行的治療靶點;該模塊能夠及早發現並區分這種差異。

識別和結構化評估的結合意味着該框架可以將研究問題從原始網絡查詢一直推進到生物學上可解釋的假設的優先列表——作者稱之爲端到端解釋。

這在更廣泛的研究工具箱中處於什麼位置?

RegNetAgents 的出現反映了計算腫瘤學領域的一個更廣泛的趨勢:從生成數據的工具轉向解讀數據的工具。來自 TCGA、GREmLN 和類似資源的龐大調控網絡數據已經遠遠超過了人工分析能力。旨在跨這些網絡運行結構化、可復現查詢的多智能體人工智能框架解決了這一真正的瓶頸。

通過圍繞 OncoKB 癌症基因過濾構建系統,該框架還將候選輸出與已建立的臨牀註釋標準保持一致——這對於需要將計算結果與現有生物學知識聯繫起來的研究人員來說是一個實際的考慮因素。

這項研究由 Jose Bird 撰寫,是其博士論文,於 2026 年 7 月發表。該框架是否能完全擴展到乳腺癌和結直腸癌以外的其他癌症類型,仍然是一個懸而未決的問題——這個問題很可能會決定該方法下一階段的測試方向。

常問問題

RegNetAgents是什麼?

RegNetAgents 是一個基於人工智能的多智能體框架,旨在用於癌症基因組學中的跨網絡調控候選基因識別。它將腫瘤調控網絡(來自 TCGA)與單細胞調控網絡(來自 GREmLN)整合,以識別和排序與癌症生物學相關的基因調控候選基因。

RegNetAgents集成了哪些數據源?

該框架整合了來自 TCGA 項目的腫瘤基因調控網絡和來自 GREmLN 項目的大規模單細胞調控網絡,從而能夠對兩種數據模式進行統一分析。

RegNetAgents如何評估候選基因?

對於每個目標基因,該方法執行雙網絡分類,利用OncoKB癌症基因註釋篩選候選基因,併爲腫瘤來源的調控關係分配作用模式。然後,根據候選基因在不同網絡中的證據一致性對其進行排序——即它們是否同時出現在TCGA和GREmLN數據庫中,或者僅出現在其中一個數據庫中。

RegNetAgents 還提供哪些其他分析?

擴展模塊評估每個候選者的致癌潛力、成藥性、臨牀相關性和網絡脆弱性,支持從識別到轉化評估的全面生物學解釋和假設生成。

本文由人工智能輔助生成,並經編輯團隊審覈。

推薦閱讀

相關文章

DeepSeek新一輪融資估值710億美元:數週內估值飆升42%

DeepSeek已重返融資市場。據《金融時報》報道,這家中國人工智能初創公司在完成首輪外部融資僅數週後,就以710億美元的投前估值尋求新一輪融資。這一數字比該公司在2026年6月投後估值500億美元的估值高出約42%——而此次估值調整僅用了不到兩個月的時間。

霍夫曼:SpaceX 的人工智能戰略是購買相關性,而不是創造相關性。

裏德·霍夫曼多年來一直以內部人士的身份觀察硅谷——他曾是創始人、投資人,並在微軟擔任了十年的董事會成員。因此,當他指出SpaceX的人工智能戰略不過是購買影響力而非構建能力,並將xAI形容爲“徹底的災難”時,他的話語擲地有聲,因爲他真正瞭解內情。

35萬美元,零股權:谷歌人工智能創業公司扶持的真實成本是多少?

谷歌帝國的邊緣正在發生一些微妙卻意義重大的變化。前員工——工程師、研究人員和人工智能專家——紛紛離職創辦公司。谷歌並沒有眼睜睜地看着這些人才永久流失,而是爲他們搭建了一條重返谷歌的途徑。

傑夫·貝佐斯駁斥人工智能將導致失業的擔憂,Prometheus 獲得 120 億美元融資

傑夫·貝佐斯現在說了一些大多數人都不想聽到的話:他通過普羅米修斯項目籌集的人工智能就業資金不會導致美國出現大規模失業潮,至少不會像許多人擔心的那樣。這位亞馬遜創始人認爲,人工智能將提高生活水平,使勞動力更加稀缺,而不是更容易被取代。這與主流觀點截然不同。

受與諾和諾德達成交易的影響,Veru股票盤中飆升4倍,RSI發出警告

6月4日,Veru股價大幅飆升,從約2.18美元一路攀升至盤中高點7.33美元,最終收於4.23美元。此次暴漲的導火索是Veru與諾和諾德公司達成臨牀供應協議,雙方將共同開展一項針對肥胖症的2b期臨牀試驗,評估其藥物enobosarm。

人腦支持人工智能遞歸式自我改進,引發控制擔憂

Anthropic 希望人工智能遞歸自我改進成爲構建先進系統的方式之一——這個想法既引人注目又令人不安。在2026年6月4日發佈的一篇博文中,Anthropic公司公開表示支持研究人員所稱的“人工智能遞歸式自我改進”:即人工智能系統通過循環迭代,不斷提升自身設計和構建下一代人工智能系統的能力。