基于深度强化学习的非小细胞肺癌稳健且关注生活质量的治疗方案

root 提交于 周六, 09/05/2026 - 20:47
在当前转移性癌症的全身治疗中,药物通常以最大耐受剂量(maximum tolerable dose,MTD)持续给药,直至出现不可接受的毒性或疾病进展。然而,遗憾的是,对许多患者而言,这种治疗策略会导致治疗耐药性的产生。进化疗法旨在利用生态—进化相互作用,阻止或延缓癌症治疗耐药性的发生。Zhang等人提出的适应性治疗方案是其中广为人知的一种实施方式,该方案利用肿瘤负荷阈值指导策略性治疗暂停。近年来,深度强化学习(deep reinforcement learning,DRL)已被用于优化此类方法。然而,迄今为止,将DRL与进化疗法相结合的研究主要聚焦于疾病进展时间(time to progression,TTP)这一性能指标,尚未从对延迟重新开始治疗的稳健性角度量化治疗安全性,也未在治疗设计中纳入患者对生活质量(quality of life,QoL)的偏好。在本研究中,我们利用由数学双群体肿瘤生长模型提供信息的DRL智能体,为非小细胞肺癌(non-small cell lung cancer,NSCLC)患者设计治疗方案。该智能体基于虚拟患者队列进行训练,所用参数此前已根据接受厄洛替尼治疗的NSCLC患者数据完成拟合。除TTP外,我们重点关注提高对延迟重新开始治疗的稳健性,以及个体偏好和价值观如何影响治疗期间的生活质量。我们比较了DRL策略、Zhang等人的适应性治疗方案与MTD方案下的TTP、稳健性和QoL。我们引入了稳健性指标“失效裕度”(margin-to-failure,MTF),并比较了不同患者偏好特征下的质量调整生存期(quality-adjusted survival,QAS)。最后,我们探索了奖励塑形,以评估如何将QoL偏好纳入基于DRL的治疗设计。为评价研究结果,我们考察了不同的治疗决策间隔,即两次剂量调整之间的时间间隔。与另外两种方案相比,在所有治疗决策间隔下,DRL策略均取得了更高的TTP、MTF和QAS中位数。随着决策间隔延长,DRL方案下的TTP逐渐下降,并趋近于MTD方案所达到的水平。相比之下,Zhang等人的方案表现不稳定,可能导致疾病过早进展。此外,在虚拟患者队列上训练的群体层面策略产生了一条具有可解释性的治疗规则:该规则能够延长大多数此前未见患者的TTP,并表明在监测频率较低时,应在更低的肿瘤负荷下恢复治疗。这些发现表明,DRL能够在保留药物敏感细胞以抑制耐药性这一获益,与肿瘤不安全性再生长风险之间实现平衡。奖励塑形进一步展示了如何调整治疗策略,以反映不同患者的偏好。总体而言,这些结果为在NSCLC等快速生长的癌症中设计具有生物学依据、稳健且以患者为中心的进化疗法提供了一种方法。

利用深度强化学习设计非小细胞肺癌中稳健且关注生活质量的治疗方案 | 生活质量的治疗方案

查看 ORCID 主页

Laura R. Jansén-Storbacka,

查看 ORCID 主页

Anne-Marie C. Dingemans,

查看 ORCID 主页

Kateřina Staňková,

查看 ORCID 主页

Alethea B. T. Barbaro,

查看 ORCID 主页

Sepinoud Azimi

doi:

https://doi.org/10.64898/2026.09.01.748242

Laura R. Jansén-Storbacka 1 代尔夫特理工大学;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Laura R. Jansén-Storbacka 的 ORCID 记录

通讯作者:

laura.ruth.stocker{at}outlook.com

Anne-Marie C. Dingemans 2 伊拉斯姆斯医学中心

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Anne-Marie C. Dingemans 的 ORCID 记录

Kateřina Staňková 1 代尔夫特理工大学;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Kateřina Staňková 的 ORCID 记录

Alethea B. T. Barbaro 1 代尔夫特理工大学;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Alethea B. T. Barbaro 的 ORCID 记录

Sepinoud Azimi 1 代尔夫特理工大学;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Sepinoud Azimi 的 ORCID 记录

摘要

信息/历史

指标

补充材料

数据/代码

预览 PDF

摘要

在当前的转移性癌症全身治疗中,通常会以最大耐受剂量(MTD)持续用药,直至出现不可接受的毒性或疾病进展。然而,遗憾的是,这种治疗策略会导致许多患者产生治疗耐药性。进化疗法旨在利用生态—进化相互作用,防止或延缓癌症治疗耐药性的出现。其中一种广为人知的实施方案是 Zhang 等人提出的适应性治疗方案,该方案利用肿瘤负荷阈值指导策略性治疗假期。

近年来,深度强化学习(DRL)已被用于优化此类治疗方法。然而,迄今为止,将 DRL 与进化疗法相结合的研究主要聚焦于疾病进展时间(TTP)这一性能指标,尚未从对延迟重启治疗的稳健性角度量化治疗安全性,也未将患者对生活质量(QoL)的偏好纳入治疗设计。

在本研究中,我们利用由数学双群体肿瘤生长模型提供信息的 DRL 智能体,为非小细胞肺癌(NSCLC)患者设计治疗时序。该智能体基于虚拟患者队列进行训练,所使用的参数此前已根据接受厄洛替尼治疗的 NSCLC 患者数据进行拟合。除 TTP 外,我们重点考察提高治疗对延迟重启的稳健性,以及个体偏好和价值观如何影响治疗期间所经历的生活质量。

我们比较了 DRL 策略、Zhang 等人的适应性治疗方案和 MTD 方案下的 TTP、稳健性及 QoL。我们引入了稳健性指标“失效裕度”(MTF),并比较了不同患者偏好特征下的质量调整生存期(QAS)。最后,我们探索了奖励塑形,以评估如何将 QoL 偏好纳入基于 DRL 的治疗设计。为评价研究结果,我们考察了不同的治疗决策间隔,即两次给药调整之间的时间间隔。

与另外两种治疗方案相比,在所有治疗决策间隔下,DRL 策略均获得了更高的 TTP、MTF 中位数和 QAS。

随着决策间隔延长,DRL 下的 TTP 逐渐下降,并趋近于 MTD 下的水平。相比之下,Zhang 等人的方案表现不稳定,可能导致过早进展。此外,在虚拟患者队列上训练的人群层面策略产生了一条具有可解释性的治疗规则:对于大多数此前未见过的患者,该规则延长了 TTP;同时表明,在监测频率较低时,应在更低的肿瘤负荷下恢复治疗。这些发现表明,DRL 能够在保留药物敏感细胞以抑制耐药性所带来的获益,与肿瘤不安全性再生长的风险之间实现平衡。奖励塑形进一步展示了如何调整治疗策略,以反映不同患者的偏好。总体而言,这些结果为在 NSCLC 等快速生长的癌症中设计具有生物学依据、稳健且以患者为中心的进化疗法提供了一种方法。

利益冲突声明

脚注

https://gitlab.tudelft.nl/evolutionary-game-theory-lab/drl_for_qol_awar…

资助者信息声明

荷兰科学研究组织(NWO),VI.Vidi.213.139,OCENW.KLEIN.277

欧盟“地平线 2020”研究与创新计划玛丽·斯克沃多夫斯卡-居里资助项目,955708

版权

本预印本的。

本预印本依据 CC-BY-NC-ND 4.0 国际许可协议提供。

返回顶部

上一篇

下一篇

发布于 2026 年 9 月 4 日。

下载 PDF

补充材料

数据/代码

电子邮件

感谢您有意向传播 生活质量的治疗方案

邮件主题

(您的姓名)从 bioRxiv 向您转发了一个页面

邮件正文

(您的姓名)认为您可能会对 bioRxiv 网站上的这一页面感兴趣。

您的个人留言

验证码

此问题用于测试您是否为人类访客,并防止自动垃圾邮件提交。

分享

利用深度强化学习设计非小细胞肺癌中稳健且关注生活质量的治疗方案

Laura R. Jansén-Storbacka,

Anne-Marie C. Dingemans,

Kateřina Staňková,

Alethea B. T. Barbaro,

Sepinoud Azimi

bioRxiv

2026.09.01.748242;

doi:

https://doi.org/10.64898/2026.09.01.748242

分享本文:

复制

引文工具

利用深度强化学习设计非小细胞肺癌中稳健且关注生活质量的治疗方案

Laura R. Jansén-Storbacka,

Anne-Marie C. Dingemans,

Kateřina Staňková,

Alethea B. T. Barbaro,

Sepinoud Azimi

bioRxiv

2026.09.01.748242;

doi:

https://doi.org/10.64898/2026.09.01.748242


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.01.748242v1?rss=1

🏷️ 非小细胞肺癌 深度强化学习 进化疗法 自适应治疗 肿瘤耐药性 生活质量