5.2 动态建模方法:推演未来轨迹


5.2 动态建模方法:推演未来轨迹

本节摘要:四阶段模型是"命名",动态建模是"计算"。同一疾病进程,离散视角用马尔可夫链描述状态之间的跳转概率,连续视角用微分方程刻画生理量的连续演化,数据驱动视角用深度时序模型从纵向数据里学习轨迹模式。三类方法各有适用边界,也能互补。本节给出每种方法的原理、一个代码示意与一个应用案例。

学习目标

阅读完本节,你应当能够:

  1. 区分离散状态机与连续动力学两种时间观。
  2. 解释马尔可夫性质及其在临床决策中的含义。
  3. 写一个简单的状态转移概率计算片段。
  4. 说明轨迹建模如何识别进展方向与干预拐点。

一、两种时间观,两种建模哲学

临床医生与患者的交流用的是离散时间:"病情稳定""进入缓解期""进展到晚期"。生理学家的测量是连续的:炎症因子浓度每分钟都在振荡,血糖每时每刻在波动。这两套时间观没有谁对谁错,只是建模的选择不同。

离散观把疾病切成有限状态,用"状态 + 跳转概率"描述进程,代表作是马尔可夫链。连续观把疾病当作随时间演化的连续变量,用微分方程描述变化率,代表作是肿瘤生长模型。数据驱动观不预设方程,直接从纵向数据里学,代表作是深度时序模型。理解三类方法的分工,是本节的目标。

二、马尔可夫链:离散状态跳转

马尔可夫链的核心假设是"无记忆性":系统下一时刻处于哪个状态,只取决于当前状态,与过去路径无关。听起来简化得过分,但它恰好匹配临床决策的逻辑——一位糖尿病患者的糖化血红蛋白 9%,医生关心的不是他三年前怎么吃,而是此刻的高血糖状态本身对肾小球滤过率下降的风险贡献。

应用马尔可夫链建模疾病进程,需要定义状态集合与转移概率矩阵。状态可以是"健康、亚临床、早期、并发症"这样的临床阶段,转移概率来自队列随访数据。下面是一段概念性的计算示意:

# 概念示意:糖尿病进程的马尔可夫状态转移 # 状态:0健康 1糖尿病前期 2糖尿病 3微血管并发症 trans = [ [0.85, 0.12, 0.03, 0.00], # 从健康出发 [0.10, 0.70, 0.18, 0.02], # 从前驱期出发 [0.00, 0.05, 0.80, 0.15], # 从糖尿病出发 [0.00, 0.00, 0.10, 0.90], # 从并发症出发 ] # 五年后各状态的概率分布 state = [1.0, 0.0, 0.0, 0.0] for _ in range(5): state = [sum(state[i] * trans[i][j] for i in range(4)) for j in range(4)] print(state) # 从健康出发,五年后各状态的概率

这段示意展示了马尔可夫链的用途:给定起始状态,推演未来若干年的状态分布。卫生经济学用它评估"筛查比不筛查省多少钱",指南制定者用它比较不同干预策略的长期结局。它的代价是把连续的生物学进程离散化——状态定义不同,结论就不同。

三、微分方程:连续量的演化

当问题变成"肿瘤体积如何随时间生长""血糖浓度如何随时间变化",离散状态不够用,需要连续动力学。经典肿瘤生长模型是逻辑斯蒂方程:

dN/dt = r*N*(1 - N/K) N:肿瘤细胞数量 r:生长速率 K:环境承载量

这个方程描述了一个关键事实:肿瘤早期近似指数生长,接近承载量后增速放缓,形成 S 形曲线。改变参数 r(如化疗降低增殖率)或 K(如抗血管生成压缩承载量),就模拟了干预效果。

微分方程的优势是机制透明——每个参数都有生物学含义,可以解释"为什么"。代价是需要先验知识:方程形式对不对、参数怎么估计,都依赖对机制的假设。对机制尚不清楚的疾病,强行套方程等于把假设当结论。

四、深度时序模型:从数据里学轨迹

第三类方法不预设方程,直接让模型从纵向数据里学习轨迹模式。电子健康档案里躺着成千上万患者的多年随访记录,深度时序模型可以从中学到"什么样的早期轨迹指向快速进展"。

它的应用模式是轨迹聚类:把患者的时序数据分成几类轨迹,每一类对应一种疾病亚型。比如心力衰竭患者可以按射血分数、炎症指标、住院频率的轨迹聚出"快速进展型""稳定型""波动型"三类,三类需要的随访强度与治疗方案不同。这类方法擅长捕捉传统建模抓不住的非线性模式,代价是可解释性差——模型说"这条轨迹危险",但说不出机制。

五、三种方法怎么选

选择标准看三个问题:机制清楚吗?数据稀疏吗?要解释还是只要预测?机制清楚、数据规律性强,用微分方程;数据量大、机制不明,用深度时序模型;中间地带(临床决策导向、需要长期推演),用马尔可夫链。

实际操作中三者常组合使用:用马尔可夫链做卫生经济学评估,用微分方程描述核心生理过程,用深度学习补足未知的高阶耦合。回到糖尿病的例子——β 细胞功能衰退可以用微分方程描述,并发症风险用马尔可夫链推演,血糖波动的个体化预测交给时序模型,三层各有分工。

⚠️ 常见坑:迷信模型的预测数字。任何模型都在做外推,外推的前提是"未来延续过去"——遇到环境剧变(新治疗上市、生活方式改变),模型预测立刻失真。预测要配置信区间,更要配"模型在什么条件下会失效"的说明。

从预测到反事实

动态建模的终点不是"预测他明年会怎样",而是回答反事实问题:"如果去年就开始干预,他现在会怎样?"模型一旦建立,就可以反复改写参数:把某条通路的增益调小(模拟药物)、把暴露曲线抹平(模拟生活方式改变)、把筛查提前两年(模拟早期发现),然后对比不同世界线的结局。这种反事实推演是第 7 章防控方案设计的基本动作——每个干预方案的"预期获益",本质上都是模型在改写世界线后算出来的差值。当然,模型的反事实可信度取决于机制的正确性,模型错,所有"世界线"都是幻觉。

数据稀疏时的建模策略

临床建模最常见的数据困境是"缺数据":随访间隔不等、指标缺失、样本量小。应对策略有层次。最朴素的是插值——用相邻测量填补空缺,但假设了线性变化。更稳健的是状态空间模型:把观测值看作"真实状态的带噪读数",用滤波算法同时估计真实轨迹与测量噪声。更高阶的是借用群体信息:用贝叶斯分层模型把相似患者的进展模式借给数据少的个体。选择哪一档,取决于问题的关键性——决策风险高的问题,值得上复杂模型;只是趋势监控,插值就够。

本节要点回顾

  • 两类时间观:离散状态与连续变量,对应不同的数学语言。
  • 马尔可夫链:无记忆性假设匹配临床决策逻辑,适合长期卫生经济学推演。
  • 微分方程:机制透明可解释,但依赖先验知识。
  • 深度时序模型:从数据学轨迹,擅长非线性但可解释性差。
  • 方法跟着问题走:先定决策问题,再选建模方法,必要时三层组合。

时间线画好了,画面里还缺一块:疾病为什么偏偏落在这个人身上?第 6 章勘查作案环境。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U