4.4 真实卷宗选编:从社交网络到药物研发


4.4 真实卷宗选编:从社交网络到药物研发

本节摘要:本节巡览五类高频应用现场——社交网络、推荐系统、生物化学、知识图谱、交通预测——每类现场按"图怎么建、模型怎么选、指标怎么看、坑在哪"四栏归档。选编的目的是把前几章的技术映射回业务语言,读完应能对新业务做"先查表、再动手"的初诊。

卷宗室的五排档案柜

三级结案能力练成之后,侦探社正式对外开放接案。卷宗室的档案柜按行业分五排,每排的卷宗各有各的建图方式与办案习惯——同样的消息传递骨架,在不同现场要换不同的"行话"。本节是第四章的收官,也是全册从理论走向业务的中转站:我们把每类现场的建模要点整理成统一格式的档案卡,配一张应用矩阵总览图。读法建议是"先看图建方式":任何新业务进门,先想清楚"节点是什么、边是什么、任务在哪一级",答案出来,选型表的行也就锁定了。

图:五类应用现场的能力矩阵

图:五类应用现场的能力矩阵

社交网络:结构与行为互证

社交现场的经典建图方式是以用户为节点、以关注或互动为边,风向标是"结构信号与行为信号互证":欺诈团伙的行为特征可以伪造,但互注关系网很难长期伪装。欺诈检测是节点级任务,难点在不平衡与对抗——黑产会持续变换设备与内容特征,结构模式相对稳定,这正是图方法的护城河。好友推荐是边级任务,"可能认识的人"就是链接预测的界面化。社区发现走聚类路线,用于内容分发与营销分层。坑集中在两点:边的语义混杂(关注、点赞、转发混作一谈会稀释信号,应分边类型或分图处理)与静态化(图是活的,按时间切片重估才能跟上团伙演化)。

推荐系统:二部图上的链接预测

推荐现场的建图是用户与商品构成的二部图,互动记录连边。冷启动是老难题——新用户没有边,图方法反而能借"注册渠道、设备指纹"等属性边把新节点挂进图里,再用归纳式模型当场出表示,这是 GraphSAGE 系在工业界的主战场。规模是另半场仗:亿级节点的全图计算不可行,重要度采样与负采样工程(如热门商品降采样)决定成败。业务指标与离线指标经常背离——离线曲线下面积漂亮但点击率不动,通常是分布漂移(训练数据是历史的,线上是当下的)与反馈回路(推荐结果反过来塑造了新互动)作祟,需按时间切分训练并做在线对照。

# 社交欺诈检测的"结构特征+GNN"混合方案骨架 import torch from torch_geometric.nn import SAGEConv class FraudNet(torch.nn.Module): """节点属性走多层感知机,结构走图卷积,双通道融合""" def __init__(self, in_dim, hid=32): super().__init__() self.attr = torch.nn.Sequential( torch.nn.Linear(in_dim, hid), torch.nn.ReLU()) self.s1 = SAGEConv(in_dim, hid) self.fuse = torch.nn.Linear(hid * 2, 2) # 融合层 def forward(self, x, ei): a = self.attr(x) # 行为画像通道 s = self.s1(x, ei).relu() # 结构证据通道 return self.fuse(torch.cat([a, s], dim=-1)) # 训练要点(承接 4.1 节):加权交叉熵处置不平衡, # 按时间切图防止"未来信息"泄漏进训练

生物化学:小图大军

分子现场的每个样本是独立小图,天然适合图级任务与批处理训练。原子特征与键特征是决定性输入——元素类型、价态、电荷、键型、共轭性——消息传递的边特征通道(MPNN 框架)在此不可省略。药物研发的典型链条:先对海量分子库做图级性质预测初筛(溶解度、毒性),再对候选做活性回归,最后进入图生成做结构优化(第六章)。蛋白质结构进入图视角后,残基接触图也成了建模对象,接触图预测与功能预测都可复用同一骨架。坑在数据:公开分子数据集的"活性悬崖"(结构微变、活性剧变)对模型分辨力要求极高,正好踩在 GIN 讨论的表达能力问题上。

知识图谱:多类型边的补全

知识图谱现场的三元组(头实体、关系、尾实体)天然是有向多类型边,补全缺失关系是边级任务。主力模型关系图卷积:按关系类型分路聚合,再对各路结果求和——多类型边的处理思路与异构图一脉相承(第六章展开)。打分函数在三元组上定义,几何类打分(把关系看作头实体到尾实体的平移或旋转)与神经网络打分(双线性、多层感知机)两条路线并行。坑在开放世界假设:图谱里"没记录的关系"不等于"不成立",负采样天然带噪,评测须用滤波协议(把已知正确三元组从候选里剔除后再排名)。

交通预测:图与时序的联姻

交通现场把路口建成节点、路段建成带权边,预测各路口未来时段的流量是节点级回归。难点在时空耦合——空间上相邻路口相互影响,时间上流量有早晚高峰的周期,纯图模型或纯时序模型都只拿到一半证据。主流做法是图卷积层与时序层交替堆叠:图卷积聚合空间证据,时序层(门控循环或时序卷积)沿时间轴传递,形成时空块;再深的变体引入自适应邻接矩阵,让"哪些路口互相影响"也成为可学习量。坑在路的语义:直线距离近不等于连通强(隔江相望的路口并不互相影响),权重应来自通行时间或流量相关性而非地理距离。

# 时空块的极简骨架:图卷积聚合空间 + 门控沿时间 import torch from torch_geometric.nn import GraphConv class STBlock(torch.nn.Module): def __init__(self, dim): super().__init__() self.gcn = GraphConv(dim, dim) self.gru = torch.nn.GRU(dim, dim, batch_first=True) def forward(self, x_seq, edge_index): # x_seq: [批, 时间步, 节点, 维度] B, T, N, D = x_seq.shape out = [] for t in range(T): g = self.gcn(x_seq[:, t], edge_index) # 空间证据:邻路口 out.append(g) z = torch.stack(out, dim=1).reshape(B * N, T, D) z, _ = self.gru(z) # 时间证据:流量周期 return z.reshape(B, T, N, D) # 完整系统还要加:邻接矩阵的构建(相关性或通行时间)、 # 节点静态特征(车道数)、多步预测头与节假日特征

选编小结

五类现场的共性动作可以压缩成初诊四问:节点与边的业务定义是什么?任务落在哪一级(节点、边、图)?图的规模与流动性如何(决定训练阵型)?边的语义是否需要分类型处理(决定模型路由)?四问答完,第三章的选型表与第五章的工程方案就能直接对接。下一章进入案件复盘:训练阵型、损失配置、过平滑诊断与工程化落地,把"演示级"的办案能力升级为"系统级"。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U