第07章 长期随访:时间序列


文档摘要

第07章 长期随访:时间序列 章节摘要:健康数据要长期跟踪才见价值。本章讲时间索引的建立与切片、resample重采样复诊、rolling移动窗口监护——Pandas时间序列三件套。时区、偏移这些慢性病也有专段处置。 一条主线 归并好的宽表(第06章)有了日期字段,但只是一列文本。把它升格为时间索引,病史就有了时间轴:能按月复诊(resample)、能滚动观察趋势(rolling)、能对照上期算变化(shift的思路融在两节里)。主线任务是产出"门店日销售额的月度随访报告":日粒度太细、年粒度太粗,重采样到月,再用移动窗口看趋势是否健康。时间序列的本质只有一句话:让时间当挂号条,一切操作都按时间对齐。

第07章 长期随访:时间序列

章节摘要:健康数据要长期跟踪才见价值。本章讲时间索引的建立与切片、resample重采样复诊、rolling移动窗口监护——Pandas时间序列三件套。时区、偏移这些慢性病也有专段处置。

一条主线

归并好的宽表(第06章)有了日期字段,但只是一列文本。把它升格为时间索引,病史就有了时间轴:能按月复诊(resample)、能滚动观察趋势(rolling)、能对照上期算变化(shift的思路融在两节里)。主线任务是产出"门店日销售额的月度随访报告":日粒度太细、年粒度太粗,重采样到月,再用移动窗口看趋势是否健康。时间序列的本质只有一句话:让时间当挂号条,一切操作都按时间对齐

沿途站点

7-1 时间索引的随访档案

to_datetime建档、DatetimeIndex的时间切片、date_range造随访日历、Period与Timestamp的血型差异、时区这道慢性病。

7-2 resample重采样复诊

高频转低频的降采样与反方向的升采样,agg口径选择,缺的随访日怎么补齐。

7-3 rolling移动窗口监护

窗口与中心化、min_periods防小样本、移动均值去噪看趋势、移动标准差看波动。

拐点与结论

本章拐点在7-2:重采样不是简单的"分月求和",downsample时聚合口径(sum还是mean还是last)决定了指标含义——月的"日均"与"总额"是两个完全不同的诊断。读完本章,你应当能够:

  • 把字符串日期升格为DatetimeIndex,并用时间字符串直接切片
  • 区分Timestamp、Period、Timedelta三种时间血型
  • 用resample完成降采样与升采样,并按指标含义选agg口径
  • 用rolling算移动均值与移动标准差,解释min_periods的用途
  • 处理时区转换与夏令时引发的重复索引

前置与延伸

前置:第01章的parse_dates伏笔、第05章的分组聚合(重采样就是按频率的分组)、第06章的归并(多表合并后再上时间轴是常见顺序)。延伸:时间序列的预测建模超出本册范围,但特征工程(lag特征、滚动统计)用的全是本章器械。练习建议找一份真实的日度数据(天气、客流、汇率),从建档到监护完整走一遍,缺勤日与脏日期一定会遇到。

下一章的接力

随访报告出炉,数据体检只剩最后一站:第08章讲怎么让整条流水线跑得更快更省——向量化、query、内存优化,让体检中心自己先健康起来。

本章考核知识点清单

随访科的考核点:把字符串日期升格为DatetimeIndex并用format处理脏值;用时间字符串直接切片;区分Timestamp、Period、Timedelta三种血型;用date_range加reindex查出缺勤日;完成时区的localize与convert;按指标含义选择重采样的聚合口径;解释MS与M的标签差异;说出升采样时存量与流量的填法区别;用rolling配min_periods算移动均线与移动标准差并设置报警线;说明rolling按个数与按时间的窗口差异。这十条是从"会Pandas"到"会做时间序列分析"的全部门槛。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U