6.8 拓展阅读 本章内容有时较为简洁。Grinstead和Snell(1997)以及Walpole et al.(2011)提供了更为宽松且适合自学的讲解。对概率的哲学层面感兴趣的读者可以阅读Hacking(2001),而与软件工程更相关的方法则由Downey(2014)介绍。Barndorff-Nielsen(2014)提供了指数族分布的概述。我们将在第8章中看到更多关于如何使用概率分布来建模机器学习任务的内容。具有讽刺意味的是,最近神经网络兴趣的激增使得人们对概率模型有了更广泛的认识。例如,标准化流(normalizing flows)的概念(Jimenez Rezende和Mohamed,2015)依赖于变量变换来转换随机变量。Goodfellow et al.
本章内容有时较为简洁。Grinstead和Snell(1997)以及Walpole et al.(2011)提供了更为宽松且适合自学的讲解。对概率的哲学层面感兴趣的读者可以阅读Hacking(2001),而与软件工程更相关的方法则由Downey(2014)介绍。Barndorff-Nielsen(2014)提供了指数族分布的概述。我们将在第8章中看到更多关于如何使用概率分布来建模机器学习任务的内容。具有讽刺意味的是,最近神经网络兴趣的激增使得人们对概率模型有了更广泛的认识。例如,标准化流(normalizing flows)的概念(Jimenez Rezende和Mohamed,2015)依赖于变量变换来转换随机变量。Goodfellow et al.(2016)所著书籍的第16至20章概述了将变分推断方法应用于神经网络的方法。
我们通过避免测度理论问题(Billingsley,1995;Pollard,2002)并假设我们已有实数以及实数上集合的定义方式及其适当的出现频率(而无需构建这些),从而绕过了连续随机变量中的大部分困难。这些细节在某些情况下很重要,例如在为连续随机变量x,y指定条件概率p(y\mid x)时(Proschan和Presnell,1998)。这种简略的记法隐藏了我们想要指定X=x(这是一个测度为零的集合)的事实。此外,我们还对y的概率密度函数感兴趣。更精确的记法应该是\mathbb{E}_y[f(y)\mid\sigma(x)],其中我们对测试函数f关于x的\sigma-代数取y的期望。对概率论细节感兴趣的更专业的读者有很多选择(Jaynes,2003;MacKay,2003;Jacod和Protter,2004;Grimmett和Welsh,2014),包括一些非常技术性的讨论(Shiryayev,1984;Lehmann和Casella,1998;Dudley,2002;Bickel和Doksum,2006;Çinlar,2011)。另一种研究概率的方法是从期望的概念出发,“逆向工作”以推导出概率空间所需的性质(Whittle,2000)。随着机器学习使我们能够在越来越复杂的数据类型上建模更复杂的分布,概率机器学习模型的开发者将不得不理解这些更技术性的方面。以概率建模为重点的机器学习著作包括MacKay(2003)、Bishop(2006)、Rasmussen和Williams(2006)、Barber(2012)以及Murphy(2012)的书籍。