贝叶斯统计:用概率表达参数的不确定性
贝叶斯推断把未知参数当作需要用概率描述的不确定量。数据到来后,先验通过似然更新为后验。后验不是算法吐出的分布,而是“模型、先验与数据共同成立”时的条件结论。

贝叶斯公式是更新规则
对参数 \(\theta\) 和数据 \(y\):
| 部件 | 回答什么 |
|---|---|
| 先验 \(p(\theta)\) | 看数据前,哪些参数值更可信 |
| 似然 \(p(y\mid\theta)\) | 每个参数值生成当前数据的相对支持度 |
| 后验 \(p(\theta\mid y)\) | 看数据后,参数的不确定性 |
| 后验预测 \(p(\tilde y\mid y)\) | 新数据可能是什么 |
flowchart LR
A[先验 p(θ)] --> C[贝叶斯更新]
B[似然 p(y|θ)] --> C
C --> D[后验 p(θ|y)]
D --> E[后验预测 p(ỹ|y)]
E --> F[决策与模型检查]
边际似然 \(p(y)=\int p(y\mid\theta)p(\theta)\,d\theta\) 负责归一化。只求单个模型内的后验时常可略去;比较模型或算 Bayes factor 时不能略去。
Beta-Binomial 给出一套可手算的更新
设 20 次独立试验中成功 14 次,成功率为 \(\theta\):
取先验 \(\theta\sim\operatorname{Beta}(2,2)\),则共轭后验为:
后验均值为:
它位于先验均值 \(0.5\) 与样本成功率 \(0.7\) 之间。样本继续增大时,似然通常占更大权重。
下一次成功的后验预测概率也是 \(2/3\):
这一步自动把参数不确定性传播到预测中。
先验必须能解释,也必须经得起预测检查
先验不是“主观随便猜”。它可以来自历史研究、物理约束、专家知识或正则化需求。
| 先验类型 | 用途 | 风险 |
|---|---|---|
| 信息性先验 | 有可靠历史信息时提高精度 | 历史环境不同时可能强行拉偏 |
| 弱信息先验 | 排除荒谬值并稳定估计 | 尺度没想清时仍可能过强 |
| 参考或近似平坦先验 | 尽量少加入信息 | 参数变换后未必仍平坦,可能不正规 |
先验预测分布是:
从先验生成模拟数据,检查它是否允许明显荒谬的结果。若模型预测“一天订单量经常达到十亿”,先验或似然的尺度就没有设对。
敏感性分析应替换几组合理先验。若主要结论随先验剧烈变化,就应明确报告“数据本身信息有限”。
可信区间可以直接陈述后验概率
95% credible interval 是后验概率质量为 0.95 的参数区间。给定模型、先验和数据,可以说“参数落在该区间的后验概率为 95%”。
这不同于频率学置信区间的重复抽样覆盖率解释。两者数值有时接近,含义并不相同。
单侧决策也可直接计算:
但“概率高于 0”未必有实际意义。更好的问题常是 \(P(\theta>\delta\mid y)\),其中 \(\delta\) 是最小有意义效应。
决策还需要损失函数
若行动 \(a\) 在参数为 \(\theta\) 时的损失为 \(L(a,\theta)\),贝叶斯行动最小化后验期望损失:
同一个后验在不同成本下会产生不同决策。发布错误的成本、错过机会的成本和实验成本,都不属于后验概率本身。
复杂模型依赖数值计算
共轭模型可解析更新;层级模型、非线性模型通常使用 MCMC 或变分推断。
MCMC 不是独立抽样。链内自相关会让有效样本量小于抽样次数。至少检查:
- 多条链是否混合并探索同一后验区域
- \(\hat R\) 是否接近 1
- bulk 与 tail effective sample size 是否足够
- 是否有 divergence、treedepth 或能量诊断问题
- trace plot 是否长期卡在局部区域
变分推断通常更快,但会用受限分布近似后验,可能低估尾部和相关性。速度不能替代校准检查。
后验预测检查负责发现模型不合身
从后验抽取 \(\theta^{(s)}\),再生成复制数据:
把复制数据与真实数据的均值、离散度、零值比例、极端值或时间结构比较。若模型生成不出真实数据的重要特征,精确的后验也只是精确地回答错模型。
后验预测检查不是检验“模型为真”。它是在找模型最明显的失配位置。
层级模型实现部分汇聚
多个门店的转化率可写为:
样本小的门店更多向总体均值收缩,样本大的门店更多由自身数据决定。部分汇聚通常比每店完全独立估计稳定,也比强行认为所有门店相同灵活。
常见误区
- 平坦先验等于没有先验 → 平坦依赖参数化,还可能导致不正规后验
- 后验概率高就证明模型正确 → 后验条件于模型,模型错时结论也会错
- MCMC 抽样多就一定可靠 → 未收敛的长链仍然不可靠
- 95% credible interval 包含大多数未来观测 → 参数区间不是预测区间
- Bayes factor 只由数据决定 → 它对模型先验和参数先验可能很敏感
- 先验敏感说明贝叶斯方法失败 → 它通常是在暴露数据没有提供足够信息
贝叶斯分析检查清单
- 参数、数据生成模型和 estimand 是否写清?
- 先验的尺度、来源和约束是否可解释?
- 先验预测能否生成合理数据?
- 后验摘要是否同时给中心、区间和有意义阈值概率?
- MCMC 收敛、有效样本量和 divergence 是否检查?
- 后验预测能否复现数据的重要结构?
- 主要结论对合理先验和模型选择是否稳健?
贝叶斯工作流不是“选先验后算后验”,而是建模、预测检查、计算诊断、敏感性分析和决策的闭环。