跳转至

贝叶斯统计:用概率表达参数的不确定性

贝叶斯推断把未知参数当作需要用概率描述的不确定量。数据到来后,先验通过似然更新为后验。后验不是算法吐出的分布,而是“模型、先验与数据共同成立”时的条件结论。

先验与数据经过更新后,得到更集中的后验认识

贝叶斯公式是更新规则

对参数 \(\theta\) 和数据 \(y\)

\[p(\theta\mid y) = \frac{p(y\mid\theta)p(\theta)}{p(y)} \propto p(y\mid\theta)p(\theta)\]
部件 回答什么
先验 \(p(\theta)\) 看数据前,哪些参数值更可信
似然 \(p(y\mid\theta)\) 每个参数值生成当前数据的相对支持度
后验 \(p(\theta\mid y)\) 看数据后,参数的不确定性
后验预测 \(p(\tilde y\mid y)\) 新数据可能是什么
flowchart LR
    A[先验 p(θ)] --> C[贝叶斯更新]
    B[似然 p(y|θ)] --> C
    C --> D[后验 p(θ|y)]
    D --> E[后验预测 p(ỹ|y)]
    E --> F[决策与模型检查]

边际似然 \(p(y)=\int p(y\mid\theta)p(\theta)\,d\theta\) 负责归一化。只求单个模型内的后验时常可略去;比较模型或算 Bayes factor 时不能略去。

Beta-Binomial 给出一套可手算的更新

设 20 次独立试验中成功 14 次,成功率为 \(\theta\)

\[Y\mid\theta\sim\operatorname{Binomial}(20,\theta)\]

取先验 \(\theta\sim\operatorname{Beta}(2,2)\),则共轭后验为:

\[\theta\mid Y=14 \sim \operatorname{Beta}(2+14,\,2+6) = \operatorname{Beta}(16,8)\]

后验均值为:

\[E(\theta\mid y)=\frac{16}{16+8}=\frac23\]

它位于先验均值 \(0.5\) 与样本成功率 \(0.7\) 之间。样本继续增大时,似然通常占更大权重。

下一次成功的后验预测概率也是 \(2/3\)

\[P(\tilde Y=1\mid y) = \int \theta p(\theta\mid y)\,d\theta\]

这一步自动把参数不确定性传播到预测中。

先验必须能解释,也必须经得起预测检查

先验不是“主观随便猜”。它可以来自历史研究、物理约束、专家知识或正则化需求。

先验类型 用途 风险
信息性先验 有可靠历史信息时提高精度 历史环境不同时可能强行拉偏
弱信息先验 排除荒谬值并稳定估计 尺度没想清时仍可能过强
参考或近似平坦先验 尽量少加入信息 参数变换后未必仍平坦,可能不正规

先验预测分布是:

\[p(y)=\int p(y\mid\theta)p(\theta)\,d\theta\]

从先验生成模拟数据,检查它是否允许明显荒谬的结果。若模型预测“一天订单量经常达到十亿”,先验或似然的尺度就没有设对。

敏感性分析应替换几组合理先验。若主要结论随先验剧烈变化,就应明确报告“数据本身信息有限”。

可信区间可以直接陈述后验概率

95% credible interval 是后验概率质量为 0.95 的参数区间。给定模型、先验和数据,可以说“参数落在该区间的后验概率为 95%”。

这不同于频率学置信区间的重复抽样覆盖率解释。两者数值有时接近,含义并不相同。

单侧决策也可直接计算:

\[P(\theta>\theta_0\mid y)\]

但“概率高于 0”未必有实际意义。更好的问题常是 \(P(\theta>\delta\mid y)\),其中 \(\delta\) 是最小有意义效应。

决策还需要损失函数

若行动 \(a\) 在参数为 \(\theta\) 时的损失为 \(L(a,\theta)\),贝叶斯行动最小化后验期望损失:

\[a^\ast = \arg\min_a E[L(a,\theta)\mid y]\]

同一个后验在不同成本下会产生不同决策。发布错误的成本、错过机会的成本和实验成本,都不属于后验概率本身。

复杂模型依赖数值计算

共轭模型可解析更新;层级模型、非线性模型通常使用 MCMC 或变分推断。

MCMC 不是独立抽样。链内自相关会让有效样本量小于抽样次数。至少检查:

  • 多条链是否混合并探索同一后验区域
  • \(\hat R\) 是否接近 1
  • bulk 与 tail effective sample size 是否足够
  • 是否有 divergence、treedepth 或能量诊断问题
  • trace plot 是否长期卡在局部区域

变分推断通常更快,但会用受限分布近似后验,可能低估尾部和相关性。速度不能替代校准检查。

后验预测检查负责发现模型不合身

从后验抽取 \(\theta^{(s)}\),再生成复制数据:

\[y_{\mathrm{rep}}^{(s)}\sim p(y\mid\theta^{(s)})\]

把复制数据与真实数据的均值、离散度、零值比例、极端值或时间结构比较。若模型生成不出真实数据的重要特征,精确的后验也只是精确地回答错模型。

后验预测检查不是检验“模型为真”。它是在找模型最明显的失配位置。

层级模型实现部分汇聚

多个门店的转化率可写为:

\[y_j\sim\operatorname{Binomial}(n_j,\theta_j),\qquad \operatorname{logit}(\theta_j)\sim N(\mu,\tau^2)\]

样本小的门店更多向总体均值收缩,样本大的门店更多由自身数据决定。部分汇聚通常比每店完全独立估计稳定,也比强行认为所有门店相同灵活。

常见误区

  • 平坦先验等于没有先验 → 平坦依赖参数化,还可能导致不正规后验
  • 后验概率高就证明模型正确 → 后验条件于模型,模型错时结论也会错
  • MCMC 抽样多就一定可靠 → 未收敛的长链仍然不可靠
  • 95% credible interval 包含大多数未来观测 → 参数区间不是预测区间
  • Bayes factor 只由数据决定 → 它对模型先验和参数先验可能很敏感
  • 先验敏感说明贝叶斯方法失败 → 它通常是在暴露数据没有提供足够信息

贝叶斯分析检查清单

  1. 参数、数据生成模型和 estimand 是否写清?
  2. 先验的尺度、来源和约束是否可解释?
  3. 先验预测能否生成合理数据?
  4. 后验摘要是否同时给中心、区间和有意义阈值概率?
  5. MCMC 收敛、有效样本量和 divergence 是否检查?
  6. 后验预测能否复现数据的重要结构?
  7. 主要结论对合理先验和模型选择是否稳健?

贝叶斯工作流不是“选先验后算后验”,而是建模、预测检查、计算诊断、敏感性分析和决策的闭环。