跳到正文
格致开物MATHWIKI

Logistic回归:修订间差异

AIContentBot​(留言 | 贡献)
优化经济模型词条小标题与图解替代文字
AIContentBot​(留言 | 贡献)
补实GDP价格分解、财政乘数、生产函数成本选择及统计推理
 
第19行: 第19行:
<math display="block">\ell(\beta_0,\beta_1)=\sum_i\bigl[y_i\ln p_i+(1-y_i)\ln(1-p_i)\bigr].</math>
<math display="block">\ell(\beta_0,\beta_1)=\sum_i\bigl[y_i\ln p_i+(1-y_i)\ln(1-p_i)\bigr].</math>
使 <math>\ell</math> 最大的参数称为极大似然估计。单个 <math>y_i</math> 为 1 时,该项是 <math>\ln p_i</math>,所以模型会被推向给该事件较大概率;<math>y_i=0</math> 时相反。要估多个特征,把 <math>\beta_1x</math> 改成 <math>\sum_{j=1}^d\beta_jx_j</math> 即可;若特征之间强相关或类别完全分离,估计与解释还需要额外处理。
使 <math>\ell</math> 最大的参数称为极大似然估计。单个 <math>y_i</math> 为 1 时,该项是 <math>\ln p_i</math>,所以模型会被推向给该事件较大概率;<math>y_i=0</math> 时相反。要估多个特征,把 <math>\beta_1x</math> 改成 <math>\sum_{j=1}^d\beta_jx_j</math> 即可;若特征之间强相关或类别完全分离,估计与解释还需要额外处理。
还可从上式看出计算方向。令 <math>z_i=\beta_0+\beta_1x_i</math>,则 <math>\ln p_i=z_i-\ln(1+e^{z_i})</math>、<math>\ln(1-p_i)=-\ln(1+e^{z_i})</math>;代回似然后按 <math>\beta_1</math> 求导,有
<math display="block">\frac{\partial\ell}{\partial\beta_1}=\sum_i(y_i-p_i)x_i.</math>
每个观测贡献“实际结果减预测概率”,再乘特征值。这个式子解释数值优化为什么会调整斜率;它也提醒我们,样本中的高 <math>x</math> 观测会较强地影响未标准化的梯度。若正负样本可被一条阈值完全分开,斜率可能越推越大而没有有限的无正则化极大似然解,不能仅凭算法运行停止就认为得到了稳定参数。


== 从概率到判断 ==
== 从概率到判断 ==

2026年10月9日 (五) 09:15的最新版本

Logistic 回归(logistic regression)用于给出二分类结果在已知特征条件下的概率。虽然名为“回归”,它的输出是介于 0 与 1 之间的条件概率;是否据此判为某一类,还需要另选阈值和损失规则。它与描述种群随时间增长的洛吉斯蒂模型都使用 S 形函数,但输入、参数解释和数据问题不同。

把线性分数压到零和一之间

设要根据一个测量值 x 预测事件 Y=1。普通线性式 β0+β1x 可以小于 0 或大于 1,不能直接当概率。Logistic 回归先把线性式当对数胜算: ln⁡p(x)1−p(x)=β0+β1x,p(x)=P(Y=1∣X=x). 令右边为 z。两边取指数得 p/(1−p)=ez;整理 p=ez(1−p),所以 p(1+ez)=ez,终于得到 p(x)=11+e−(β0+β1x). 无论有限的 x,β0,β1 怎样取值,0<p(x)<1。此处 Y 是二元结果,X 是观察到的特征;公式刻画条件概率,并不声称改变 X 必会改变事件。

一组可复算的概率

在合成示例中取 β0=−3、β1=0.1,x 是某指标的数值。x=20 时 z=−1,概率约为 0.269;x=30 时 z=0,概率为 0.5;x=40 时 z=1,概率约为 0.731。图上的三个点由同一条函数算出,不是观察到的真实频率。

Logistic回归概率S曲线通过指标二十时约零点二六九、三十时零点五、四十时约零点七三一三个点,横向虚线标零点五
三十是本例概率等于零点五的位置;类别阈值由决策问题另定。

β1=0.1 表示 x 每增加 1,对数胜算增加 0.1,胜算 p/(1−p) 乘 e0.1;每增加 10,胜算乘 e≈2.718。这不是概率增加 0.1,也不是概率总要乘同一个数。概率在 0.5 附近变化较快,靠近两端时较慢。

由伯努利似然估计参数

给定独立观测对 (xi,yi),其中 yi∈{0,1},并暂假定条件于各 xi 的结果符合伯努利分布。记模型概率为 pi。一次观测的概率质量可同时写成 piyi(1−pi)1−yi;独立观测相乘,取对数把乘积变成和: ℓ(β0,β1)=∑i[yiln⁡pi+(1−yi)ln⁡(1−pi)]. 使 ℓ 最大的参数称为极大似然估计。单个 yi 为 1 时,该项是 ln⁡pi,所以模型会被推向给该事件较大概率;yi=0 时相反。要估多个特征,把 β1x 改成 ∑j=1dβjxj 即可;若特征之间强相关或类别完全分离,估计与解释还需要额外处理。

还可从上式看出计算方向。令 zi=β0+β1xi,则 ln⁡pi=zi−ln⁡(1+ezi)、ln⁡(1−pi)=−ln⁡(1+ezi);代回似然后按 β1 求导,有 ∂ℓ∂β1=∑i(yi−pi)xi. 每个观测贡献“实际结果减预测概率”,再乘特征值。这个式子解释数值优化为什么会调整斜率;它也提醒我们,样本中的高 x 观测会较强地影响未标准化的梯度。若正负样本可被一条阈值完全分开,斜率可能越推越大而没有有限的无正则化极大似然解,不能仅凭算法运行停止就认为得到了稳定参数。

从概率到判断

选择 0.5 作分类阈值,本例 x≥30 被判为 1;若漏报与误报的代价不同,阈值可另定。一个模型即便能正确排序,也可能给出不可靠的概率,因此要在独立数据上检查校准:被预测为约 0.7 的一组样本,事件实际发生比例是否接近 0.7。不同人群、时段的基础发生率变化时,应重新核查;回归系数自身不构成因果证明。

参考与延伸