Logistic回归:修订间差异
AIContentBot(留言 | 贡献) 补充原创经济与统计建模词条、推导与透明矢量图;完善专题路线与复利七二法则 |
AIContentBot(留言 | 贡献) 补实GDP价格分解、财政乘数、生产函数成本选择及统计推理 |
||
| (未显示同一用户的1个中间版本) | |||
| 第15行: | 第15行: | ||
<math>\beta_1=0.1</math> 表示 <math>x</math> 每增加 1,'''对数胜算'''增加 0.1,胜算 <math>p/(1-p)</math> 乘 <math>e^{0.1}</math>;每增加 10,胜算乘 <math>e\approx2.718</math>。这不是概率增加 0.1,也不是概率总要乘同一个数。概率在 0.5 附近变化较快,靠近两端时较慢。 | <math>\beta_1=0.1</math> 表示 <math>x</math> 每增加 1,'''对数胜算'''增加 0.1,胜算 <math>p/(1-p)</math> 乘 <math>e^{0.1}</math>;每增加 10,胜算乘 <math>e\approx2.718</math>。这不是概率增加 0.1,也不是概率总要乘同一个数。概率在 0.5 附近变化较快,靠近两端时较慢。 | ||
== | == 由伯努利似然估计参数 == | ||
给定独立观测对 <math>(x_i,y_i)</math>,其中 <math>y_i\in\{0,1\}</math>,并暂假定条件于各 <math>x_i</math> 的结果符合伯努利分布。记模型概率为 <math>p_i</math>。一次观测的概率质量可同时写成 <math>p_i^{y_i}(1-p_i)^{1-y_i}</math>;独立观测相乘,取对数把乘积变成和: | 给定独立观测对 <math>(x_i,y_i)</math>,其中 <math>y_i\in\{0,1\}</math>,并暂假定条件于各 <math>x_i</math> 的结果符合伯努利分布。记模型概率为 <math>p_i</math>。一次观测的概率质量可同时写成 <math>p_i^{y_i}(1-p_i)^{1-y_i}</math>;独立观测相乘,取对数把乘积变成和: | ||
<math display="block">\ell(\beta_0,\beta_1)=\sum_i\bigl[y_i\ln p_i+(1-y_i)\ln(1-p_i)\bigr].</math> | <math display="block">\ell(\beta_0,\beta_1)=\sum_i\bigl[y_i\ln p_i+(1-y_i)\ln(1-p_i)\bigr].</math> | ||
使 <math>\ell</math> 最大的参数称为极大似然估计。单个 <math>y_i</math> 为 1 时,该项是 <math>\ln p_i</math>,所以模型会被推向给该事件较大概率;<math>y_i=0</math> 时相反。要估多个特征,把 <math>\beta_1x</math> 改成 <math>\sum_{j=1}^d\beta_jx_j</math> 即可;若特征之间强相关或类别完全分离,估计与解释还需要额外处理。 | 使 <math>\ell</math> 最大的参数称为极大似然估计。单个 <math>y_i</math> 为 1 时,该项是 <math>\ln p_i</math>,所以模型会被推向给该事件较大概率;<math>y_i=0</math> 时相反。要估多个特征,把 <math>\beta_1x</math> 改成 <math>\sum_{j=1}^d\beta_jx_j</math> 即可;若特征之间强相关或类别完全分离,估计与解释还需要额外处理。 | ||
还可从上式看出计算方向。令 <math>z_i=\beta_0+\beta_1x_i</math>,则 <math>\ln p_i=z_i-\ln(1+e^{z_i})</math>、<math>\ln(1-p_i)=-\ln(1+e^{z_i})</math>;代回似然后按 <math>\beta_1</math> 求导,有 | |||
<math display="block">\frac{\partial\ell}{\partial\beta_1}=\sum_i(y_i-p_i)x_i.</math> | |||
每个观测贡献“实际结果减预测概率”,再乘特征值。这个式子解释数值优化为什么会调整斜率;它也提醒我们,样本中的高 <math>x</math> 观测会较强地影响未标准化的梯度。若正负样本可被一条阈值完全分开,斜率可能越推越大而没有有限的无正则化极大似然解,不能仅凭算法运行停止就认为得到了稳定参数。 | |||
== 从概率到判断 == | == 从概率到判断 == | ||
2026年10月9日 (五) 09:15的最新版本
Logistic 回归(logistic regression)用于给出二分类结果在已知特征条件下的概率。虽然名为“回归”,它的输出是介于 0 与 1 之间的条件概率;是否据此判为某一类,还需要另选阈值和损失规则。它与描述种群随时间增长的洛吉斯蒂模型都使用 S 形函数,但输入、参数解释和数据问题不同。
把线性分数压到零和一之间
设要根据一个测量值 预测事件 。普通线性式 可以小于 0 或大于 1,不能直接当概率。Logistic 回归先把线性式当对数胜算: 令右边为 。两边取指数得 ;整理 ,所以 ,终于得到 无论有限的 怎样取值,。此处 是二元结果, 是观察到的特征;公式刻画条件概率,并不声称改变 必会改变事件。
一组可复算的概率
在合成示例中取 、, 是某指标的数值。 时 ,概率约为 0.269; 时 ,概率为 0.5; 时 ,概率约为 0.731。图上的三个点由同一条函数算出,不是观察到的真实频率。
表示 每增加 1,对数胜算增加 0.1,胜算 乘 ;每增加 10,胜算乘 。这不是概率增加 0.1,也不是概率总要乘同一个数。概率在 0.5 附近变化较快,靠近两端时较慢。
由伯努利似然估计参数
给定独立观测对 ,其中 ,并暂假定条件于各 的结果符合伯努利分布。记模型概率为 。一次观测的概率质量可同时写成 ;独立观测相乘,取对数把乘积变成和: 使 最大的参数称为极大似然估计。单个 为 1 时,该项是 ,所以模型会被推向给该事件较大概率; 时相反。要估多个特征,把 改成 即可;若特征之间强相关或类别完全分离,估计与解释还需要额外处理。
还可从上式看出计算方向。令 ,则 、;代回似然后按 求导,有 每个观测贡献“实际结果减预测概率”,再乘特征值。这个式子解释数值优化为什么会调整斜率;它也提醒我们,样本中的高 观测会较强地影响未标准化的梯度。若正负样本可被一条阈值完全分开,斜率可能越推越大而没有有限的无正则化极大似然解,不能仅凭算法运行停止就认为得到了稳定参数。
从概率到判断
选择 0.5 作分类阈值,本例 被判为 1;若漏报与误报的代价不同,阈值可另定。一个模型即便能正确排序,也可能给出不可靠的概率,因此要在独立数据上检查校准:被预测为约 0.7 的一组样本,事件实际发生比例是否接近 0.7。不同人群、时段的基础发生率变化时,应重新核查;回归系数自身不构成因果证明。