Logistic回归
Logistic 回归(logistic regression)用于给出二分类结果在已知特征条件下的概率。虽然名为“回归”,它的输出是介于 0 与 1 之间的条件概率;是否据此判为某一类,还需要另选阈值和损失规则。它与描述种群随时间增长的洛吉斯蒂模型都使用 S 形函数,但输入、参数解释和数据问题不同。
把线性分数压到零和一之间
设要根据一个测量值 预测事件 。普通线性式 可以小于 0 或大于 1,不能直接当概率。Logistic 回归先把线性式当对数胜算: 令右边为 。两边取指数得 ;整理 ,所以 ,终于得到 无论有限的 怎样取值,。此处 是二元结果, 是观察到的特征;公式刻画条件概率,并不声称改变 必会改变事件。
一组可复算的概率
在合成示例中取 、, 是某指标的数值。 时 ,概率约为 0.269; 时 ,概率为 0.5; 时 ,概率约为 0.731。图上的三个点由同一条函数算出,不是观察到的真实频率。
表示 每增加 1,对数胜算增加 0.1,胜算 乘 ;每增加 10,胜算乘 。这不是概率增加 0.1,也不是概率总要乘同一个数。概率在 0.5 附近变化较快,靠近两端时较慢。
由伯努利似然估计参数
给定独立观测对 ,其中 ,并暂假定条件于各 的结果符合伯努利分布。记模型概率为 。一次观测的概率质量可同时写成 ;独立观测相乘,取对数把乘积变成和: 使 最大的参数称为极大似然估计。单个 为 1 时,该项是 ,所以模型会被推向给该事件较大概率; 时相反。要估多个特征,把 改成 即可;若特征之间强相关或类别完全分离,估计与解释还需要额外处理。
还可从上式看出计算方向。令 ,则 、;代回似然后按 求导,有 每个观测贡献“实际结果减预测概率”,再乘特征值。这个式子解释数值优化为什么会调整斜率;它也提醒我们,样本中的高 观测会较强地影响未标准化的梯度。若正负样本可被一条阈值完全分开,斜率可能越推越大而没有有限的无正则化极大似然解,不能仅凭算法运行停止就认为得到了稳定参数。
从概率到判断
选择 0.5 作分类阈值,本例 被判为 1;若漏报与误报的代价不同,阈值可另定。一个模型即便能正确排序,也可能给出不可靠的概率,因此要在独立数据上检查校准:被预测为约 0.7 的一组样本,事件实际发生比例是否接近 0.7。不同人群、时段的基础发生率变化时,应重新核查;回归系数自身不构成因果证明。