数据分析数据科学科研【免费下载链接】statsmodelsStatsmodels: statistical modeling and econometrics in Python项目地址https://gitcode.com/gh_mirrors/st/statsmodels点击查看免费下载statsmodels.othermod是 statsmodels 中专门容纳难以归入其他类别的模型类的子模块目前的核心成员是 Beta 回归模型BetaModel——面向取值落在单位区间(0, 1)内的连续因变量如比例、分数、甲基化水平等采用全极大似然Full Maximum Likelihood估计。本文以 docs/source/other_models.rst 为主线结合 betareg.py 的源码与 test_beta.py 测试用例完整讲解其定位、API、建模流程、预测与结果解读并深入剖析其均值 精度双线性预测子的底层实现。读完本文你将能够独立使用BetaModel完成比例型数据的回归建模、公式化精度子模型设定、多种预测量的提取与模型诊断。模块定位othermod 与 miscmodels 的分工在 statsmodels 中othermod即 other models是一个较新的子模块其设计意图在文档中写得很明确它包含不属于任何其他类别的模型类典型场景是响应变量endog的支持集为单位区间、正数或非负数的模型它收录的是已经或将要被完整开发的模型与statsmodels.miscmodels形成对比——后者主要存放通用似然模型框架GenericLikelihoodModel的用法示例。从源码看othermod的公开 API 目前非常聚焦api.py 仅导出了BetaModel一个类并写入__all__ [BetaModel]init.py 则提供了标准的test测试入口基于PytestTester。在构建层面statsmodels/meson.build 将othermod列入模块列表说明它是一个正式的、随包编译分发的一等公民子模块。需要特别说明的是实验性状态文档明确标注 Status is experimentalbetareg.py 中也注明 new in 0.13、Core results are verified, but api can change。也就是说核心估计结果是经过验证的但 API 形态会随着未来支持更多模型类型例如多个exog、多个链接函数而调整。Beta 回归的适用场景单位区间连续因变量othermod目前聚焦的模型是Beta 回归Beta Regression用于连续取值且落在单位区间内的因变量典型例子包括家庭支出中用于食物的比例如测试数据中的food/income甲基化测序中的甲基化水平如测试数据中的methylation取值 0~1 的连续比率各种以百分比、份额、覆盖率形式存在的比例数据。文档特别强调了一个重要的建模选择单位区间上的因变量也可以用二元endog模型如Logit和GLM-Binomial通过**拟极大似然Quasi Maximum Likelihood, QMLE**来估计但discrete.Probit的实现假设了二元endog无法为连续因变量估计 QMLE。这意味着对同一类数据你至少有三条技术路线专门的 Beta 回归本文主角、Logit/GLM-Binomial 的 QMLE 近似。BetaModel的优势在于它针对单位区间连续响应建立了完整的参数化似然直接估计均值与精度两套结构。BetaModel 的建模思想均值与精度双重参数化Beta 分布通常用形状参数(a, b)描述但BetaModel采用了更利于回归建模的均值–精度参数化。模型对每个观测定义均值mu E[endog | exog]通过均值设计矩阵exog与链接函数link关联精度precisionphi一个正值参数通过独立的精度设计矩阵exog_precision与精度链接函数link_precision关联。从 betareg.py 的对数似然实现可见其分布形式alpha mu * phi beta (1 - mu) * phi ll lgamma(phi) - lgamma(alpha) - lgamma(beta) (mu * phi - 1) * log(y) ((1 - mu) * phi - 1) * log(1 - y)这正是 Beta 分布Beta(alpha, beta)的对数密度其中alpha mu*phi、beta (1-mu)*phi。相应的条件方差由_predict_var给出var_endog mean * (1 - mean) / (1 precision)可以看出精度phi越大围绕均值的方差越小分布越集中——这直观地对应了 Beta 分布的集中度含义。构造函数参数BetaModel.__init__的完整参数如下参数类型默认值说明endogarray_like必填一维响应变量必须严格落在 (0, 1) 开区间源码中用assert np.all((0 etmp) (etmp 1))强制校验exogarray_like必填nobs × k的均值设计矩阵。默认不含截距需用户自行添加公式接口默认带截距exog_precisionarray_like可选精度部分的设计矩阵默认退化为常数列仅一个 precision 参数linkLink 实例Logit()均值链接函数要求值域落在 [0, 1]可使用 statsmodels.genmod.families.links 中的任意链接link_precisionLink 实例Log()精度链接函数要求值域在正半轴**kwdsdict—传递给父类GenericLikelihoodModel的额外关键字在构造内部BetaModel会把精度参数名注册为precision或precision-{列名}当exog_precision是多列时并通过extra_params_names传给父类这也是为什么最终results.params中会出现precision之类的参数名。快速上手以 foodexpenditure 数据为例最简洁的用法是直接传数组使用默认的 logit 链接均值与 log 链接精度from statsmodels.othermod.betareg import BetaModel mod BetaModel(endog, exog) rslt mod.fit() print(rslt.summary())测试套件 test_beta.py 中使用的是 R 经典数据集 FoodExpenditure 的公式写法import pandas as pd from statsmodels.othermod.betareg import BetaModel income pd.read_csv(statsmodels/othermod/tests/results/foodexpenditure.csv) model I(food/income) ~ income persons fit BetaModel.from_formula(model, income).fit()该用例把食品支出占收入比例作为因变量用income和家庭人数persons建模均值精度部分使用默认的仅常数项。测试中与 R 包betareg的结果对齐的系数为截距约-0.6225、income约-0.0123、persons约0.1185常数精度phi ≈ 35.61R 结果见 test_beta.py。公式接口与精度子模型from_formula 详解BetaModel.from_formula是更常用的入口它通过 patsy 风格的公式同时支持均值与精度两套设计矩阵。其签名见 betareg.pyBetaModel.from_formula(formula, data, exog_precision_formulaNone, *args, **kwargs)formula描述均值模型的公式字符串dataDataFrame 数据exog_precision_formula可选描述精度模型的公式若为None精度部分仅含常数项等价于exog_precision缺省时的单精度参数设定*args, **kwargs透传给BetaModel的其他参数如link_precision。文档内置示例给出了两种典型的公式化用法。用法一显式传入精度设计矩阵如 identity 链接from statsmodels.genmod.families.links import identity import patsy Z patsy.dmatrix(~ temp, dat, return_typedataframe) mod BetaModel.from_formula(iyield ~ C(batch, Treatment(10)) temp, dat, exog_precisionZ, link_precisionidentity())这里均值公式中含有分类变量batch指定 Treatment 编码和连续变量temp精度部分单独用temp建模并改用恒等链接。用法二比例数据场景——精度依赖测量次数文档给出的甲基化数据示例非常贴近真实业务当观测是比例型数据时精度可能取决于测量次数如覆盖某个位点的测序读段数Z patsy.dmatrix(~ coverage, df) formula methylation ~ disease age gender coverage mod BetaModel.from_formula(formula, df, exog_precisionZ) rslt mod.fit()用法三直接用精度公式字符串。测试代码 test_beta.py 展示了exog_precision_formula与exog_precision两种写法等价m BetaModel.from_formula(methylation ~ gender CpG, methylation, exog_precision_formula~ age, link_precisionlinks.Identity()) rslt m.fit()该测试断言两种方式得到的参数完全一致rtol1e-10并验证了公式接口返回的参数是带索引的pd.Series。此外test_beta.py 的test_eval_env用例表明公式中的任意 Python 函数如times_two(income)也会被正确解析到参数名中且数值关系保持income系数是times_two(income)系数的 2 倍。提示由于exog_precision_formula的实现基于内部FormulaManager.get_matrices见 betareg.py精度公式的用法与均值公式略有差异测试中也提示目前predict对exog_precision的公式变换支持尚有限制。拟合fit 方法与优化选项BetaModel.fit的签名与选项如下fit(start_paramsNone, maxiter1000, dispFalse, methodbfgs, **kwds)参数默认值说明start_paramsNone起始参数向量为None时自动计算见下文_start_paramsmaxiter1000最大迭代次数dispFalse是否输出收敛信息methodbfgs优化方法测试中亦使用newtonkwds—优化器附加参数特殊地传入cov_typeeim会切换信息矩阵类型起始值的选取_start_paramsbetareg.py实现了一个两阶段的加权最小二乘WLS逼近——先用 OLS 拟合link(endog)得到均值的初值再从残差构造精度初值prec_i fitted*(1-fitted)/max(|resid|,1e-2)^2 - 1然后交替迭代 WLS 若干轮默认 2 轮得到最终起点。文档源码注释也引用了 Ferrari 关于精度初始化的经典论文见 betareg.py 附近。协方差矩阵类型模型属性hess_type默认取oimobserved information matrix观测信息矩阵即负 Hessian当fit收到cov_typeeim时会改写为eimexpected information matrix期望信息矩阵这是对父类GenericLikelihoodModel不支持直接传cov_type的变通处理。测试 test_beta.py 验证了hessian(observedTrue/False)结果不同且显式传参优先于hess_type默认值。predict五种预测量BetaModel.predict通过which参数控制返回的统计量这在同类模型中相当完整which取值返回内容mean默认条件期望E(endog | exog)即link.inverse(线性预测)precision预测精度philinear均值部分的线性预测子X params_meanlinear-precision精度部分的线性预测子var模型隐含的条件方差mean*(1-mean)/(1precision)为兼容旧名称与拼写linpred会被归一化为linearlinpred_precision/linear_precision归一化为linear-precision。调用时支持传入新的exog与exog_precision进行样本外预测。在结果对象上还可以通过get_prediction(...)获得带置信区间的预测汇总summary_frame()测试 test_beta.py 验证了whichmean/var/precision/linear/linear-precision各模式以及average、agg_weights加权平均等用法。BetaResults结果对象与诊断工具拟合返回BetaResults继承GenericLikelihoodModelResults并混入_LLRMixin其常用只读属性见 betareg.py属性/方法含义fittedvalues样本内预测均值fitted_precision样本内预测精度resid响应残差endog - fittedvaluesresid_pearsonPearson 标准化残差除以条件标准差prsquaredCox-Snell 似然比伪 R²1 - exp((llnull - llf) * (2 / nobs))get_distribution(...)基于估计参数返回 scipy 冻结的stats.beta预测分布get_influence()返回MLEInfluence实例提供 Cook 距离、hat 矩阵对角线、学生化残差等影响与离群点度量其中get_distribution与get_distribution_params在模型与结果类上都有实现模型方法需要显式传入params结果方法则自动使用已估参数且支持公式变换transformTrue。测试 test_beta.py 验证了distr.stats()返回的均值、方差与fittedvalues、_predict_var高度一致rtol1e-13并对照了 R 中predict(typevariance)的结果。get_influence的实现betareg.py在文档中明确说明其与 Rbetareg的差异R 使用线性近似 hat 矩阵做标准化而本实现使用广义 leveragegeneralized leverage作为hat_matrix_diag残差分析采用 Pearson 残差。测试 test_beta.py 对cooks_distance、d_fittedvalues、dfbetas、hat_matrix_diag、resid_studentized等做了冒烟验证。源码级原理score 与 Hessian 的实现策略BetaModel的梯度与二阶信息在 betareg.py 中实现得相当精细理解这些有助于排查数值问题score_factor返回对数似然关于两个线性预测子的得分因子sf1, sf2其中sf1 phi * t * (ystar - mustar)t为均值链接导数的倒数sf2 h * (mu*(ystar-mustar) yt - mut)h为精度链接导数的倒数真正的score_obs由sf1[:, None] * exog与sf2[:, None] * exog_precision拼接而成score_hessian_factor同时计算得分因子与 Hessian 的三个分块因子(-jbb, -jbg, -jgg)对应上三角通过observed参数切换观测/期望信息计算中用trigammapolygamma(1, ·)表达二阶 digammahessian由分块因子按X.T * j * X的逐元素乘法重组为完整分块矩阵。数值上值得注意的细节是eps_lb 1e-200的下界裁剪在mu*phi或(1-mu)*phi接近 0 时digamma 会趋于-inf裁剪避免了溢出见 betareg.py。测试 test_beta.py 断言了解析 score 与父类数值差分 score 的一致rtol1e-6test_hessian_factor_reassembles_hessian 则验证了从hessian_factor重组出的 Hessian 与hessian()直接结果一致。验证与参考与 R betareg 的对照模型的正确性通过与 R 生态对照来保证。statsmodels/othermod/tests/目录提供了完整证据链数据foodexpenditure.csvRbetareg包的 FoodExpenditure、methylation-test.csv参考结果results_betareg.py来自 Rbetareg输出的系数表、方差协方差矩阵、对数似然、伪 R² 等测试test_beta.py 覆盖系数对齐test_income_coefficients、test_methylation_coefficients、OIM/EIM 两种标准误test_oim、似然比检验统计量test_basic中llnull/llr/llr_pvalue对照 R 的lrtest、score testtest_score_test等。以甲基化数据为例Rbetareg参考结果test_beta.py显示均值部分系数截距、genderM、CpGCpG_1、CpGCpG_2精度部分截距、age而精度公式为~ age、链接为 Log。测试中还演示了cov_typeeim与默认 OIM 两种标准误都能与 R 结果对齐test_beta.py这为使用者提供了交叉验证的信心。状态与使用建议综合文档与源码使用BetaModel时有几点需要留意endog 约束严格endog必须满足0 y 1开区间0 或 1 的观测需要先做边界处理如经典的 Smithson Verkuilen 变换否则构造时直接断言失败实验性 API模型自 0.13 版本引入核心结果已验证但部分附属功能如公式化predict对精度变量的变换、MLEInfluence对多链接/多 exog 的支持仍标记为实验性替代路线对单位区间数据可考虑 Logit 或 GLM-Binomial 的 QMLE 作为快速基线但discrete.Probit不可用于连续因变量扩展方向文档指出未来模块将支持多exog、多链接函数的模型API 会随之演进编写依赖该模块的代码时建议固定 statsmodels 版本。想要亲自动手验证可以在仓库根目录运行对应测试pytest statsmodels/othermod/tests/test_beta.py或用 methylation-test.csv 与 foodexpenditure.csv 复现本文中的建模示例。赞分享数据分析数据科学科研【免费下载链接】statsmodelsStatsmodels: statistical modeling and econometrics in Python项目地址https://gitcode.com/gh_mirrors/st/statsmodels点击查看免费下载相关推荐python_for_data_analysis_2nd_chinese_version回归分析变量间关系的建模方法python_for_data_analysis_2nd_chinese_version回归分析变量间关系的建模方法 你是否还在为如何分析销售数据中的价格与销教程文档数据分析如何快速构建TensorFlow回归模型连续值预测完整指南如何快速构建TensorFlow回归模型连续值预测完整指南 TensorFlow Course是一个专为初学者设计的开源项目提供简单易用的TensorFlo教程深度学习机器学习ML-For-Beginners 回归模块2-Regression以北美南瓜价格为案例的 Scikit-learn 回归建模实战ML For Beginners 回归模块2 Regression以北美南瓜价格为案例的 Scikit learn 回归建模实战 本篇基于 ML For教程机器学习人工智能上一篇保护数据隐私gh_mirrors/json1/json本地转换功能深度解析下一篇Alpine.js 模板语法终极指南掌握插值、指令与表达式创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
