摘要医疗保健疾病预测数据集是一个面向临床风险评估与机器学习疾病预测研究构建的结构化医疗数据集共包含 2000 名患者记录。数据融合了人口统计学信息、临床生理指标、生活方式以及病史等多维特征可用于分析不同健康因素与疾病发生之间的关联。数据集概述医疗保健疾病预测数据集是一个面向临床风险评估与机器学习疾病预测研究构建的结构化医疗数据集共包含 2000 名患者记录。数据融合了人口统计学信息、临床生理指标、生活方式以及病史等多维特征可用于分析不同健康因素与疾病发生之间的关联。与传统单一疾病分类数据不同该数据集采用多标签分类形式同一名患者可能同时患有心脏病、糖尿病和中风中的一种或多种疾病因此更加适合模拟真实医疗场景中的多疾病共存问题并为综合健康风险预测模型提供数据基础。数据结构与关键特征该数据集以患者为基本样本单位主要包含人口统计学特征、临床指标、生活方式因素、病史信息和疾病标签。人口统计信息包括年龄和性别临床指标包括体重指数BMI、收缩压、舒张压、胆固醇和血糖水平可用于反映肥胖、血压异常、血脂及糖代谢状态生活方式特征包括吸烟、饮酒和体育活动可用于分析行为因素对疾病风险的影响病史部分包含家族疾病史等遗传相关信息。目标变量分别为 心脏病、糖尿病和中风三个二元标签每个标签均采用 0/1 表示未患病或患病从而支持一个患者对应多个疾病标签的联合预测任务。应用价值与研究方向该数据集可广泛应用于心血管疾病预测、糖尿病风险识别、中风预警、多疾病联合预测以及个体健康风险评估等研究。研究人员可以采用逻辑回归、随机森林、XGBoost、LightGBM、支持向量机和神经网络等方法建立多标签分类模型并通过特征重要性、SHAP 等可解释性方法分析年龄、BMI、血压、胆固醇、血糖以及生活方式因素对不同疾病的影响。进一步还可围绕疾病共现关系建模、类别不平衡处理、多任务学习、个性化风险评分和早期筛查系统开展研究为智能医疗辅助决策、慢性病管理和健康干预提供数据支持。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-444文件大小28K原创声明本数据集为整理作品