数据集是专为自动化招聘与申请人跟踪系统建模而构建的10万份候选人综合画像数据集,核心价值在于通过多因素加权选择矩阵评估CGPA、领域技能、面试分数与ATS匹配度之间的真实关联,并提供44个涵盖个人信息、学术背景、专业技能、项目作品及评估分数的平衡分类特征,有效解决了招聘数据中类别不平衡与特征随机性的问题。适用于数据科学从业者与HR分析师进行二分类预测与公平AI审计。
人力资源
表格
数据集是专为数据清洗初学者而设计的单表合成医疗患者数据集,核心价值在于通过约630条记录集中呈现缺失值、重复行、重复ID、大小写不一致、分类值不一致、混合日期格式、无效日期、格式错误的邮箱与电话及ZIP码等11类常见数据质量问题,有效解决了初学者缺乏贴近真实世界清洗练习数据的问题。适用于数据分析学习者与数据工程师进行数据清洗流程的系统化训练。
医疗
表格
数据集是专为二手车价格预测与回归建模而构建的车辆规格综合数据集,核心价值在于提供品牌型号、车龄、里程、燃油类型、发动机排量、变速箱、拍卖评级及售价等关键特征,覆盖巴基斯坦市场多品牌二手车辆信息,有效解决了二手车估值缺乏结构化训练数据的问题。适用于数据科学从业者与机器学习爱好者进行价格预测建模与特征工程实践。
消费
表格
数据集是专为零售价格分析与液体体积价格比较研究而构建的2026年7月中旬至8月上旬美国12个ZIP市场即饮冰咖啡、冷萃咖啡及液体浓缩咖啡产品级挂牌价格数据集,核心价值在于提供60942条未经聚合的产品级价格观测记录,并通过固定液体体积比较目标(64液量盎司)实现价格可比性归一化,有效解决不同包装规格液体咖啡产品间价格直接比较的困难。适用于数据分析师与市场研究者进行零售价格分布研究与跨市场比较分析。
消费
时序
表格
数据集为82个大语言模型在10家主要提供商(OpenAI、Anthropic、Google DeepMind、xAI、Meta、阿里巴巴、DeepSeek、Mistral AI、智谱AI、Amazon)的API定价、技术规格与基准性能追踪数据,每行标注来源URL与基准自报/独立评估标识,可支撑成本分析、模型选型与价格趋势研究,适用于LLM成本对比分析、模型性能评估及价格趋势追踪等场景。
其他
表格
数据集是专为零样本提示分类与输出令牌长度预测而构建的1859条去重提示多标签分类语料库,核心价值在于提供覆盖复杂度层级、推理深度、输出长度、执行优先级与任务领域等23个标签的精细标注体系,可训练LightGBM、CatBoost等轻量级CPU高效模型实现亚10毫秒级推理,有效解决了依赖辅助LLM进行提示路由时延迟高与成本高的问题。适用于AI工程师与ML开发者进行动态LLM路由与提示复杂度估计。
其他
表格
数据集是专为开源生态分析与开发者社区研究而构建的1735个Discord相关GitHub仓库数据集,核心价值在于通过标记官方(88个)与社区(1647个)仓库,揭示Discord官方工具与社区驱动生态之间的规模与活跃度差异,有效解决了平台官方与社区贡献界限模糊的问题。适用于开源研究者与开发者进行生态趋势分析与工具选型决策。
其他
表格
数据集是专为供应链延迟预测与物流优化而构建的10万条货运记录综合数据集,核心价值在于提供涵盖货运生命周期、供应商可靠性、仓库绩效、交通状况、天气影响与路线效率等106个细粒度运营特征,并同时支持二分类、回归与风险评分三类预测任务,有效解决了供应链分析中特征维度单一且缺乏时效性数据的问题。适用于数据科学家与物流分析师进行延迟预测与供应链风险建模。
交通
表格
数据集为销售交易数据与劳动力规划视角的融合分析表,包含订单日期、销售额、利润、产品类别、客户细分、地区、发货方式等信息,可支撑销售趋势分析与劳动力需求预测,适用于销售预测、劳动力需求分析及HR数据分析实践等场景。
消费
表格
数据集是专为金融违约预测与电商信用风险分析而构建的10000名线上消费者综合画像数据集,核心价值在于提供涵盖人口统计、财务状况、BNPL使用行为及购物习惯的11个特征,并基于债务收入比、信用评分与逾期记录建模生成违约风险目标变量(低/中/高),有效解决了新兴BNPL消费模式缺乏结构化风险分析数据的问题。适用于数据科学家与金融分析师进行信用风险建模与客户分群研究。
金融
表格
数据集是专为销售趋势分析与商业智能仪表板开发而构建的5000条模拟电商交易记录数据集,核心价值在于提供订单详情、客户信息、产品类别、区域销售、支付方式、折扣、配送绩效与客户评分等12个完整字段,覆盖从订单到客户反馈的全链路商业数据,有效解决了电商分析教学中缺乏结构化销售数据的问题。适用于数据分析师与商业智能从业者进行EDA与KPI分析。
消费
表格
数据集是专为电动汽车电池故障预测与健康管理而构建的20万条物理信息合成电池遥测记录数据集,核心价值在于通过因果关联真实电池退化物理机制(LFP/NMC/NCA/LMO/LTO五种化学体系与20个品牌)与热应力、充电习惯、驾驶行为、维护质量等多因素非线性组合生成故障标签(约10%故障率),有效解决了真实电池故障数据稀缺且难以获取标记样本的问题。适用于数据科学家与汽车工程师进行分类建模与电池健康研究。
制造
表格
数据集是专为肺癌风险因素分析与生存预测而构建的2000名患者综合临床数据集,核心价值在于提供跨越2015–2026年、覆盖60个国家与6个WHO地区的详细临床、人口统计、生活方式、遗传及诊断信息,并预置包年指数、风险因素计数、症状计数、年龄分组与BMI分类等5个工程特征,有效解决了多区域肺癌数据整合与特征工程门槛高的问题。适用于临床研究者与数据科学从业者进行生存分析与社会经济差异研究。
医疗
表格
数据集是专为零售价格分析与可比性研究而构建的2026年7月中旬至8月上旬美国12个ZIP市场美国奶酪切片产品级挂牌价格数据集,核心价值在于提供12039条未经聚合的产品级价格观测记录,并通过固定比较目标(0.375磅)实现质量归一化的可比价格字段,有效解决了不同包装规格产品间价格直接比较的困难。适用于数据分析师与市场研究者进行价格分布研究与跨市场、跨时间的价格跟踪分析。
消费
时序
表格
数据集是专为印度铁路网络分析与空间地理研究而构建的8990个车站地理目录数据集,核心价值在于整合精确车站坐标与官方时刻表路由流量数据(各车站独特列车路线计数),形成兼具空间地图与加权网络图双重功能的印度铁路基础设施数据集,有效解决了公共车站列表缺乏准确坐标或交通流量指标的问题。适用于交通网络分析师与GIS研究者进行连通性分析与基础设施密度研究。
交通
表格
地理空间
数据集是专为登革热流行病学分析与时空预测而构建的38万余条监测记录数据集,核心价值在于通过标准化102个国家/地区的时空字段、保留原始来源UUID与明确标注数据修复标记,提供分析就绪的百年登革热监测数据,有效解决了全球登革热监测数据在时空字段不一致、地理标签不统一及元数据缺失等问题。适用于流行病学家与数据科学家进行时间序列预测与暴发检测研究。
医疗
时序
表格
数据集是专为宏观经济分析与生活成本跨国比较而构建的多维度经济指标数据集,核心价值在于通过融合世界银行实时通胀数据与覆盖194个国家的细粒度生活成本指数及日常商品服务价格(食品、住房、交通、水电),形成标准化、可比价的全球生活成本画像,有效解决了宏观经济统计与微观消费数据脱节的问题。适用于宏观经济学家与政策分析师进行购买力评估与跨国生活成本研究。
金融
时序
表格
数据集是专为癌症分类与生物标志物筛选而构建的100个高信息量基因判别能力基准数据集,核心价值在于通过整合ANOVA、互信息、效应量及多种机器学习方法的综合评估与稳定性排序,生成共识评分并划分为三个基因层级,有效解决了癌症研究中基因优先级排序缺乏系统化基准的问题。适用于生物信息学研究者进行特征选择实验与分类模型开发。
医疗
表格
数据集是专为关系型数据清洗实践而构建的双表合成医疗数据集,核心价值在于通过在患者表与就诊表之间设置不一致分类值、拼写错误、混合日期格式、数值字段含文本符号、缺失值、重复就诊记录、无效日期关系、外键断裂、孤立记录及异常金额等15种以上真实世界数据质量问题,有效解决了从单表清洗向关系型数据库清洗过渡的训练需求。适用于数据分析学习者与数据工程师进行跨表数据质量分析与清洗流程实践。
医疗
表格
数据集是专为材料信息学与MOF材料探索而构建的代表性金属有机框架材料属性数据集,核心价值在于提供涵盖电子、孔隙与化学组成三大属性空间的900种MOF材料结构信息,包含PBE带隙、孔径描述符、元素组成特征及多样性选择依据等27个字段,并采用确定性多样性采样方法进行材料选择,有效解决了MOF材料空间探索中数据代表性不足与采样偏差的问题。适用于材料科学家与数据科学从业者进行小样本机器学习与主动学习实验。
其他
表格
数据集是专为全球供应链风险分析与地缘政治研究而构建的全球主要海上咽喉要道综合数据集,核心价值在于不仅提供2000-2024年历史追踪数据,更通过集成地缘政治冲突场景与气候风险冲击的机器学习时序预测模型,将船舶流量、石油运输与战略风险预测延伸至2025-2036年,有效解决了传统线性预测无法反映突发事件冲击的问题。适用于供应链分析师与地缘政治研究员进行风险优化与情景规划。
交通
表格
数据集是专为自动化招聘与申请人跟踪系统建模而构建的10万份候选人综合画像数据集,核心价值在于通过多因素加权选择矩阵评估CGPA、领域技能、面试分数与ATS匹配度之间的真实关联,并提供44个涵盖个人信息、学术背景、专业技能、项目作品及评估分数的平衡分类特征,有效解决了招聘数据中类别不平衡与特征随机性的问题。适用于数据科学从业者与HR分析师进行二分类预测与公平AI审计。
人力资源
表格
数据集是专为数据清洗初学者而设计的单表合成医疗患者数据集,核心价值在于通过约630条记录集中呈现缺失值、重复行、重复ID、大小写不一致、分类值不一致、混合日期格式、无效日期、格式错误的邮箱与电话及ZIP码等11类常见数据质量问题,有效解决了初学者缺乏贴近真实世界清洗练习数据的问题。适用于数据分析学习者与数据工程师进行数据清洗流程的系统化训练。
医疗
表格
数据集是专为二手车价格预测与回归建模而构建的车辆规格综合数据集,核心价值在于提供品牌型号、车龄、里程、燃油类型、发动机排量、变速箱、拍卖评级及售价等关键特征,覆盖巴基斯坦市场多品牌二手车辆信息,有效解决了二手车估值缺乏结构化训练数据的问题。适用于数据科学从业者与机器学习爱好者进行价格预测建模与特征工程实践。
消费
表格
数据集是专为零售价格分析与液体体积价格比较研究而构建的2026年7月中旬至8月上旬美国12个ZIP市场即饮冰咖啡、冷萃咖啡及液体浓缩咖啡产品级挂牌价格数据集,核心价值在于提供60942条未经聚合的产品级价格观测记录,并通过固定液体体积比较目标(64液量盎司)实现价格可比性归一化,有效解决不同包装规格液体咖啡产品间价格直接比较的困难。适用于数据分析师与市场研究者进行零售价格分布研究与跨市场比较分析。
消费
时序
表格
数据集为82个大语言模型在10家主要提供商(OpenAI、Anthropic、Google DeepMind、xAI、Meta、阿里巴巴、DeepSeek、Mistral AI、智谱AI、Amazon)的API定价、技术规格与基准性能追踪数据,每行标注来源URL与基准自报/独立评估标识,可支撑成本分析、模型选型与价格趋势研究,适用于LLM成本对比分析、模型性能评估及价格趋势追踪等场景。
其他
表格
数据集是专为零样本提示分类与输出令牌长度预测而构建的1859条去重提示多标签分类语料库,核心价值在于提供覆盖复杂度层级、推理深度、输出长度、执行优先级与任务领域等23个标签的精细标注体系,可训练LightGBM、CatBoost等轻量级CPU高效模型实现亚10毫秒级推理,有效解决了依赖辅助LLM进行提示路由时延迟高与成本高的问题。适用于AI工程师与ML开发者进行动态LLM路由与提示复杂度估计。
其他
表格
数据集是专为开源生态分析与开发者社区研究而构建的1735个Discord相关GitHub仓库数据集,核心价值在于通过标记官方(88个)与社区(1647个)仓库,揭示Discord官方工具与社区驱动生态之间的规模与活跃度差异,有效解决了平台官方与社区贡献界限模糊的问题。适用于开源研究者与开发者进行生态趋势分析与工具选型决策。
其他
表格
数据集是专为供应链延迟预测与物流优化而构建的10万条货运记录综合数据集,核心价值在于提供涵盖货运生命周期、供应商可靠性、仓库绩效、交通状况、天气影响与路线效率等106个细粒度运营特征,并同时支持二分类、回归与风险评分三类预测任务,有效解决了供应链分析中特征维度单一且缺乏时效性数据的问题。适用于数据科学家与物流分析师进行延迟预测与供应链风险建模。
交通
表格
数据集为销售交易数据与劳动力规划视角的融合分析表,包含订单日期、销售额、利润、产品类别、客户细分、地区、发货方式等信息,可支撑销售趋势分析与劳动力需求预测,适用于销售预测、劳动力需求分析及HR数据分析实践等场景。
消费
表格
数据集是专为金融违约预测与电商信用风险分析而构建的10000名线上消费者综合画像数据集,核心价值在于提供涵盖人口统计、财务状况、BNPL使用行为及购物习惯的11个特征,并基于债务收入比、信用评分与逾期记录建模生成违约风险目标变量(低/中/高),有效解决了新兴BNPL消费模式缺乏结构化风险分析数据的问题。适用于数据科学家与金融分析师进行信用风险建模与客户分群研究。
金融
表格
数据集是专为销售趋势分析与商业智能仪表板开发而构建的5000条模拟电商交易记录数据集,核心价值在于提供订单详情、客户信息、产品类别、区域销售、支付方式、折扣、配送绩效与客户评分等12个完整字段,覆盖从订单到客户反馈的全链路商业数据,有效解决了电商分析教学中缺乏结构化销售数据的问题。适用于数据分析师与商业智能从业者进行EDA与KPI分析。
消费
表格
数据集是专为电动汽车电池故障预测与健康管理而构建的20万条物理信息合成电池遥测记录数据集,核心价值在于通过因果关联真实电池退化物理机制(LFP/NMC/NCA/LMO/LTO五种化学体系与20个品牌)与热应力、充电习惯、驾驶行为、维护质量等多因素非线性组合生成故障标签(约10%故障率),有效解决了真实电池故障数据稀缺且难以获取标记样本的问题。适用于数据科学家与汽车工程师进行分类建模与电池健康研究。
制造
表格
数据集是专为肺癌风险因素分析与生存预测而构建的2000名患者综合临床数据集,核心价值在于提供跨越2015–2026年、覆盖60个国家与6个WHO地区的详细临床、人口统计、生活方式、遗传及诊断信息,并预置包年指数、风险因素计数、症状计数、年龄分组与BMI分类等5个工程特征,有效解决了多区域肺癌数据整合与特征工程门槛高的问题。适用于临床研究者与数据科学从业者进行生存分析与社会经济差异研究。
医疗
表格
数据集是专为零售价格分析与可比性研究而构建的2026年7月中旬至8月上旬美国12个ZIP市场美国奶酪切片产品级挂牌价格数据集,核心价值在于提供12039条未经聚合的产品级价格观测记录,并通过固定比较目标(0.375磅)实现质量归一化的可比价格字段,有效解决了不同包装规格产品间价格直接比较的困难。适用于数据分析师与市场研究者进行价格分布研究与跨市场、跨时间的价格跟踪分析。
消费
时序
表格
数据集是专为印度铁路网络分析与空间地理研究而构建的8990个车站地理目录数据集,核心价值在于整合精确车站坐标与官方时刻表路由流量数据(各车站独特列车路线计数),形成兼具空间地图与加权网络图双重功能的印度铁路基础设施数据集,有效解决了公共车站列表缺乏准确坐标或交通流量指标的问题。适用于交通网络分析师与GIS研究者进行连通性分析与基础设施密度研究。
交通
表格
地理空间
数据集是专为登革热流行病学分析与时空预测而构建的38万余条监测记录数据集,核心价值在于通过标准化102个国家/地区的时空字段、保留原始来源UUID与明确标注数据修复标记,提供分析就绪的百年登革热监测数据,有效解决了全球登革热监测数据在时空字段不一致、地理标签不统一及元数据缺失等问题。适用于流行病学家与数据科学家进行时间序列预测与暴发检测研究。
医疗
时序
表格
数据集是专为宏观经济分析与生活成本跨国比较而构建的多维度经济指标数据集,核心价值在于通过融合世界银行实时通胀数据与覆盖194个国家的细粒度生活成本指数及日常商品服务价格(食品、住房、交通、水电),形成标准化、可比价的全球生活成本画像,有效解决了宏观经济统计与微观消费数据脱节的问题。适用于宏观经济学家与政策分析师进行购买力评估与跨国生活成本研究。
金融
时序
表格
数据集是专为癌症分类与生物标志物筛选而构建的100个高信息量基因判别能力基准数据集,核心价值在于通过整合ANOVA、互信息、效应量及多种机器学习方法的综合评估与稳定性排序,生成共识评分并划分为三个基因层级,有效解决了癌症研究中基因优先级排序缺乏系统化基准的问题。适用于生物信息学研究者进行特征选择实验与分类模型开发。
医疗
表格
数据集是专为关系型数据清洗实践而构建的双表合成医疗数据集,核心价值在于通过在患者表与就诊表之间设置不一致分类值、拼写错误、混合日期格式、数值字段含文本符号、缺失值、重复就诊记录、无效日期关系、外键断裂、孤立记录及异常金额等15种以上真实世界数据质量问题,有效解决了从单表清洗向关系型数据库清洗过渡的训练需求。适用于数据分析学习者与数据工程师进行跨表数据质量分析与清洗流程实践。
医疗
表格
数据集是专为材料信息学与MOF材料探索而构建的代表性金属有机框架材料属性数据集,核心价值在于提供涵盖电子、孔隙与化学组成三大属性空间的900种MOF材料结构信息,包含PBE带隙、孔径描述符、元素组成特征及多样性选择依据等27个字段,并采用确定性多样性采样方法进行材料选择,有效解决了MOF材料空间探索中数据代表性不足与采样偏差的问题。适用于材料科学家与数据科学从业者进行小样本机器学习与主动学习实验。
其他
表格
数据集是专为全球供应链风险分析与地缘政治研究而构建的全球主要海上咽喉要道综合数据集,核心价值在于不仅提供2000-2024年历史追踪数据,更通过集成地缘政治冲突场景与气候风险冲击的机器学习时序预测模型,将船舶流量、石油运输与战略风险预测延伸至2025-2036年,有效解决了传统线性预测无法反映突发事件冲击的问题。适用于供应链分析师与地缘政治研究员进行风险优化与情景规划。
交通
表格