数据集为4000名音乐流媒体用户的收听行为数据,涵盖平台选择、订阅类型、收听时长、跳过率、音乐偏好及情绪等15个字段,可支撑用户行为分析与分群研究,适用于用户行为聚类、平台偏好分析及数据可视化实践等场景。
文旅
表格
数据集为500条学生与职场人士的心理健康与生活方式记录,涵盖睡眠、压力、社交媒体使用、身体活动及焦虑抑郁评分等18个特征,可用于预测心理健康状况与严重程度,适用于心理健康状态预测、生活方式与心理指标关联分析及医疗数据分析教学等场景。
医疗
表格
数据集为53198条保健品价格观测记录,覆盖5个品类、12个美国邮政编码区域、29个连续日期(2026年7月21日至8月18日),包含产品标题、日期、地理位置、列表价格及品类别标准化价格字段,可支撑区域价格差异分析与时间序列趋势研究,适用于区域价格差异分析、品类价格分布研究及数据可视化仪表盘开发等场景。
消费
时序
表格
数据集为45466部电影的元数据信息,涵盖预算、收入、类型、演员概述、上映日期、时长、语言、流行度及用户评分等字段,可支撑电影推荐系统开发与票房分析研究,适用于电影推荐系统构建、票房收入预测及电影行业趋势分析等场景。
文旅
文本
表格
数据集是专为印度股票市场基本面分析与估值研究而构建的5,258家上市公司综合财务数据集,核心价值在于提供股价、市盈率、市值、季度利润/销售增长率及资本回报率等关键指标的结构化快照,有效解决了印度市场公司级财务数据分散且难以批量获取的问题。适用于金融分析师与数据科学从业者进行基本面筛选与估值比较分析。
金融
表格
数据集是专为模型集成与预测结果复现而构建的Kaggle Playground系列竞赛提交文件存档数据集,核心价值在于汇总5位参赛者针对296302条测试样本的预测概率文件,为加权集成与模型融合提供标准化基础预测源,有效解决了竞赛后预测结果分散难以系统性复用的问题。适用于数据科学从业者与竞赛参与者进行模型集成学习与结果后处理研究。
医疗
表格
数据集是专为AI加速器性能分析与硬件演进研究而构建的2010-2026年Nvidia数据中心GPU综合性能数据集,核心价值在于提供从Tesla C2070到Blackwell B200共9代AI超级计算加速器的架构、制程、核心数、时钟频率、功耗、价格及衍生效率指标等33个字段的标准化数据,有效解决了GPU代际性能对比缺乏结构化数据的问题。适用于硬件分析师与AI研究者进行性能趋势分析与算力成本建模。
制造
表格
数据集是专为能源需求预测与时序建模而构建的2.8年小时级电力消耗数据集,核心价值在于提供温度、云量、小时、月份、周末标志等7个特征与25,000条逻辑驱动的时间序列记录(遵循日间周期、季节变化、周末低谷与极端天气效应),有效解决了能源预测教学中缺乏结构化时序数据的问题。适用于数据科学从业者与能源分析师进行时间序列预测与特征工程实践。
能源
表格
数据集是专为硬件性能预测与规格建模而构建的4000+ CPU型号综合规格数据集,核心价值在于整合x86与ARM架构处理器的时钟频率、核心/线程数、插槽类型、TDP、发布年份、类别及价格等关键字段,并工程化衍生11个ML就绪特征(如标准化频率与每性能点成本),有效解决了处理器规格数据分散且缺乏结构化整合的问题。适用于数据科学从业者与硬件分析师进行价格预测与规格聚类分析。
制造
表格
数据集是专为电商分析与销售预测而构建的多年度跨国零售交易数据集,核心价值在于提供订单、退货与人员三张关联表的50000+订单记录,覆盖140+国家的时间、地理、产品、财务与物流等27个字段,支持从时间序列预测到供应链优化的全链路商业分析,有效解决了零售分析教学中缺乏多表关联真实规模数据集的问题。适用于商业分析师与数据科学从业者进行销售预测与客户细分建模。
消费
表格
数据集是专为认知发展影响因素研究而构建的50,000名儿童综合数据集,核心价值在于整合父母IQ、孕期营养、环境暴露、早期教育、家庭环境等28个特征,并校准至元分析文献效应量,揭示环境因素(R²=0.45)比父母IQ(R²=0.28)更能预测儿童IQ的核心发现,有效解决了行为遗传学与环境流行病学数据分散且缺乏结构化整合的问题。适用于发展心理学家与数据科学从业者进行基因-环境交互与可干预因素分析。
教育
表格
数据集是专为网络安全与钓鱼邮件检测而构建的5万封合成邮件数据集,核心价值在于提供邮件内容、发送者信息、域名特征、认证信号、URL指标、附件行为及工程化风险指标等44个特征,并包含钓鱼概率评分与二元标签,有效解决了真实钓鱼邮件数据获取困难且标注成本高的问题。适用于网络安全研究员与数据科学从业者进行钓鱼邮件分类与异常检测建模。
其他
表格
数据集是专为电动汽车市场分析与销售预测而合成的特斯拉车型销售、定价与性能结构化数据集,核心价值在于提供车型细分、区域销量、定价、收入、电池容量、续航里程、加速、能效、充电时间及客户满意度等多维字段,有效解决了特斯拉真实销售数据难以公开获取的问题。适用于数据科学从业者与商业分析师进行销售趋势分析与市场比较研究。
制造
表格
数据集是专为法律合同审查与合规红队测试而构建的100样本多轮对话指令微调与偏好优化数据集,核心价值在于通过模拟对抗性谈判对话与链式推理标注,覆盖SaaS MSA、并购NDA、DPA及雇佣合同等5类合同类型及4大司法管辖区,有效解决了法律AI领域缺乏结构化合同审查训练数据的问题。适用于法律科技开发者与AI研究员进行大语言模型合同审查能力微调与评估。
其他
文本
表格
数据集是专为贷款额度预测与信贷风险评估而构建的50000条合成抵押贷款申请数据集,核心价值在于基于真实承保规则(含信用评分分级的债务收入比限制与年金现值计算)构建借款人画像与最大可贷金额,涵盖人口统计、就业、收入及财务特征等14个字段,有效解决了抵押贷款建模缺乏标准化结构化数据的问题。适用于数据科学从业者与金融分析师进行回归建模与风险分析。
金融
表格
数据集为1000条DNA甲基化位点记录,涵盖CpG密度、基因组位置、调控潜力评分及进化保守性评分等特征,目标变量为甲基化状态(0=未甲基化/1=甲基化),已按训练/测试集划分,可用于表观遗传生物标志物发现与视网膜疾病早期检测研究,适用于表观遗传学生物标志物发现、基因组学分类建模及生物信息学特征重要性分析等场景。
医疗
表格
数据集是专为全球经济流动分析与时间序列预测而构建的2000-2023年全球201个国家年度汇款流出数据集,核心价值在于提供以百万美元计量的标准化汇款流出数据,反映移民工人东道国资本流出轨迹,有效解决了原始世界银行KNOMAD数据格式复杂难以直接分析的问题。适用于数据科学家与宏观经济学家进行财富分布趋势分析与全球冲击影响研究。
金融
表格
数据集为100000条合成网络流量记录,模拟正常网络行为与DDoS攻击、暴力破解登录、端口扫描等攻击模式,可支撑入侵检测系统开发与网络安全机器学习研究,适用于入侵检测、网络异常检测及多分类模型训练等场景。
其他
表格
数据集为50余个大语言模型的Token定价与上下文长度元数据,涵盖OpenAI、Claude、Gemini、DeepSeek、Grok等主流提供商,包含输入/输出Token成本及上下文窗口等字段,可支撑LLM推理成本估算与模型选型决策,适用于成本估算、模型对比及上下文长度需求匹配等场景。
其他
表格
数据集是专为医疗信息学与药品知识管理而构建的26000+药品品牌结构化目录数据集,核心价值在于整合化药与草本产品的临床药理、商业及用药指导信息,涵盖1,993种活性成分与424家制药企业,有效解决了药品信息分散且缺乏结构化整合的问题。适用于医疗数据分析师与NLP研究者进行药品信息检索、知识图谱构建与临床决策支持系统开发。
医疗
表格
数据集为零售业务的关系型数据集合,包含客户人口统计画像与交易订单明细两张关联表,通过客户ID进行关联,可支撑客户分群与财务绩效分析,适用于客户细分、销售绩效分析及商业智能仪表盘开发等场景。
消费
表格
数据集为4000名音乐流媒体用户的收听行为数据,涵盖平台选择、订阅类型、收听时长、跳过率、音乐偏好及情绪等15个字段,可支撑用户行为分析与分群研究,适用于用户行为聚类、平台偏好分析及数据可视化实践等场景。
文旅
表格
数据集为500条学生与职场人士的心理健康与生活方式记录,涵盖睡眠、压力、社交媒体使用、身体活动及焦虑抑郁评分等18个特征,可用于预测心理健康状况与严重程度,适用于心理健康状态预测、生活方式与心理指标关联分析及医疗数据分析教学等场景。
医疗
表格
数据集为53198条保健品价格观测记录,覆盖5个品类、12个美国邮政编码区域、29个连续日期(2026年7月21日至8月18日),包含产品标题、日期、地理位置、列表价格及品类别标准化价格字段,可支撑区域价格差异分析与时间序列趋势研究,适用于区域价格差异分析、品类价格分布研究及数据可视化仪表盘开发等场景。
消费
时序
表格
数据集为45466部电影的元数据信息,涵盖预算、收入、类型、演员概述、上映日期、时长、语言、流行度及用户评分等字段,可支撑电影推荐系统开发与票房分析研究,适用于电影推荐系统构建、票房收入预测及电影行业趋势分析等场景。
文旅
文本
表格
数据集是专为印度股票市场基本面分析与估值研究而构建的5,258家上市公司综合财务数据集,核心价值在于提供股价、市盈率、市值、季度利润/销售增长率及资本回报率等关键指标的结构化快照,有效解决了印度市场公司级财务数据分散且难以批量获取的问题。适用于金融分析师与数据科学从业者进行基本面筛选与估值比较分析。
金融
表格
数据集是专为模型集成与预测结果复现而构建的Kaggle Playground系列竞赛提交文件存档数据集,核心价值在于汇总5位参赛者针对296302条测试样本的预测概率文件,为加权集成与模型融合提供标准化基础预测源,有效解决了竞赛后预测结果分散难以系统性复用的问题。适用于数据科学从业者与竞赛参与者进行模型集成学习与结果后处理研究。
医疗
表格
数据集是专为AI加速器性能分析与硬件演进研究而构建的2010-2026年Nvidia数据中心GPU综合性能数据集,核心价值在于提供从Tesla C2070到Blackwell B200共9代AI超级计算加速器的架构、制程、核心数、时钟频率、功耗、价格及衍生效率指标等33个字段的标准化数据,有效解决了GPU代际性能对比缺乏结构化数据的问题。适用于硬件分析师与AI研究者进行性能趋势分析与算力成本建模。
制造
表格
数据集是专为能源需求预测与时序建模而构建的2.8年小时级电力消耗数据集,核心价值在于提供温度、云量、小时、月份、周末标志等7个特征与25,000条逻辑驱动的时间序列记录(遵循日间周期、季节变化、周末低谷与极端天气效应),有效解决了能源预测教学中缺乏结构化时序数据的问题。适用于数据科学从业者与能源分析师进行时间序列预测与特征工程实践。
能源
表格
数据集是专为硬件性能预测与规格建模而构建的4000+ CPU型号综合规格数据集,核心价值在于整合x86与ARM架构处理器的时钟频率、核心/线程数、插槽类型、TDP、发布年份、类别及价格等关键字段,并工程化衍生11个ML就绪特征(如标准化频率与每性能点成本),有效解决了处理器规格数据分散且缺乏结构化整合的问题。适用于数据科学从业者与硬件分析师进行价格预测与规格聚类分析。
制造
表格
数据集是专为电商分析与销售预测而构建的多年度跨国零售交易数据集,核心价值在于提供订单、退货与人员三张关联表的50000+订单记录,覆盖140+国家的时间、地理、产品、财务与物流等27个字段,支持从时间序列预测到供应链优化的全链路商业分析,有效解决了零售分析教学中缺乏多表关联真实规模数据集的问题。适用于商业分析师与数据科学从业者进行销售预测与客户细分建模。
消费
表格
数据集是专为认知发展影响因素研究而构建的50,000名儿童综合数据集,核心价值在于整合父母IQ、孕期营养、环境暴露、早期教育、家庭环境等28个特征,并校准至元分析文献效应量,揭示环境因素(R²=0.45)比父母IQ(R²=0.28)更能预测儿童IQ的核心发现,有效解决了行为遗传学与环境流行病学数据分散且缺乏结构化整合的问题。适用于发展心理学家与数据科学从业者进行基因-环境交互与可干预因素分析。
教育
表格
数据集是专为网络安全与钓鱼邮件检测而构建的5万封合成邮件数据集,核心价值在于提供邮件内容、发送者信息、域名特征、认证信号、URL指标、附件行为及工程化风险指标等44个特征,并包含钓鱼概率评分与二元标签,有效解决了真实钓鱼邮件数据获取困难且标注成本高的问题。适用于网络安全研究员与数据科学从业者进行钓鱼邮件分类与异常检测建模。
其他
表格
数据集是专为电动汽车市场分析与销售预测而合成的特斯拉车型销售、定价与性能结构化数据集,核心价值在于提供车型细分、区域销量、定价、收入、电池容量、续航里程、加速、能效、充电时间及客户满意度等多维字段,有效解决了特斯拉真实销售数据难以公开获取的问题。适用于数据科学从业者与商业分析师进行销售趋势分析与市场比较研究。
制造
表格
数据集是专为法律合同审查与合规红队测试而构建的100样本多轮对话指令微调与偏好优化数据集,核心价值在于通过模拟对抗性谈判对话与链式推理标注,覆盖SaaS MSA、并购NDA、DPA及雇佣合同等5类合同类型及4大司法管辖区,有效解决了法律AI领域缺乏结构化合同审查训练数据的问题。适用于法律科技开发者与AI研究员进行大语言模型合同审查能力微调与评估。
其他
文本
表格
数据集是专为贷款额度预测与信贷风险评估而构建的50000条合成抵押贷款申请数据集,核心价值在于基于真实承保规则(含信用评分分级的债务收入比限制与年金现值计算)构建借款人画像与最大可贷金额,涵盖人口统计、就业、收入及财务特征等14个字段,有效解决了抵押贷款建模缺乏标准化结构化数据的问题。适用于数据科学从业者与金融分析师进行回归建模与风险分析。
金融
表格
数据集为1000条DNA甲基化位点记录,涵盖CpG密度、基因组位置、调控潜力评分及进化保守性评分等特征,目标变量为甲基化状态(0=未甲基化/1=甲基化),已按训练/测试集划分,可用于表观遗传生物标志物发现与视网膜疾病早期检测研究,适用于表观遗传学生物标志物发现、基因组学分类建模及生物信息学特征重要性分析等场景。
医疗
表格
数据集是专为全球经济流动分析与时间序列预测而构建的2000-2023年全球201个国家年度汇款流出数据集,核心价值在于提供以百万美元计量的标准化汇款流出数据,反映移民工人东道国资本流出轨迹,有效解决了原始世界银行KNOMAD数据格式复杂难以直接分析的问题。适用于数据科学家与宏观经济学家进行财富分布趋势分析与全球冲击影响研究。
金融
表格
数据集为100000条合成网络流量记录,模拟正常网络行为与DDoS攻击、暴力破解登录、端口扫描等攻击模式,可支撑入侵检测系统开发与网络安全机器学习研究,适用于入侵检测、网络异常检测及多分类模型训练等场景。
其他
表格
数据集为50余个大语言模型的Token定价与上下文长度元数据,涵盖OpenAI、Claude、Gemini、DeepSeek、Grok等主流提供商,包含输入/输出Token成本及上下文窗口等字段,可支撑LLM推理成本估算与模型选型决策,适用于成本估算、模型对比及上下文长度需求匹配等场景。
其他
表格
数据集是专为医疗信息学与药品知识管理而构建的26000+药品品牌结构化目录数据集,核心价值在于整合化药与草本产品的临床药理、商业及用药指导信息,涵盖1,993种活性成分与424家制药企业,有效解决了药品信息分散且缺乏结构化整合的问题。适用于医疗数据分析师与NLP研究者进行药品信息检索、知识图谱构建与临床决策支持系统开发。
医疗
表格
数据集为零售业务的关系型数据集合,包含客户人口统计画像与交易订单明细两张关联表,通过客户ID进行关联,可支撑客户分群与财务绩效分析,适用于客户细分、销售绩效分析及商业智能仪表盘开发等场景。
消费
表格