数据集是专为医学影像报告分析与弱监督学习而构建的4407份RSNA膝关节MRI放射学报告的大语言模型生成弱标签数据集,核心价值在于通过Qwen3-8B模型从报告中提取12类膝关节异常的二元标签及置信度、提及/否定标志等丰富元数据,并在58份有人工标注的研究上验证总体83.19%准确率,有效解决了医学影像标注成本高昂且数据规模受限的问题。适用于医学影像研究者与ML工程师进行弱监督学习与模型预训练。
医疗
表格
数据集是专为消费者行为分析与营销策略研究而构建的500条购物习惯调查响应数据集,从真实Google Form试点扩展而来,保留部分未完成调查、偶尔拼写错误与缺失值等现实凌乱性,模拟真实调查数据行为,提供涵盖购物渠道、设备偏好、广告与评论影响力、冲动购买频率及购后感受等综合调查数据,有效解决了高度清洁的合成数据无法练习真实调查数据清洗的问题。适用于数据分析师与市场研究者进行客户分群与营销分析。
消费
表格
数据集是专为事实验证与NLP模型评估而构建的5000条标注上下文-声明对合成数据集,核心价值在于提供涵盖科学、历史、地理、技术等多领域的二元验证标签与知识领域、难度等级等元数据,支持自动化事实核查与检索增强生成评估,有效解决了事实核查任务缺乏标准化合成基准数据的问题。适用于NLP研究者与AI安全从业者进行事实验证与文本分类建模。
其他
表格
数据集是专为情感分类与NLP研究而构建的99996条合成英文文本样本数据集,核心价值在于提供平衡分布于12种情感类别与3种情感极性(积极/消极/中性)的丰富标注数据,并附置信度、强度、写作风格、平台等18个元数据列,有效解决了真实情感标注数据获取成本高且类别不平衡的问题。适用于NLP研究者与数据科学从业者进行情感分类与模型微调。
其他
表格
数据集是专为博彩市场效率分析与赔率比较研究而构建的2026年世界杯与MLB实时赔率快照数据集,核心价值在于提供来自23个不同来源(体育博彩公司、交易所与预测市场)的数千条赔率记录,涵盖独赢盘、亚洲盘、让分盘、总分盘及正确比分等多种市场类型,有效解决了跨博彩平台赔率数据分散难以获取的问题。适用于金融分析师与量化研究者进行赔率校准与套利检测研究。
金融
表格
数据集为2,286条英文新闻文章,涵盖2025年5月至2026年6月伊朗-美国冲突的国际媒体报道,包括十二日战争、午夜之锤行动、哈梅内伊遇刺、霍尔木兹海峡危机及停火谈判等关键事件,文章来自BBC News及150余家国际媒体,可支撑情感分析与媒体偏见研究,适用于新闻情感分析、主题建模及媒体偏见检测等场景。
其他
文本
时序
表格
数据集为基于CarAPI遗留车辆数据源的结构化汽车信息,涵盖制造商、车型、配置版本、生产年份、价格、发动机规格、变速箱类型及车身样式等57个字段,可支撑汽车市场分析与价格预测建模,适用于车辆价格预测、车型配置分析与汽车市场趋势研究等场景。
消费
表格
数据集是专为慢性肾病风险预测与医疗AI研究而构建的50000条合成患者记录数据集,核心价值在于提供涵盖人口统计、临床测量、实验室检验、生活方式、病史及AI生成健康建议等40个特征的综合健康画像,并基于规则风险评分生成风险评分与分类标签,有效解决了肾病数据获取困难且隐私受限的问题。适用于数据科学从业者与医疗AI研究者进行分类建模与风险因素分析。
医疗
表格
数据集是专为宫颈癌进展阶段光谱鉴别研究而构建的35条ATR-FTIR光谱测量数据集,核心价值在于提供覆盖399–4001 cm⁻¹范围的3736个波数点的健康宫颈细胞、原发性癌与转移性细胞三组光谱数据,并明确标注两例基于PCA的质量控制离群值,有效解决了癌症光谱分析中缺乏标准化原始数据与离群值标注的问题。适用于光谱分析研究者与生物医学数据科学家进行模式识别与分类建模。
医疗
表格
数据集是专为早期学业风险预警而构建的10万条合成学生记录数据集,核心价值在于通过出勤率、学习习惯与学业历史等10个特征与模拟期末成绩的逻辑关联生成三分类风险标签,并模拟真实数据分布与缺失值,有效解决了真实学生数据敏感且难以公开获取的问题。适用于数据科学从业者与教育研究者进行分类建模与可解释性分析。
教育
表格
数据集是专为AI对就业市场影响分析而构建的2222条来自Adzuna API的真实职位发布数据集,核心价值在于通过关键词匹配标注AI相关与非AI岗位,提供职位标题、公司、地点、类别、合同类型、薪资范围(本地货币)及完整职位描述等19个字段,有效解决了AI劳动力市场缺乏结构化对比数据的问题。适用于数据科学从业者与HR分析师进行薪资比较与就业趋势研究。
人力资源
表格
数据集是专为儿童发育迟缓风险因素分析与多分类预测而构建的2993条儿童健康记录数据集,核心价值在于提供涵盖儿童特征、母亲特征、喂养实践、医疗保健、社会经济与环境等20个字段的综合风险因素,并包含正常/发育迟缓/严重发育迟缓三类目标变量,有效解决了公共卫生领域儿童营养缺乏结构化多因素分析数据的问题。适用于公共卫生研究者与数据科学从业者进行风险因素分析与预测建模。
医疗
表格
数据集是专为电竞运动员表现预测与生物特征关联分析而构建的25万条合成电竞生物特征记录数据集,核心价值在于提供涵盖心率、反应时间、疲劳度、睡眠时长、咖啡因摄入、环境条件与比赛结果等15个字段,并基于真实电竞科学逻辑(如睡眠不足延长反应时间、高APM与高心率相关)生成相关性,有效解决了电竞运动科学数据稀缺且缺乏结构化分析数据的问题。适用于数据科学从业者与体育分析师进行分类建模与回归分析。
其他
表格
数据集为388条客户在线食品订购行为记录,涵盖人口统计、社会经济、教育、家庭、地理位置及客户反馈等14个属性,可支撑客户行为模式分析与订购偏好研究,适用于客户分群、订购行为预测及客户反馈情感分析等场景。
消费
文本
表格
数据集是专为多语言NLP与低资源印度语脚本处理而构建的15671条维基百科文章高质量文本语料库,核心价值在于通过严格的随机采样与存根过滤流程,从20种印度语言中提取真实语言内容与站点元数据(含介绍文本、类别、跨语言链接数等12个特征),有效解决了大规模多语言数据集中空页与数字存根过多的问题。适用于NLP研究者与数据科学家进行语言识别、多语言模型评估与跨语言差距分析。
其他
文本
表格
数据集为2500条患者记录,将吸烟行为与器官健康状况及临床风险指标相关联,涵盖人口统计、吸烟史、BMI、血压风险、胆固醇及心脏/肺/肝/肾/全身健康状态等字段,可支撑健康风险分析与可视化仪表盘开发,适用于吸烟相关健康模式分析、风险分类建模及医疗数据分析教学等场景。
医疗
表格
数据集是专为配送时间预测与物流效率分析而构建的50000条食品配送订单完整生命周期数据集,核心价值在于提供涵盖客户、餐厅、骑手及环境四大域的37个结构一致特征,并支持ETA回归、延迟二分类(含5分钟宽限期)与订单状态多分类三重预测任务,有效解决了物流预测数据中业务逻辑不清晰与目标不一致的问题。适用于数据科学从业者与物流分析师进行ETA预测与运营效率优化。
消费
表格
提供城市跨区域车流迁徙、OD出行矩阵数据,包含区域间出行流量、热门起讫点分布,按日更新,刻画城市人群跨片区流动规律,支撑重大交通组织与路网宏观研判。
交通
文本
针对信号控制路口建立六维量化评价体系,包含通行能力、拥堵、安全、均衡度等指标,按周更新,全面评估信号路口运行效能,指导信号配时优化与交叉口改造。
交通
文本
面向指定路段开展多维度综合评价,整合拥堵指标、车流特征、危险驾驶行为数据,按周更新,实现单条道路运行质量量化评估,支撑精细化路段交通治理。
交通
文本
聚焦居民通勤出行特征,包含通勤路径提取、通勤整体特征两大维度数据,按周更新,掌握通勤主流路线、通勤时长、通勤流向,支撑早晚高峰通勤交通组织优化。
交通
文本
数据集是专为医学影像报告分析与弱监督学习而构建的4407份RSNA膝关节MRI放射学报告的大语言模型生成弱标签数据集,核心价值在于通过Qwen3-8B模型从报告中提取12类膝关节异常的二元标签及置信度、提及/否定标志等丰富元数据,并在58份有人工标注的研究上验证总体83.19%准确率,有效解决了医学影像标注成本高昂且数据规模受限的问题。适用于医学影像研究者与ML工程师进行弱监督学习与模型预训练。
医疗
表格
数据集是专为消费者行为分析与营销策略研究而构建的500条购物习惯调查响应数据集,从真实Google Form试点扩展而来,保留部分未完成调查、偶尔拼写错误与缺失值等现实凌乱性,模拟真实调查数据行为,提供涵盖购物渠道、设备偏好、广告与评论影响力、冲动购买频率及购后感受等综合调查数据,有效解决了高度清洁的合成数据无法练习真实调查数据清洗的问题。适用于数据分析师与市场研究者进行客户分群与营销分析。
消费
表格
数据集是专为事实验证与NLP模型评估而构建的5000条标注上下文-声明对合成数据集,核心价值在于提供涵盖科学、历史、地理、技术等多领域的二元验证标签与知识领域、难度等级等元数据,支持自动化事实核查与检索增强生成评估,有效解决了事实核查任务缺乏标准化合成基准数据的问题。适用于NLP研究者与AI安全从业者进行事实验证与文本分类建模。
其他
表格
数据集是专为情感分类与NLP研究而构建的99996条合成英文文本样本数据集,核心价值在于提供平衡分布于12种情感类别与3种情感极性(积极/消极/中性)的丰富标注数据,并附置信度、强度、写作风格、平台等18个元数据列,有效解决了真实情感标注数据获取成本高且类别不平衡的问题。适用于NLP研究者与数据科学从业者进行情感分类与模型微调。
其他
表格
数据集是专为博彩市场效率分析与赔率比较研究而构建的2026年世界杯与MLB实时赔率快照数据集,核心价值在于提供来自23个不同来源(体育博彩公司、交易所与预测市场)的数千条赔率记录,涵盖独赢盘、亚洲盘、让分盘、总分盘及正确比分等多种市场类型,有效解决了跨博彩平台赔率数据分散难以获取的问题。适用于金融分析师与量化研究者进行赔率校准与套利检测研究。
金融
表格
数据集为2,286条英文新闻文章,涵盖2025年5月至2026年6月伊朗-美国冲突的国际媒体报道,包括十二日战争、午夜之锤行动、哈梅内伊遇刺、霍尔木兹海峡危机及停火谈判等关键事件,文章来自BBC News及150余家国际媒体,可支撑情感分析与媒体偏见研究,适用于新闻情感分析、主题建模及媒体偏见检测等场景。
其他
文本
时序
表格
数据集为基于CarAPI遗留车辆数据源的结构化汽车信息,涵盖制造商、车型、配置版本、生产年份、价格、发动机规格、变速箱类型及车身样式等57个字段,可支撑汽车市场分析与价格预测建模,适用于车辆价格预测、车型配置分析与汽车市场趋势研究等场景。
消费
表格
数据集是专为慢性肾病风险预测与医疗AI研究而构建的50000条合成患者记录数据集,核心价值在于提供涵盖人口统计、临床测量、实验室检验、生活方式、病史及AI生成健康建议等40个特征的综合健康画像,并基于规则风险评分生成风险评分与分类标签,有效解决了肾病数据获取困难且隐私受限的问题。适用于数据科学从业者与医疗AI研究者进行分类建模与风险因素分析。
医疗
表格
数据集是专为宫颈癌进展阶段光谱鉴别研究而构建的35条ATR-FTIR光谱测量数据集,核心价值在于提供覆盖399–4001 cm⁻¹范围的3736个波数点的健康宫颈细胞、原发性癌与转移性细胞三组光谱数据,并明确标注两例基于PCA的质量控制离群值,有效解决了癌症光谱分析中缺乏标准化原始数据与离群值标注的问题。适用于光谱分析研究者与生物医学数据科学家进行模式识别与分类建模。
医疗
表格
数据集是专为早期学业风险预警而构建的10万条合成学生记录数据集,核心价值在于通过出勤率、学习习惯与学业历史等10个特征与模拟期末成绩的逻辑关联生成三分类风险标签,并模拟真实数据分布与缺失值,有效解决了真实学生数据敏感且难以公开获取的问题。适用于数据科学从业者与教育研究者进行分类建模与可解释性分析。
教育
表格
数据集是专为AI对就业市场影响分析而构建的2222条来自Adzuna API的真实职位发布数据集,核心价值在于通过关键词匹配标注AI相关与非AI岗位,提供职位标题、公司、地点、类别、合同类型、薪资范围(本地货币)及完整职位描述等19个字段,有效解决了AI劳动力市场缺乏结构化对比数据的问题。适用于数据科学从业者与HR分析师进行薪资比较与就业趋势研究。
人力资源
表格
数据集是专为儿童发育迟缓风险因素分析与多分类预测而构建的2993条儿童健康记录数据集,核心价值在于提供涵盖儿童特征、母亲特征、喂养实践、医疗保健、社会经济与环境等20个字段的综合风险因素,并包含正常/发育迟缓/严重发育迟缓三类目标变量,有效解决了公共卫生领域儿童营养缺乏结构化多因素分析数据的问题。适用于公共卫生研究者与数据科学从业者进行风险因素分析与预测建模。
医疗
表格
数据集是专为电竞运动员表现预测与生物特征关联分析而构建的25万条合成电竞生物特征记录数据集,核心价值在于提供涵盖心率、反应时间、疲劳度、睡眠时长、咖啡因摄入、环境条件与比赛结果等15个字段,并基于真实电竞科学逻辑(如睡眠不足延长反应时间、高APM与高心率相关)生成相关性,有效解决了电竞运动科学数据稀缺且缺乏结构化分析数据的问题。适用于数据科学从业者与体育分析师进行分类建模与回归分析。
其他
表格
数据集为388条客户在线食品订购行为记录,涵盖人口统计、社会经济、教育、家庭、地理位置及客户反馈等14个属性,可支撑客户行为模式分析与订购偏好研究,适用于客户分群、订购行为预测及客户反馈情感分析等场景。
消费
文本
表格
数据集是专为多语言NLP与低资源印度语脚本处理而构建的15671条维基百科文章高质量文本语料库,核心价值在于通过严格的随机采样与存根过滤流程,从20种印度语言中提取真实语言内容与站点元数据(含介绍文本、类别、跨语言链接数等12个特征),有效解决了大规模多语言数据集中空页与数字存根过多的问题。适用于NLP研究者与数据科学家进行语言识别、多语言模型评估与跨语言差距分析。
其他
文本
表格
数据集为2500条患者记录,将吸烟行为与器官健康状况及临床风险指标相关联,涵盖人口统计、吸烟史、BMI、血压风险、胆固醇及心脏/肺/肝/肾/全身健康状态等字段,可支撑健康风险分析与可视化仪表盘开发,适用于吸烟相关健康模式分析、风险分类建模及医疗数据分析教学等场景。
医疗
表格
数据集是专为配送时间预测与物流效率分析而构建的50000条食品配送订单完整生命周期数据集,核心价值在于提供涵盖客户、餐厅、骑手及环境四大域的37个结构一致特征,并支持ETA回归、延迟二分类(含5分钟宽限期)与订单状态多分类三重预测任务,有效解决了物流预测数据中业务逻辑不清晰与目标不一致的问题。适用于数据科学从业者与物流分析师进行ETA预测与运营效率优化。
消费
表格
提供城市跨区域车流迁徙、OD出行矩阵数据,包含区域间出行流量、热门起讫点分布,按日更新,刻画城市人群跨片区流动规律,支撑重大交通组织与路网宏观研判。
交通
文本
针对信号控制路口建立六维量化评价体系,包含通行能力、拥堵、安全、均衡度等指标,按周更新,全面评估信号路口运行效能,指导信号配时优化与交叉口改造。
交通
文本
面向指定路段开展多维度综合评价,整合拥堵指标、车流特征、危险驾驶行为数据,按周更新,实现单条道路运行质量量化评估,支撑精细化路段交通治理。
交通
文本
聚焦居民通勤出行特征,包含通勤路径提取、通勤整体特征两大维度数据,按周更新,掌握通勤主流路线、通勤时长、通勤流向,支撑早晚高峰通勤交通组织优化。
交通
文本