印度语言维基百科语料数据库

数据集是专为多语言NLP与低资源印度语脚本处理而构建的15671条维基百科文章高质量文本语料库,核心价值在于通过严格的随机采样与存根过滤流程,从20种印度语言中提取真实语言内容与站点元数据(含介绍文本、类别、跨语言链接数等12个特征),有效解决了大规模多语言数据集中空页与数字存根过多的问题。适用于NLP研究者与数据科学家进行语言识别、多语言模型评估与跨语言差距分析。

行业:
多语言文本分析
国标分类:
行业通识数据集
0
26
2026-09-03

数据集介绍

数据属性

数据模态
文本 表格
数据格式
CSV JSON Parquet
记录数/样本数
15671条记录
文件数量
3个文件
总大小
29.9MB
地理覆盖范围
印度
时间覆盖范围
无特定时间点
数据更新频率
静态(不再更新)
数据采集方式
公共数据集获取
预期用途
微调
标注状态
完全标注
标注类型
分类标签
数 据 驱 动 未 来
Data Drives The Future
0512-88869195
客服微信二维码

微信扫码,咨询客服

数 据 驱 动 未 来
Data Drives The Future