小型语言模型可靠性基准数据集

数据集为PRISM基准评估结果,涵盖4个小型语言模型在2个科学问答数据集(ARC-Challenge和SciQ)上、400个问题与5种提示条件下的表现,包含准确性、指令遵循、一致性及提示敏感性等评估指标,可支撑小语言模型可靠性与提示敏感性研究,适用于小型语言模型鲁棒性评估、提示工程研究及模型对比基准测试等场景。

行业:
人工智能
国标分类:
行业专识数据集
0
15
2026-09-10

数据集介绍

数据属性

数据模态
文本 表格
数据格式
CSV MD
记录数/样本数
1600条记录
文件数量
6个文件
总大小
约3MB
地理覆盖范围
不适用
时间覆盖范围
不适用
数据更新频率
静态(不再更新)
数据采集方式
线下采集
预期用途
评估
标注状态
完全标注
标注类型
分类标签 回归标签
数 据 驱 动 未 来
Data Drives The Future
0512-88869195
客服微信二维码

微信扫码,咨询客服

数 据 驱 动 未 来
Data Drives The Future