大语言模型性能与幻觉数据集

数据集是专为LLM失败模式分析与幻觉风险预测而构建的10万条合成模型评估基准数据集,核心价值在于通过25000个独特提示与4个合成模型配置(7B/13B/70B/MoE)的结构化交互,生成涵盖提示复杂度、模糊度、上下文、模型能力与安全性等20个字段的评估记录,有效解决了真实LLM评估数据分散且缺乏系统化幻觉标注的问题。适用于AI安全研究者与ML工程师进行幻觉预测建模与安全评估。

行业:
AI安全与模型评估
国标分类:
行业专识数据集
0
28
2026-08-31

数据集介绍

数据属性

数据模态
表格
数据格式
CSV
记录数/样本数
100000条记录
文件数量
1个文件
总大小
14.86MB
地理覆盖范围
不适用
时间覆盖范围
无特定时间点
数据更新频率
静态(不再更新)
数据采集方式
数据合成
预期用途
微调
标注状态
完全标注
标注类型
分类标签
数 据 驱 动 未 来
Data Drives The Future
0512-88869195
客服微信二维码

微信扫码,咨询客服

数 据 驱 动 未 来
Data Drives The Future