2026前沿大语言模型推理与速度基准数据集

数据集是专为大语言模型综合能力评估而构建的500+标准化提示基准数据集,核心价值在于通过7个前沿模型在数学推理、代码生成、多步逻辑、长上下文检索与JSON提取5个企业级领域的执行结果,提供准确性分数、响应延迟、吞吐量及成本等多维度性能指标,有效解决了LLM对比评估缺乏标准化与多维度数据的问题。适用于AI研究者与企业开发者进行模型选型与性能基准测试。

行业:
AI技术与模型评估
国标分类:
行业通识数据集
0
25
2026-08-31

数据集介绍

数据属性

数据模态
表格
数据格式
CSV Parquet
记录数/样本数
500+条记录
文件数量
4个文件
总大小
1.37MB
地理覆盖范围
全球
时间覆盖范围
2026年
数据更新频率
静态(不再更新)
数据采集方式
公开网络爬取
预期用途
微调
标注状态
完全标注
标注类型
分类标签
数 据 驱 动 未 来
Data Drives The Future
0512-88869195
客服微信二维码

微信扫码,咨询客服

数 据 驱 动 未 来
Data Drives The Future