数据集展示

排序规则:
BASE-01

数学Phd rubrics

本数据产品提供博士级高难数学研究题的可复现评分 Rubrics,面向大语言模型基模研发团队与数学推理研究团队,专门用于高难数学推理能力的训练、对齐与评测。数据以 “可验证的完整推理路径” 为核心设计理念,将每道题拆解为可量化的关键步骤、等价变形节点、分类边界与容错标准,支持对模型输出进行细粒度判分与精准误差归因,彻底摆脱仅以最终答案判定能力的单一评测模式。 严格的质量保障与筛选标准: 1. 每题由 doubao-seed-2-0-pro 进行 3 次完全独立的闭卷作答,作答过程互不干扰、不共享任何前置信息; 2. 由 GPT-5.4-thinking 依据统一 Rubrics 对 3 份答案分别进行 0-10 分的独立评分,并记录详细扣分点; 3. 仅保留三次作答均分≤5 分的题目,确保入选题目能对当前主流强模型形成稳定的难度压制; 4. 所有题目均经过字段完整性校验,完整归档三次模型答案、评分记录、均分结果与判定结论,满足一致性、独立性、可解释性与可追溯性的质量要求。 能力覆盖与应用价值: 数据集覆盖前沿数学理论导向的研究型主题与多元证明范式,能够帮助研发团队在形式推理、长链证明、抽象结构理解、反例构造等核心高难推理能力上,建立稳定的训练信号与可横向比较的统一评测基准。同时,本数据集支持后续扩展为 PRM/critic 训练数据、难例回归集与细分能力切片评测集,可适配模型研发全周期的训练与评测需求。

量级: 3000题
BASE-02

物理Phd rubrics

本数据产品提供博士级物理研究题的可复现评分 Rubrics,面向基模与研究团队,用于高难推理能力的训练、对齐与评测。数据以“可验证的推理路径”为核心:将每道题拆解为可量化的关键步骤、等价变形与容错边界,支持对模型输出进行细粒度判分与误差归因(而非只看最终答案)。 覆盖前沿理论导向的研究型主题与证明范式,帮助团队在“形式推理、长链证明、抽象结构理解、反例构造”等关键能力上建立稳定的训练信号与可比较的评测基准,并支持后续扩展为 PRM/critic 数据、难例回归集与能力切片评测。

量级: 3000题
BASE-03

Openclaw/Hermes SFT数据

本数据产品提供面向真实企业知识工作场景OpenClaw/Hermes Agent 轨迹合成数据,面向基础模型、Agent 团队与评测研究团队,用于长链任务执行、工具使用、环境交互、过程监督与综合能力评测。数据以“可回放、可验证、可交付的代理执行过程”为核心:完整保留 system 指令、多轮用户交互、assistant 推理与决策、tool call / tool 返回、workspace 初态与末态快照,以及任务执行后沉淀的文件级交付物,使模型学习的不只是最终回答,还包括如何理解需求、拆解任务、调用工具、读写文件、利用外部信息并完成最终产出。 任务领域覆盖医疗运营,金融科技,企业软件等13个不同一级领域,数百个二级领域。采用最先进拟真技术,确保多样性,杜绝模板化query等低质量合成特征。 关键质量门槛: 1.平均user query轮次>=4; 2.平均工具调用次数>=32; 3.工具调用信息完整;workspace信息完整; 4.执行模型为Claude-opus-4.6。 这类数据特别适合用于构建和评测以下能力:长链规划与执行、工具使用与调用时机判断、网页检索与证据整合、文件系统操作、结构化文档生成、多文件协同产出、假设与事实分离、任务完成度判断,以及面向真实办公场景的 Agent 稳定性。适用于SFT训练,也可进一步扩展为PRM/critic 数据、工具调用纠错集、失败恢复样本、难例回归集与能力切片评测集。

量级: 100000组
BASE-04

Openclaw/Hermes RL数据

本数据产品提供面向真实 Agent 执行场景的高质量 OpenClaw/Hermes 全会话轨迹与人工Rubric 数据,面向强化学习、奖励建模、critic 训练与高标准 Agent 评测团队。数据以“已完成任务的完整执行过程 + 可解释评分依据”为核心:每条样本均保留完整 session 轨迹、任务描述、workspace初末态(可提供逐轮快照)、最终交付物,以及配套的人工 rubric 与打分结果,使模型训练与评测不再只依赖最终答案,而能对“是否完成任务、完成得是否可靠、证据是否充分、交付是否可用”进行结构化监督。 轨迹本身是完整的 Agent 执行过程,任务最终状态全部为成功完成;rubric 通常包含 4 至 5 个评分维度,权重和为 1,可直接转化为多目标奖励或分项 critic 信号。从需求覆盖、证据与可追溯性、交付物完整性、过程可靠性、最终沟通效果等维度进行评分,并在 qa.json 中给出总分、分维度得分、通过项数量和评分理由,方便团队直接用于监督学习、奖励拟合和评测回放。 关键质量门槛: 1.任务完整闭环; 2.平均user query轮次>=4;平均工具调用次数>=32; 3.工具调用信息完整;workspace信息完整; 4.执行模型为Claude-opus-4.6。 这类数据特别适合训练和评估以下能力:长链任务完成度、工具使用质量、约束遵守、证据引用与可追溯性、结构化交付物生成、错误恢复、最终验收意识,以及面向真实办公任务的稳定执行能力。相较于只告诉模型“答案“对不对”,OpenClaw/Hermes-RL更适合告诉模型“什么样的行为路径更值得奖励”,因此天然适合作为强化学习、奖励建模、critic 数据构建、失败样本对比学习和高质量 Agent 回归评测的基础数据资产。

量级: 60000组
BASE-05

swe-bench-multilingual代码修复评测数据

采用 SWE-bench 评测范式,每个任务含完整 Docker 化运行环境、标准测试补丁及 Agent 运行轨迹;基于 2026 年初 - 4 月 GitHub 12 个活跃开源项目真实 PR 构建,覆盖 10 种编程语言。可用于AI Agent 真实软件工程代码修复能力评估、模型能力对比、Agent 架构研究、代码生成技术评测。

量级: 2500组
BASE-06

K12多学科多模态数据

全部来自全国各地高考 / 模考 / 名校卷真实试题,无合成题;100% 答案经双盲审验证可严格判分,完全排除选择题;37.2% 含几何图、函数图、统计图等多模态信息;每条样本含题面 + 图像 + 标准答案 + 1646 个细粒度双语知识点标签;采用 HITL 人机协同构造流程。可用于RL/RLVR 多模态推理训练、多模态大模型 K12 推理 SFT 训练、模型能力评测与错因分析。

量级: 141655题
BASE-07

Claude AI 智能代理任务交互日志数据

本数据集为Claude模型的用户数据,大部分是Claude code、open hands这些agent的真实落地使用日志。 数据核心内容构成: 1.基础元数据(包含每条会话唯一 ID、用户 ID、创建 / 更新时间、会话标识、消息 ID、角色标识、签名信息、模型推理思考过程字段等完整结构化元数据) 2.系统角色预设 Prompt(内置 OpenHands Agent 完整角色定位、内存管理、文件系统规范等全套系统指令 Prompt) 3.工程任务交互全链路(围绕投注博弈类 Go 语言后端项目开发任务完整记录) 4.多角色对话结构(严格区分系统角色、用户角色、AI 助手角色、工具调用四大角色消息,保留原始对话格式)。

量级: 扫描文件数: 4, 扫描记录数: 25912, 唯一 session 数: 25912, 原始命中数: 2560, 导出命中数: 2560
BASE-08

期货量化策略源码与交易规则数据(螺纹钢 / 热卷 / 豆粕・15 分钟 K 线)

基于聚宽 JoinQuant 平台的 Python 可运行代码与标准化交易风控规则文档,覆盖螺纹钢、热卷、豆粕三品种 15 分钟 K 线策略与日内交易全逻辑。

量级: 20万
BASE-09

GPT Coding Agent 工程开发日志数据

GPT 系列大模型作为 Coding Agent 完成真实 CAD 插件工业软件项目的全量日志,完整记录需求理解、代码检索、方案设计、源码修改与编译测试排错全流程。

量级: 20万
BASE-10

国外AI模型对话轨迹

通过LLM Gate网关访问OpenAI、GPT、Anthropic Claude 模型,多领域的完整对话轨迹数据。可用于偏好对齐训练 + 跨模型评测 + 通用 SFT 训练。

量级: 日产20000条(5轮以上对话轨迹)