数学Phd rubrics
本数据产品提供博士级高难数学研究题的可复现评分 Rubrics,面向大语言模型基模研发团队与数学推理研究团队,专门用于高难数学推理能力的训练、对齐与评测。数据以 “可验证的完整推理路径” 为核心设计理念,将每道题拆解为可量化的关键步骤、等价变形节点、分类边界与容错标准,支持对模型输出进行细粒度判分与精准误差归因,彻底摆脱仅以最终答案判定能力的单一评测模式。 严格的质量保障与筛选标准: 1. 每题由 doubao-seed-2-0-pro 进行 3 次完全独立的闭卷作答,作答过程互不干扰、不共享任何前置信息; 2. 由 GPT-5.4-thinking 依据统一 Rubrics 对 3 份答案分别进行 0-10 分的独立评分,并记录详细扣分点; 3. 仅保留三次作答均分≤5 分的题目,确保入选题目能对当前主流强模型形成稳定的难度压制; 4. 所有题目均经过字段完整性校验,完整归档三次模型答案、评分记录、均分结果与判定结论,满足一致性、独立性、可解释性与可追溯性的质量要求。 能力覆盖与应用价值: 数据集覆盖前沿数学理论导向的研究型主题与多元证明范式,能够帮助研发团队在形式推理、长链证明、抽象结构理解、反例构造等核心高难推理能力上,建立稳定的训练信号与可横向比较的统一评测基准。同时,本数据集支持后续扩展为 PRM/critic 训练数据、难例回归集与细分能力切片评测集,可适配模型研发全周期的训练与评测需求。
