BASE-01
Mathematics PhD Rubrics
Reproducible evaluation rubrics for doctoral-level research mathematics questions, tailored for frontier foundation models and mathematical reasoning research teams. Designed with verifiable step-by-step deduction paths to enable granular scoring and precise error attribution beyond final-answer checking.
Quality Assurance & Strict Filtering:
1. 3 independent closed-book answers per question evaluated by benchmark models;
2. Scored 0-10 independently with explicit deduction points against unified rubrics;
3. Only questions maintaining an average score <= 5 points are selected to ensure consistent difficulty;
4. Fully archived reasoning traces supporting PRM/critic training and fine-grained evaluation.
Volume: 3,000 Questions
|
Sample: Package Pending
BASE-02
Physics PhD Rubrics
Doctoral-level physics research evaluation rubrics with verifiable deduction paths, designed for reasoning capability training and benchmark evaluation. Decomposes each problem into quantifiable key steps, equivalent transformations, and error boundaries for fine-grained error attribution.
Volume: 3,000 Questions
|
Sample: Package Pending
BASE-03
OpenClaw / Hermes SFT Trajectory Data
Enterprise Agent trajectory synthetic dataset covering 13 primary industries including healthcare, fintech, and enterprise software. Retains full system prompts, multi-turn dialogues, tool calling/returns, workspace state snapshots, and file-level deliverables for robust long-horizon SFT training.
Volume: 100,000 Groups
|
Sample: Package Pending
BASE-04
OpenClaw / Hermes RL Reinforcement Learning Trajectories
High-quality full session trajectory and human rubric dataset for reinforcement learning and reward modeling. Contains 4-5 weighted dimensions with structured scoring reasons for multi-objective reward fitting and critic training.
Volume: 60,000 Groups
|
Sample: Package Pending
BASE-05
SWE-bench Multilingual Code Repair Evaluation Benchmark
SWE-bench paradigm evaluation dataset spanning 10 programming languages from real GitHub pull requests, complete with Dockerized environments and test patches.
Volume: 2,500 Groups
|
Sample: Package Pending
BASE-06
K12 Multidisciplinary Multimodal Reasoning Dataset
Authentic exam questions excluding multiple-choice with 37.2% multimodal geometry/function diagrams, fine-grained knowledge tags, and double-blind verified answers for RLVR/SFT training.
Volume: 141,655 Questions
|
Sample: Package Pending
BASE-07
Claude AI Agent Task Interaction Execution Logs
Structured production agent logs from Claude Code and OpenHands across full-stack backend development workflows, preserving system prompts and multi-turn tool traces.
Volume: 25,912 Sessions
|
Sample: Package Pending
BASE-08
Futures Quantitative Strategy Source Code & Rules (15m K-Line)
Production-ready JoinQuant Python quantitative trading algorithms, signal detection rules, and risk management parameters for commodity futures.
Volume: 200,000 Records
|
Sample: Package Pending
BASE-09
GPT Coding Agent Full Engineering Development Logs
Full-lifecycle software engineering interaction traces of GPT coding agents developing industrial CAD plugins in C# / .NET.
Volume: 200,000 Records
|
Sample: Package Pending
BASE-10
Multiturn Frontier AI Dialogue Trajectories
Gateway dialogue sessions across OpenAI GPT and Anthropic Claude models for preference alignment and cross-model evaluation.
Volume: 20,000 / Day
|
Sample: Package Pending