AI Dataset Assets

Sort By:
BASE-01

Mathematics PhD Rubrics

Reproducible evaluation rubrics for doctoral-level research mathematics questions, tailored for frontier foundation models and mathematical reasoning research teams. Designed with verifiable step-by-step deduction paths to enable granular scoring and precise error attribution beyond final-answer checking. Quality Assurance & Strict Filtering: 1. 3 independent closed-book answers per question evaluated by benchmark models; 2. Scored 0-10 independently with explicit deduction points against unified rubrics; 3. Only questions maintaining an average score <= 5 points are selected to ensure consistent difficulty; 4. Fully archived reasoning traces supporting PRM/critic training and fine-grained evaluation.

Volume: 3,000 Questions
BASE-02

Physics PhD Rubrics

Doctoral-level physics research evaluation rubrics with verifiable deduction paths, designed for reasoning capability training and benchmark evaluation. Decomposes each problem into quantifiable key steps, equivalent transformations, and error boundaries for fine-grained error attribution.

Volume: 3,000 Questions
BASE-03

OpenClaw / Hermes SFT Trajectory Data

Enterprise Agent trajectory synthetic dataset covering 13 primary industries including healthcare, fintech, and enterprise software. Retains full system prompts, multi-turn dialogues, tool calling/returns, workspace state snapshots, and file-level deliverables for robust long-horizon SFT training.

Volume: 100,000 Groups
BASE-04

OpenClaw / Hermes RL Reinforcement Learning Trajectories

High-quality full session trajectory and human rubric dataset for reinforcement learning and reward modeling. Contains 4-5 weighted dimensions with structured scoring reasons for multi-objective reward fitting and critic training.

Volume: 60,000 Groups
BASE-05

SWE-bench Multilingual Code Repair Evaluation Benchmark

SWE-bench paradigm evaluation dataset spanning 10 programming languages from real GitHub pull requests, complete with Dockerized environments and test patches.

Volume: 2,500 Groups
BASE-06

K12 Multidisciplinary Multimodal Reasoning Dataset

Authentic exam questions excluding multiple-choice with 37.2% multimodal geometry/function diagrams, fine-grained knowledge tags, and double-blind verified answers for RLVR/SFT training.

Volume: 141,655 Questions
BASE-07

Claude AI Agent Task Interaction Execution Logs

Structured production agent logs from Claude Code and OpenHands across full-stack backend development workflows, preserving system prompts and multi-turn tool traces.

Volume: 25,912 Sessions
BASE-08

Futures Quantitative Strategy Source Code & Rules (15m K-Line)

Production-ready JoinQuant Python quantitative trading algorithms, signal detection rules, and risk management parameters for commodity futures.

Volume: 200,000 Records
BASE-09

GPT Coding Agent Full Engineering Development Logs

Full-lifecycle software engineering interaction traces of GPT coding agents developing industrial CAD plugins in C# / .NET.

Volume: 200,000 Records
BASE-10

Multiturn Frontier AI Dialogue Trajectories

Gateway dialogue sessions across OpenAI GPT and Anthropic Claude models for preference alignment and cross-model evaluation.

Volume: 20,000 / Day