
POLARIS 53K 训练数据全揭秘高质量数学数据集是如何筛选炼成的【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARISPOLARIS 53K 训练数据是开源强化学习RL后训练项目 POLARIS 的核心资产由 5.3 万道高难度数学竞赛题组成专门服务于高级推理模型的训练。这套高质量数学数据集通过独特的动态难度筛选 三阶段课程学习机制炼成让 4B 参数的小模型在 AIME 等基准上超越了多款商业大模型。本文为你完整揭秘 POLARIS 53K 数据集从原始语料到最终训练数据的筛选全过程。 什么是 POLARIS 53K 数据集POLARIS 是一个开源的强化学习后训练配方Post-training Recipe核心思路是在已有强推理能力的基座模型如 Qwen3-4B、DeepSeek-R1-Distill-Qwen-7B之上继续用强化学习压榨推理潜力。而 RL 训练的效果很大程度上取决于喂给模型的数据质量——这正是 POLARIS 53K 数据集存在的意义。这份高质量数学数据集共 5.3 万条数学题覆盖 AIME、AMC、Minerva、Olympiad Bench 等主流数学竞赛与学术基准风格每题都附带标准答案ground truth用于 RL 奖励计算。数据文件就保存在项目的 parquet/stage1/polaris-data-53K.parquet官方还同步公开了数据集的难度分布。 POLARIS 53K 数据集从哪里来两大开源语料强强联合53K 数据集并非凭空生成而是从两个知名开源数学数据集合并 筛选而来DeepScaleR-Preview-Dataset约 4 万道高难度数学竞赛题AReaL-boba-Data约 10.6 万道数学题两者合计约 14 万题经过清洗、合并、难度筛选后最终只保留约 5.3 万道值得训练的题目淘汰率超过 60%。可以说这份数据集本身就是一次去粗取精的数据工程。⚙️ 数据标准化从 JSONL 到 Parquet 的转换流水线开源数据集的原始格式五花八门而 RL 训练框架本项目基于 Verl 构建需要统一的 Parquet 格式。项目提供了 scripts/data/jsonl2parquet.py 一键转换脚本每条样本被整理为统一的字段结构prompt题目内容以对话形式呈现给模型reward_model.ground_truth标准答案用于规则奖励打分extra_info附加索引信息是后续按题筛选的关键转换命令非常简单python scripts/data/jsonl2parquet.py --jsonl_file data/jsonl_data/polaris-data-53K.jsonl 数据筛选核心机制动态难度评估淘汰简单题这是 POLARIS 53K 数据筛选的精髓也是它与普通静态筛选最大的区别难度不是人工标注的而是让模型做一遍来动态评估的。训练分多个阶段进行每个阶段中模型会对数据集里的每道题做多次采样默认 n8系统会记录每道题被答对的频率训练日志以 JSONL 形式保存每个样本的历史得分。随后drop_easy_data.py 脚本登场完成三步筛选汇总按 index 索引汇总每道题在全部历史采样中的得分求均值计算每道题的平均正确率剔除平均正确率 0.9 的题目被判定为模型已掌握的简单题直接移出下一阶段数据集。一句话概括模型已经学会的题就不再喂给它把宝贵的训练算力留给还不会的难题。这正是课程学习Curriculum Learning思想在强化学习训练中的落地实践。 三阶段课程训练数据难度如何逐级加码配合动态筛选机制POLARIS 采用三阶段训练每一阶段的数据集都不同采样温度也随之提高训练阶段数据规模采样温度数据说明Stage 1全量 53K1.4完整数据集热身充分探索Stage 2剔除简单题1.45去掉正确率 0.9 的题聚焦中高难度Stage 3再次剔除1.5继续淘汰已掌握题目主攻最难样本对应脚本见 scripts/train/qwen3-4b/stage1.sh、stage2.sh、stage3.sh。随着数据难度上升采样温度同步升高是为了保证模型输出多样性不塌缩——题目更难了需要更发散的探索空间。️ 温度自搜索让每个阶段的采样多样性保持一致阶段切换时一个容易被忽视的细节是温度设置。项目提供了 search_optimal_temperature.py会在 1.41.6 区间内按 0.05 步长自动搜索找出能让当前阶段模型多样性分数与上一阶段接近的最佳温度而不是拍脑袋定参数。这也是数据筛选流水线里保证稳定性的关键一环。 数据筛选的最终效果4B 小模型超越商业巨头经过 POLARIS 53K 高质量数学数据集 三阶段课程训练POLARIS-4B-Preview 交出了惊人的成绩单AIME24 达到 81.2、AIME25 达到 79.4超越了 Claude-4-Opus、Grok-3-Beta、o3-mini-high 等顶级商业模型以 AIME25 为参照。这份成绩的代价并不高4B 模型在 32 张 H800 GPU 上仅训练约 10 天batch size 128、rollout size 8。可以说数据的筛选质量在很大程度上决定了训练的性价比。️ 如何复现三步跑通 POLARIS 数据管线想亲自动手复现完整流程非常清晰克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/polaris34/POLARIS cd POLARIS pip install -e ./verl pip install -e ./转换数据将 JSONL 原始数据转为 Parquet 格式使用 scripts/data/jsonl2parquet.py迭代筛选跑完 Stage 1 后用 drop_easy_data.py 基于训练日志生成 Stage 2 数据集并继续训练Stage 3 同理循环。 结语POLARIS 53K 训练数据向我们展示了一个重要趋势在大模型强化学习训练时代数据的质量与难度曲线比数据的绝对数量更关键。通过让模型自己筛题的动态难度评估与三阶段课程训练POLARIS 用 5.3 万道题就把 4B 模型推上了比肩商业巨头的推理水平。如果你也在探索强化学习训练数据的筛选方法这份开源配方值得深入研究与复现。【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考