AReaL:全异步强化学习框架与推理大模型训练加速引擎

原创 2025-06-13 11:11:52新闻资讯
1342

AReaL是什么

AReaL(Ant Reasoning RL)是蚂蚁技术研究院与清华大学交叉信息研究院联合开发的开源强化学习训练框架,作为全球首个实现全异步训练的推理大模型优化系统,其核心突破在于通过算法-系统协同设计(co-design),解决了传统同步强化学习在GPU利用率、训练周期和扩展性方面的三大痛点。项目于2025年2月首次开源,经过三个版本迭代后,最新发布的AReaL-boba²(v0.3)在Qwen3-14B模型上实现训练速度提升2.77倍,同时保持模型性能不变甚至提升。

区别于传统同步RL框架(如VeRL),AReaL创新性地采用可中断生成机制解耦PPO目标函数,将数据生成与模型训练完全解耦。实验证明,该系统在1.5B-32B参数范围的模型上均实现线性加速:在数学推理任务中,7B模型仅需25.4小时完成训练(对比基线57.7小时),AIME2024分数达63.1分;在代码生成任务中,14B模型以21.9小时训练时间达到LiveCodeBench 58.1分,刷新开源社区记录。项目已全面开源代码、数据集及模型权重,为推理大模型(LRM)的普惠化发展提供了基础设施级支持。

功能特色

AReaL在强化学习训练领域实现三大技术突破:

1. 全异步训练架构

传统系统如DeepCoder采用同步模式,而AReaL通过可中断Rollout Worker实现革命性突破:

  • 动态权重加载:生成过程中可中断并切换模型版本,KV缓存实时重组,中断延迟<0.1ms

  • 解耦数据流:训练器与生成器通过共享内存池通信,吞吐量提升35-73%(1.5B-32B模型)

  • 资源优化:在512张GPU集群上实现线性扩展,利用率从58%提升至92%

2. 低成本高性能训练

通过数据蒸馏技术实现极致性价比:

  • 极简数据需求:仅用200条数据复现QwQ-32B的78.8 AIME分数(原模型需5万条),成本200美元

  • 快速收敛:7B模型2天内完成RL训练,AIME2025分数48.3分,超越o1-Preview

  • 混合精度支持:FP16+FP32混合训练使显存占用降低40%

3. 多任务泛化能力

基于统一框架支持跨领域优化

  • 数学推理:1.5B模型在AMC23任务准确率从57.5%提升至70.0%

  • 代码生成:14B模型LiveCodeBench得分69.1,Codeforce Rating达2044

  • 智能体训练:原生支持多轮Agentic RL,交互延迟<300ms

AReal.webp

技术细节

1. 核心架构设计

异步训练系统

  • 四组件架构:生成器/评估器/训练器/经验池通过gRPC通信

  • 动态批处理:自动打包不同长度序列,填充率从51%提升至89%

  • 容错机制:训练中断后可从任意检查点恢复,数据丢失率<0.1%

关键算法创新

  1. 解耦PPO目标函数

    • 传统PPO:

    • AReaL改进:引入策略版本差异补偿项

  2. 陈旧性控制

    • 设置最大陈旧度η=4,优先消耗η范围内的旧数据

    • 实验显示η=8时性能下降仅2.3%(传统方法下降37%)

  3. 部分序列生成

    • 将长序列拆分为chunk(默认256token)

    • 通过KV缓存重组实现跨chunk一致性

2. 训练优化策略

三阶段训练流程

  1. 基础预训练

    • 数据:106k条数学/代码样本(AReaL-boba-106k数据集)

    • 硬件:128张H800 GPU,24小时完成1.5B模型训练

  2. 强化学习微调

    • 算法:异步PPO+KL散度约束(β=0.2)

    • 超参:学习率5e-6,batch size 1024,GAE λ=0.95

  3. 多任务迁移

    • 方法:冻结底层Transformer,仅微调注意力头

    • 效果:数学→代码任务迁移性能损失<15%

3. 性能评估

基准测试对比(AReaL-boba² v0.3)

任务/模型 指标 同步RL基线 AReaL提升
数学/7B AIME2024分数 63.0 +0.1
  训练时间 57.7小时 -55.9%
代码/14B LiveCodeBench 56.7 +1.4
  GPU利用率 58% +34%
智能体/32B 交互延迟 420ms -120ms

消融实验发现

  • 异步收益:1.5B模型在16GPU上训练时间从41h→14.8h

  • 数据蒸馏:200条数据即可达到全量数据92%性能

  • 解耦PPO:η=4时训练稳定性提升3.7倍

应用场景

AReaL的技术特性在多个领域产生变革性影响:

1. 教育领域

  • 个性化辅导:7B模型可实时生成解题思路(某在线教育平台响应时间从3s→0.8s)

  • 自动评分:数学证明题评估准确率达89%(传统方法72%)

2. 工业研发

  • 代码补全:14B模型在内部代码库补全准确率提升至71%(GitHub Copilot 68%)

  • 设计优化:通过RL训练实现芯片布局面积减少12%

3. 科学研究

  • 定理证明:在Coq框架下自动证明成功率提升28%

  • 文献分析:32B模型可生成符合学术规范的文献综述(人工审核通过率82%)

相关链接

  • 论文地址:https://arxiv.org/pdf/2505.24298

  • 代码仓库:https://github.com/inclusionAI/AReaL

  • 模型数据:https://huggingface.co/collections/inclusionAI/areal-boba-2-683f0e819ccb7bb2e1b2f2d5

总结

AReaL作为全球首个全异步强化学习训练框架,通过可中断生成机制与解耦PPO算法,在Qwen3-14B模型上实现2.77倍训练加速与69.1的LiveCodeBench分数,其开箱即用的200美元低成本方案与全面开源的技术栈,已成功应用于教育辅导、工业编程、科研分析等领域,为推理大模型的普惠化发展树立了新的技术标杆。

ai框架 开源项目
THE END
ai资讯
关注ai行业发展,专注ai软件推荐。

相关推荐

arealme测试入口官网
arealme测试入口官网是https://www.arealme.com/。这个网站提供多种免费在线测试工具,操作简单且无需注册。根据权威资料,具体测试入口如下: 色盲检查测试入口 官网地址:...
2026-04-02 新闻资讯
221

SE-Agent:中科院、清华大学和阶跃星辰等联合开源的创新型自进化智能体框架
一、SE-Agent是什么SE-Agent(Self-Evolution Agent)是由中国科学院、清华大学和阶跃星辰等机构联合开发的一款创新型自进化智能体框架,旨在通过系统性地优化语言模型(LL...
2025-08-21 新闻资讯
981

MemU:NevaMind-AI团队专为AI伴侣打造的开源长期记忆框架
MemU(Memory Unit)是由NevaMind-AI团队开发的一款专注于AI伴侣场景的下一代开源记忆框架,其核心目标是解决当前AI系统普遍存在的"健忘"问题。与传统的静态数据存储不同,Me...
2025-08-19 新闻资讯
1860

AudioGenie:多模态输入驱动的无训练多智能体音频生成框架
AudioGenie 是由腾讯AI Lab与香港科技大学(广州)联合研发的无需训练的多智能体系统,专注于多模态到多音频生成(MultiModality-to-MultiAudio, MM2MA)任务。它能够从视频、...
2025-08-19 新闻资讯
965

VeOmni:字节跳动与火山引擎开源的全模态AI训练框架
VeOmni 是字节跳动Seed团队与火山引擎联合研发并开源的一款全模态PyTorch原生训练框架,旨在解决当前AI领域从单一文本模态向多模态(文本、图像、语音、视频)演进过程中的系...
2025-08-18 新闻资讯
952

RynnRCP:阿里巴巴达摩院开源的一套机器人上下文协议及框架
RynnRCP 是阿里巴巴达摩院自主研发并开源的一套机器人上下文协议及框架,全称为Robotics Context Protocol。它首次将模型上下文协议(MCP)理念引入具身智能领域,旨在打通从传...
2025-08-14 新闻资讯
817