现代资讯现代实验室装备网
全国服务热线
400-100-9187、0731-84444840

阿里通义实验室智能计算团队推出新算法FIPO

   2026-04-10 975
核心提示:近日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励
近日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。
 
举报收藏 0打赏 0
 
更多>同类资讯
  • 猎人
    加关注0
  • 没有留下签名~~
推荐图文
推荐资讯
点击排行