罗福莉:MiMo-V2.6或完成开源模型领域规模最大的单次强化学习训练之一

据PANews发布,PANews 9月22日消息,小米MiMo团队成员罗福莉发文表示,MiMo-V2.6按算力规模计,可能是迄今开源模型团队开展的最大规模单次强化学习训练之一。团队在算力紧缺的情况下,投入数十人并持续较长时间推进强化学习扩展,模型能力在中期训练阶段形成,并通过大规模强化学习进一步释放。她称,团队针对代码等可验证的中等难度任务采用MixRL训练,对难以验证、超长周期或复杂度过高的任务则单独训练,再通过MOPD合并能力。为推动智能体强化学习研究,团队还发布了一个由MiMo强化学习轨迹蒸馏而来的Qwen模型、7000个多样化环境以及完整的强化学习训练框架。
利多 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯