Skip to main content

MiMo-V2.6 进行大规模 RL 训练,细节将陆续开源Fuli Luo 在 X 上透露,经过近半年研究,团队正对 MiMo-V2.6 进行大规模 RL 训练,扩展了计算量(每步约 20 亿 tokens)、环境(多任务 agentic RL)和裁判计算三方面,细节将陆续开源

  1. MiMo-V2.6 进行大规模 RL 训练,细节将陆续开源

    Fuli Luo 在 X 上透露,经过近半年研究,团队正对 MiMo-V2.6 进行大规模 RL 训练,扩展了计算量(每步约 20 亿 tokens)、环境(多任务 agentic RL)和裁判计算三方面,细节将陆续开源。

    X | mimo rl

    🌸 科技圈· 茶馆 · 投稿
    🤣 89 👍 53 🙈 5 👎 4 😁 2 ❤️ 1 🔥 1 🖕 1 🙉 1 🙊 1