小米直播训练 MiMo-V2.6 模型,罗福莉称沉寂半年钻研一件事

IT之家 9 月 17 日消息,小米 MiMo 大模型负责人罗福莉今日发文,自 4 月份开源 MiMo-v2.5 后,小米沉寂了近半年,花时间研究了一件事 —— 强化学习究竟能扩展到多远 。 MiMo-V2.6 目前正处于强化学习中间阶段。该团队为其扩展了三项能力: 计算(每步约 20 亿个 Token,1,568 个 Prompt × 16 条 Rollout,完全异步) 环境和工具(多任务智能体强化学习,一次运行中混合多个框架) Grader Compute(给打分 / 评分过程本身增加算力,Agentic In-group Credit Assignment,包含测试案例和评分标准奖励)…
以上为资讯摘要,完整内容请访问原文网站。
阅读原文 →