小米MiMo大模型团队在强化学习领域取得新进展。负责人罗福莉近日通过社交平台透露,自今年4月开源MiMo-v2.5版本后,团队投入近半年时间专注探索强化学习的技术边界,目前正在推进的MiMo-V2.6版本已进入关键阶段。
该版本在三个核心维度实现突破:计算能力方面,单步处理规模达20亿Token,支持1568个prompt同步生成16条Rollout路径,并采用完全异步架构优化效率;环境适配层面,通过多任务智能体强化学习技术,实现单个运行周期内混合调用多个框架的能力;评分机制创新引入Grader Compute模块,为评估过程配置专用算力资源,结合测试案例库与动态评分标准构建奖励体系。
技术团队同步公开了模型训练的实时数据。据直播页面显示,项目累计投入已超125万美元(按当前汇率折合约840.3万元人民币),资金主要用于算力资源采购与算法优化。罗福莉特别强调,此次升级重点聚焦强化学习的可扩展性,通过架构创新解决传统模型在复杂任务中的性能瓶颈问题。
关于技术细节的公开计划,小米方面表示将在未来数周内分阶段开源相关代码与文档。此次开源内容不仅包含核心算法模块,还将提供完整的训练配置参数和性能评估报告,供全球开发者参考验证。业内人士指出,该成果可能推动大模型在多模态交互、自主决策等场景的应用落地。





京公网安备 11011402013531号