小米罗福莉重返大模型领域,全程直播训练过程

更新时间: 2026-09-18 浏览:3047

在经历了半年的沉寂后,小米的罗福莉再次参与大模型的竞争,并直播了大模型的训练过程。9月17日凌晨,作为小米MiMo大模型团队的负责人,前DeepSeek研究员罗福莉在社交平台X上分享了他们目前在强化学习(RL)领域的研究进展。目前最新的大模型MiMo-V2.6正处于RL运行的中期,团队正朝三个方向进行扩展:一是计算资源,每一步消耗约20亿tokens,采用1568个提示和16次rollout的完全异步运行;二是环境和测试框架,执行多任务代理式强化学习,混合多个测试框架;三是评估计算,涉及代理式组内信用分配和基于量规的奖励,未来几周将逐步开源相关详细内容。

罗福莉还分享了MiMo-V2.6的实时训练界面,这是外界首次看到该模型在强化学习阶段的一部分状态。训练页面显示了模型训练的进展、Token消耗、训练成本、样本数量等多个内部指标的变化。目前有两个版本的训练数据,分别是MiMo-V2.6-Pro和MiMo-V2.6-Flash。根据统计,这两个版本的训练成本已累计超过128万美元,其中MiMo-V2.6-Pro的训练时长为1天19小时,花费89万美元,平均每小时超2万美元;而MiMo-V2.6-Flash则训练了1天14小时,耗费39.7万美元,平均每小时超1万美元。

小米创始人雷军曾多次提到公司在人工智能方面的突破,今年3月在微博上表示,万亿参数的大模型MiMo-V2-Pro位列全球大模型综合智能排行榜第八,并在品牌排名中名列第五,超过了xAI Grok,后续会快速迭代和增强。罗福莉是雷军从DeepSeek挖来的“95后”AI领军人物,毕业于北京师范大学计算机专业,之后在北京大学深造计算语言学。她曾在阿里巴巴达摩院工作,参与多语言预训练模型的开发。2022年,罗福莉加入了DeepSeek,之后成为DeepSeek-V2等模型的研究员。去年11月,罗福莉首次正式宣布加入小米,并致力于实现智能从语言到物理世界的跨越。 千亿球友会