
沉寂半年的小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉17日凌晨于X平台发文,公开旗下最新大模型MiMo-V2.6强化学习(RL)阶段的实时训练页面,首次全程直播大模型训练过程。页面数据显示,MiMo-V2.6-Pro与Flash两个版本当前累计训练成本已超过128万美元(约858万人民币),每小时训练成本合计超过3万美元(约20万人民币),展现小米在大模型赛道上的高额研发投入与技术推进。
澎湃新闻报导,根据罗福莉公开的页面细节,MiMo-V2.6正在进行大规模的Agent(智能体)强化学习实验,展示了训练进度、Token消耗与样本数量等指针。团队目前正进行计算资源、环境测试框架及评估计算等三方面的扩展,其中每步约消耗20亿Token,并采用1568个提示与16次rollout的完全异步机制。
截至公开时,Pro版本已训练1天19小时、耗费89万美元(平均每小时超2万美元);Flash版本训练1天14小时、耗费39.7万美元(平均每小时超1万美元),并预告未来几周将逐步开源细节。
这项昂贵的技术直播背后,折射出小米对通用人工智能(AGI)的积极布局。身为「95后」AI领军科学家的罗福莉,硕士毕业于北京大学,曾任职于阿里达摩院及DeepSeek,参与研发DeepSeek-V2等模型。她去年11月宣布加入小米,并表示:「智能终将从语言迈向物理世界,我正在Xiaomi MiMo,和一群富有创造力的研究员致力于构建这样的未来,全力奔赴我们心目中的AGI」。
小米创办人雷军此前亦多次强调AI研发进展,并在今年3月发文透露,万亿参数大模型MiMo-V2-Pro在权威排行榜Artificial Analysis上位列全球第八,若按大模型品牌排名则高居全球第五,甚至超越了xAI的Grok,并承诺未来将持续快速迭代增强。
许多网友感叹直言:「每小时烧掉超3万美元,大模型果然是巨头才能玩得起的超级游戏」、「敢直接公开实时训练页面和成本,说明技术自信相当足」;也有网友留言评价:「从DeepSeek挖来顶尖人才再加上雷军的资金支持,期待小米带来新突破」。
罗福莉公开的是MiMo-V2.6在强化学习(RL)阶段的实时训练页面,属于首次全程直播大模型训练。页面同步显示进度、Token消耗与样本数等关键指针。 截至公开时,Pro与Flash两个版本累计训练成本已超过128万美元,合计每小时超过3万美元。其中Pro约训练1天19小时、耗费89万美元,Flash约训练1天14小时、耗费39.7万美元。 内容显示小米正投入大规模Agent强化学习实验,并扩展计算资源、环境测试框架与评估计算能力。罗福莉也强调团队正朝AGI方向前进,未来几周会逐步开源更多细节。精华 FAQ

