小米 MiMo-V2.6-Pro:开放权重模型的新前沿

Latent Space4 天前

小米进入前沿模型竞争

小米发布了 MiMo-V2.6 系列模型,其中包括两个“原生全模态”模型:

  • MiMo-V2.6-Pro:目前小米能力最强的模型。
  • MiMo-V2.6-Flash:在智能水平、效率和成本之间取得平衡。
  • MiMo-V2.6-Pro-UltraSpeed:面向极致生成速度需求,宣称在相同质量下最高可实现 20 倍输出速度提升。

这对小米而言是一个值得关注的节点。它过去更常被视为手机和硬件公司,而不是传统意义上的中国前沿 AI 实验室。但 MiMo-V2.6 的发布,尤其是开放权重版本的表现,使其进入了大模型社区的讨论中心。

第三方评测中的表现

在 Artificial Analysis 的 Intelligence Index 中,MiMo-V2.6-Pro 被列为开放权重模型中的第一名,指数得分为 46。

该模型还被标注为在“智能水平 vs. 每任务成本”的帕累托前沿上:

  • 每个 Intelligence Index 任务成本约 0.13 美元;
  • 模型为开放权重;
  • 文章标题信息称其训练成本约为 300 万美元。

需要注意的是,这些指标来自特定评测体系,并不等同于所有场景下的通用排名。不同基准、任务类型和部署条件可能会给出不同结果。

训练透明度受到关注

MiMo-V2.6 发布前,小米团队曾公开展示最终阶段的强化学习训练过程,包括内部训练指标。这种做法在大模型训练中并不常见,因此引发了社区关注。

其中一位关键人物是罗福莉,她此前曾在 DeepSeek 工作,后来加入小米。相关训练过程展示了小米在强化学习阶段的一些方法和监控指标。

技术报告中的强化学习扩展方向

根据技术报告,MiMo-V2.6 在强化学习计算上主要沿三个方向扩展:

1. 更大的 batch 与更高吞吐

模型训练采用全异步架构,并使用较大的 batch:

  • 每次更新包含 1,568 个样本;
  • 训练上下文长度最高达到 100 万 token;
  • 每步训练规模约为 35 亿至 37 亿 token。

这表明团队试图通过更高吞吐和更长上下文,提升长任务与复杂任务上的学习效率。

2. 更多任务与更丰富环境

训练任务覆盖多个方向,包括:

  • 代码;
  • 通用智能体任务;
  • 视觉任务;
  • 网络安全相关任务。

这些任务被混合在多个评测与训练框架中,目标是让不同能力之间形成相互强化,而不是只针对单一能力进行优化。

3. 更多评审计算

技术报告提到,训练中使用了组内相对比较,为长程强化学习任务提供更精细、更多样的奖励信号。

这种做法的目标包括:

  • 改善长任务中的奖励判断;
  • 形成一定程度的自我改进循环;
  • 引导模型用更短路径完成任务;
  • 减少每个任务消耗的 token 数。

为什么值得关注

MiMo-V2.6-Pro 的意义不只在于单个排行榜成绩,还在于它体现了几个趋势:

  1. 硬件公司正在进入前沿模型竞赛:小米并非传统“AI 六小虎”之一,但正在投入基础模型研发。
  2. 开放权重模型继续逼近闭源模型体验:开放权重生态仍在快速迭代。
  3. 强化学习训练规模与透明度成为竞争点:更长上下文、更大 batch、更复杂任务环境,正在成为模型后训练阶段的重要变量。
  4. 成本效率成为模型竞争的核心指标之一:每任务成本与能力的组合,越来越受到社区关注。

总体来看,MiMo-V2.6-Pro 是近期中国开放权重大模型中值得跟踪的一个版本。它的真实价值仍需在更多独立评测、实际部署和开发者使用中继续验证。

评论

请登录后发表观点

暂无数据