MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果
智东西 作者 江宇 编辑 李水青 智东西9月24日报道,昨晚,小米MiMo大模型负责人罗福莉发文, 提前披露了MiMo-V3的新架构 ,其 核心组件HySparse2率先登场 ,相关技术论文同步公布。 ▲罗福莉发文 简单来说,这套新架构主要解决Agent越做越多轮之后出现的三个问题: 长输入算得太多 、 缓存占得太大 ,以及 如何从越来越长的上下文里准确找到需要的信息 。 罗福莉直接给出了一组数据:与MiMo-V2.6采用的Hybrid SWA架构相比,在100万Token上下文下,HySparse2处理长输入时所需的预填充(Prefill)计算量 降至约1/5 ,KV Cache占用 降至约1/4.5 ;与此同时,其 长上下文检索 表现进一步提升, AgentPPL和LongPPL 也有所下降。 ▲HySparse2在长上下文表现、Prefill计算量和KV Cache占用上的对比 HySparse2论文由小米LLM-Core团队完成,共有15位作者,罗福莉为通讯作者并标注为Team Lead。论文参考文献里还出现了不少业内熟悉的成果。 其中, DeepSeek相关成果共有4项 ,包括DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash;此外,OpenAI的gpt-oss模型卡以及GPT-4.1相关评测工作也在引用之列。 ▲HySparse2论文引用的4项DeepSeek相关成果 值得注意的是, 距离小米上一轮模型更新,才过去两天 。 9月22日,小米大模型团队刚刚发布并开源新一代Xiaomi MiMo-V2.6系列,并预告后续将逐步开放MiMo-V2.6-Pro-UltraSpeed。相比MiMo-V2.6-Pro,后者在同等智力水平下输出速度提高20倍。 小米还同步开源了用于新模型训练的RL环境、框架以及模型技术报告。罗福莉当时称,MiMo-V2.6押注大规模RL扩展,进行了开源模型迄今最大规模的单次RL训练,团队将其视为探索RSI(递归自我改进)、通往AGI的新一步。 MiMo-V2.6刚刚把大规模RL摆到台前,这一次,小米把刀落到了模型底层架构上。 一、Agent多轮任务,带来更高的长输入成本 HySparse2解决的问题,与Agent越来越典型的一种工作模式有关: 模型生成的动作很短,工具返回的内容却可能很长。 例如,Agent可能只生成一句搜索指令或一次工具调用,随后搜索引擎返回一篇长文档,代码工具返回大量运行日志。模型进行下一轮推理之前,需要先把这些新增内容处理一遍。 这个过程就是Prefill,也就是预填充 。 当Agent连续调用搜索、代码执行、文件读取等工具,文档、网页和运行记录会不断进入上下文。模型既要反复处理这些新增输入,还要保存越来越大的KV Cache,并在几十万甚至上百万Token的历史信息中找出当前真正需要的内容。 论文因此把长周期Agent推理面临的问题归纳为三个方面: 降低Prefill计算量、减少KV Cache占用,以及提高长上下文检索准确率。 上一代HySparse已经做过一轮优化。它把全注意力层和稀疏注意力层交替排列,后面的稀疏层可以复用前一个全注意力层生成的KV Cache和选择索引,从而减少注意力计算和缓存占用。不过,在Prefill阶段,HySparse仍需要依次执行全部网络层。 到了HySparse2, 小米进一步把Prefill的执行路径缩短 :处理长输入时,模型跑完前半部分,就可以完成后续推理所需KV Cache的构建。 二、两级KV共享,让模型少跑一半 实现这一点的核心,是HySparse2采用的 两级KV共享 。 第一层叫KV Bridging 。 HySparse2把模型主体分成Self-Decoder和Cross-Decoder两部分。前者由全注意力和滑动窗口注意力组成,后者则由全注意力和稀疏注意力组成。 在Cross-Decoder中,全注意力层生成K和V时,可以直接使用Self-Decoder对应全注意力层产生的隐藏状态。这样,后半部分无需再完整处理一次此前输入的全部Token。 第二层是KV Reuse 。 进入Cross-Decoder后,一个全注意力层生成的KV Cache和Token选择结果,还会继续提供给后续多个稀疏注意力层复用。两级共享叠加后,Cross-Decoder所需的KV Cache都可以根据Self-Decoder的隐藏状态构建。 ▲HySparse2的两级KV共享架构 Prefill执行完Self-Decoder即可退出,无需再让后半部分完整跑过一次长输入。 HySparse2还调整了寻找长上下文信息的方式 。 上一代HySparse采用Block级选择,即一次选取一整块连