C
发布于 2026/09/03 · 阅读 41

小米MiMo-V2.5-Pro-UltraSpeed:1万亿参数模型推理速度突破1000 token/s

  • #AI推理
  • #大模型
  • #小米
  • #模型量化
  • #推测解码
小米MiMo-V2.5-Pro-UltraSpeed:1万亿参数模型推理速度突破1000 token/s

MiMo-V2.5-Pro-UltraSpeed:将1万亿参数模型生成速度提升至1000 TPS

1. 小米MiMo-V2.5-Pro-UltraSpeed:速度是终极优势

从内燃机时代的第一辆咆哮赛车到突破音障的音爆,人类对速度的渴望深植于DNA之中。AI推理的速度同样如此——它定义了智能本身的边界。当一个模型足够快时,它就不再是你等待的工具,而成为你自己思维的延伸:实时响应、瞬间迭代、无摩擦协作。

今天,我们激动地宣布与TileRT合作发布小米MiMo-V2.5-Pro-UltraSpeed,首次在1万亿参数模型上突破1000 tokens/s的解码速度!

2. 限时访问 · 申请制

MiMo-V2.5-Pro-UltraSpeed API同步上线,限时促销价格为MiMo-V2.5-Pro的3倍,但生成速度提升约10倍!3倍价格,10倍输出体验。(仅API,不支持Token计划。)

由于高速推理资源有限,MiMo-V2.5-Pro-UltraSpeed将通过申请制限时开放。获批用户可在试用期内访问API,仅限2026年6月9日至6月23日23:59(北京时间,UTC+8)。

如何申请:API平台:platform.xiaomimimo.com/ultraspeed。试用名额有限,提交申请不代表保证批准。我们将优先考虑有真实业务需求的企业和专业开发者。标准模型访问请关注MiMo-V2.5模型系列。如需与UltraSpeed模型进行深度商业合作,请联系business-mimo@xiaomi.com

聊天体验(试用期内免费):获批用户将获得两周内有效的免费聊天访问权限。入口:ultraspeed.xiaomimimo.com。为确保资源限制下的质量和公平,规则如下:每个账户每天最多排队10次,每次会话上限30分钟,会话空闲超5分钟将自动释放。

3. 1000 tokens/s:不仅仅是快,更是范式转变

在万亿参数规模下,突破1000 tps远不止是一台更快的打字机——它从根本上颠覆了AI应用范式。

首先,速度本身开始转化为智能。以前,面对难题时,你只能“等待一个答案并祈祷它正确”。现在,在相同的实际时间内,模型可以并行运行数十条推理路径(Best-of-N / 树搜索),自动验证并在后台自我纠正——用原始速度产生思维深度,直接提升推理质量。

其次,它完全释放了编码代理的生产力上限。以前,让AI写代码意味着开发者痛苦地等待在屏幕前,受推理延迟瓶颈制约。在1000 tps下,代码生成速度和生产力效率经历范式级别的加速。

最重要的是,万亿参数模型现在可以进入实时决策循环。毫秒级的“思考-响应”周期使得1T旗舰模型无缝接入时间敏感场景——高频量化交易信号生成、即时反欺诈拦截、智能竞价和实时交互对话。而当这种能力被带入生死攸关的手术辅助和医学影像分析时,AI速度不再仅仅是效率指标——它成为与死神赛跑的筹码。在手术台上,AI完成病灶分析和风险预测每节省的一秒,都给外科医生多一分自由度。这加深了我们的信念:速度的终极意义不仅仅是提高生产力,而是让技术帮助人类更好地生活。

4. 极致的模型-系统协同设计

在1T旗舰模型上实现1000+ tokens/s的生成速度并非单一技术的突破——它是MiMo模型团队与TileRT系统团队深度协作和极致协同设计的产物。当前行业实现类似极速通常依赖专用硬件——Cerebras的晶圆级集成或Groq的纯片上SRAM定制架构。我们选择了不同的路径:仅通过模型-系统协同设计在通用GPU上实现更令人印象深刻的推理速度。

在模型侧,我们针对通用硬件的带宽瓶颈应用了FP4量化,大幅缩小模型尺寸并减少内存访问开销;同时,我们引入了DFlash,一种基于块级掩码并行预测的高效推测解码方法,显著增加了每验证步骤接受的token长度。在系统侧,TileRT完美适配这些算法的动态特性,提供了针对新型量化和推测解码流水线优化的定制编译引擎和计算内核。通过这种极致协同设计,我们仅使用单台标准8-GPU通用节点就实现了1T模型1000+ tokens/s的输出。

4.1 FP4量化

在万亿参数规模下,传统的8位(FP8/INT8)甚至16位推理会带来巨大的内存占用和带宽压力。减少参数位宽直接有助于解码速度。因此,我们采用了广泛验证、几乎无损的FP4(MXFP4)量化格式[1]。

然而,对整个模型朴素地应用FP4会导致复杂推理、逻辑和代码生成性能下降。鉴于小米MiMo-V2.5-Pro的MoE(混合专家)架构——专家占据了绝大多数参数,并且对量化具有最高的容忍度——我们选择仅对MoE专家进行FP4量化,同时保持其他模块的原始精度。通过FP4 QAT(量化感知训练),我们在保持模型整体能力基本与原模型持平的同时,大幅减小模型尺寸并最大化硬件带宽利用率,如下所示:

(基准测试对比图,显示FP4量化(仅MoE专家)与FP8相比,整体能力与原模型基本持平)

4.2 DFlash推测解码

传统推测解码依赖一个小型草稿模型“猜测”后续token,然后由大模型验证。这将对自回归生成(每次前向传播生成1个token)转换为并行多token生成,验证中的拒绝采样确保输出质量无损。然而,其瓶颈在于草稿模型的质量决定了接受率,而更强的草稿模型会带来更高的计算开销——这是一种根本性的矛盾。

为了打破僵局,我们采用了DFlash,一种来自研究社区的创新块级掩码并行预测方法[2]:草稿模型在一次前向传播中填充整个掩码位置块,从根本上消除了“自回归草稿”的串行约束。

我们将这种方法部署在MiMo-V2.5-Pro上,并针对万亿规模MoE和长上下文场景进行了定制优化。使用Muon二阶优化器和模型自蒸馏,我们确保紧凑的掩码块仍能提供理想的接受率,同时将草稿阶段开销压缩至接近理论最小值:

  • 草稿模型专门使用滑动窗口注意力(SWA),与MiMo-V2系列的SWA设计自然对齐。这消除了对完整前缀的依赖,将每次预测的计算量从上下文长度线性关系降低为常数。
  • 在训练过程中,掩码信号采样下推到GPU本地分片,使单个序列能够一步产生覆盖不同上下文位置的数万个独立训练信号——与MiMo-V2系列的长上下文能力保持一致,同时避免了跨设备通信开销。

在结果方面,我们的并行预测推测解码在高价值agent和编码场景中实现了显著的接受长度提升,意味着大模型每轮验证可以“一口气”确认更多内容。此外,我们将块大小限制为8以减少验证开销并增加并发性,使高接受长度直接转化为高推理吞吐量:

场景接受长度
编码6.30
数学/推理5.56
Agent4.29

在编码场景中,我们实现了平均6.30的接受长度,部分样本最高达到7.14——意味着每轮验证的8个草稿token中有6-7个被接受。草稿模型保持在轻量级,同时将接受率推至带来实际端到端收益的水平。我们还观察到,在语义更发散、不确定性更高的通用对话场景中,当前接受率还不高。我们正在持续优化算法以探索更高的泛化上限。

4.3 TileRT超低延迟推理内核/系统

如果说MiMo的算法创新解开了百亿和万亿参数模型的带宽约束,那么TileRT推理系统则将通用GPU的物理潜能榨取到微秒级。

在1000 tokens/s的运行频率下,每个算子的生命周期被压缩到微秒级别,传统推理系统的“算子边界”成为核心瓶颈——每次算子启动、硬件同步和全局内存往返都在微秒尺度上打断执行流,暴露出可见的“执行间隙”。

TileRT的范式级执行模型革命

作为超低延迟推理的基础设施,TileRT引入了一种全新的执行模型,从根本上消除了算子边界带来的执行间隙:

  • 持久引擎内核:完全抛弃传统的按算子启动范式,让整个计算流水线持久驻留并在GPU内流动。这实现了全流水线连续预取——当当前Tile仍在Tensor Core上计算时,后续数据已流过内存层次结构,实现数据移动与计算的极致重叠。
  • Warp专业化(异构流水线协作):在Tile级别,通信、数据移动和张量计算以更细粒度进行物理分解。打破同构锁步执行模型,不同的Warp(线程组)甚至整个GPU上的异构执行域独立运行但精确协调——将GPU转变为一个持续流动、精确编排的异构执行系统。

微秒级软硬件深度融合(协同设计)

当底层执行模型将硬件性能推向极限时,纯运行时优化开始触及物理边界。在此基础上,TileRT系统团队与小米MiMo团队进行了深度技术共创,打破了传统软件层边界。为了使模型行为与这种超低延迟执行流水线完美对齐,模型层最终采用了MoE专家的混合FP4量化策略,并在万亿参数架构上部署了SWA对齐的DFlash推测解码。TileRT与这些算法特性和量化方案紧密耦合,提供定制的编译引擎和计算内核。两个团队基于硬件物理进行了深刻的联合工程权衡,确保执行压力闭合。

5. 总结

MiMo-V2.5-Pro-UltraSpeed通过模型-系统协同设计,在通用GPU上实现了万亿参数模型1000+ tokens/s的推理速度,证明了速度本身可以转化为智能。FP4量化、DFlash推测解码和TileRT系统的极致优化共同推动了这一突破。该技术对实时决策、编码Agent和医疗等场景具有重大意义。

(注:本文为技术博客翻译,原文发表于2026年6月8日。)

41 阅读0 评论0 点赞

评论

登录 / 注册即可发布评论!
暂无评论,成为第一个发表评论的用户吧。