小米推出三款大模型
面向Agent时代的旗舰基座模型
XiaomiMiMo-V2-Pro专为现实世界中高强度的Agent工作场景而打造。它拥有超过1T的总参数量,采用创新的混合注意力架构,支持1M超长上下文长度。在ArtificialAnalysis排行榜上位列全球第八、国内第二。在智能体框架中,能完成复杂工作流编排等,且模型API定价仅为其他模型的1/5。该模型针对Agent场景深度优化,在相关评测榜单上效果顶尖,还能参与严肃代码工程构建。
全模态基座模型
XiaomiMiMo-V2-Omni专为现实世界中复杂的多模态交互与执行场景而生,可无缝接入各种Agent框架。音频理解方面表现出色,能进行环境声分类等;图像理解展现强大能力;视频理解支持原生音视频联合输入。它能跨模态理解复杂环境,自主制定并执行计划,遇到异常时实时修正策略。该模型已开放API服务,还为全球开发者提供限时免费接口支持。
语音合成大模型
XiaomiMiMo-V2-TTS是小米自主研发的语音合成大模型。基于自研架构,经过大规模预训练与多维度强化学习,实现高度可控的多粒度语音风格控制。支持从整体风格到局部情绪表达的精准调节,能还原自然韵律,还能进行高质量歌声合成。训练过程分多阶段,通过超大规模预训练、少量高质量监督数据微调及多维度强化学习,让模型具备丰富多元表达能力。
模型的特点与优势
强大的性能表现
MiMo-V2-Pro拥有超1T总参数量和创新架构,支持超长上下文长度,在排行榜上位居前列,能完成复杂任务且成本低。MiMo-V2-Omni在音频、图像、视频理解方面表现卓越,超越多个知名模型,能跨模态处理复杂环境。MiMo-V2-TTS实现高度可控的语音风格控制,能精准调节语音,自然还原韵律,还能进行高质量歌声合成。

广泛的应用场景
MiMo-V2-Pro适用于高强度Agent工作场景,如代码工程构建、智能体框架中的复杂任务处理。MiMo-V2-Omni可用于复杂多模态交互与执行场景,如智能客服、智能家居控制等领域。MiMo-V2-TTS可应用于有声读物、语音导航、语音助手等需要语音合成的场景。
技术创新与突破
三款模型在技术上均有创新。MiMo-V2-Pro的混合注意力架构和1M上下文长度拓展了智能动作空间。MiMo-V2-Omni的创新视频预训练使其具备情境感知与未来推理能力。MiMo-V2-TTS的自研架构和多维度强化学习实现了多粒度语音风格控制。
模型的开放与使用
开放API服务
MiMo-V2-Pro和MiMo-V2-Omni已正式开放API服务。MiMo-V2-Pro支持1M上下文长度,根据使用量分段计价;MiMo-V2-Omni支持256K上下文长度。用户访问特定网址即可接入API,方便开发者将模型集成到自己的应用和服务中。
限时免费体验
目前,这些模型已经登陆Xiaomimiclaw、MiMoStudio、金山办公、小米浏览器,通过OpenClaw、OpenCode、KiloCode、Blackbox、Cline接入,可限时免费体验一周。这为开发者和用户提供了一个了解和试用模型的机会,降低了使用门槛。
与其他生态的集成
MiMoClaw模块全面打通金山WebOffice生态,原生支持四大主流格式,覆盖超95%日常文档类型。XiaomiMiMo底层推理引擎与金山办公生态实现框架级集成,WPS灵犀接入MiMo-V2-Pro模型,提升办公效率。

相关问答
小米推出的三款大模型分别是什么?
小米推出的三款大模型是MiMo-V2-Pro、MiMo-V2-Omni和MiMo-V2-TTS。MiMo-V2-Pro是旗舰基座模型,MiMo-V2-Omni是全模态基座模型,MiMo-V2-TTS是语音合成大模型。
MiMo-V2-Pro有什么特点?
MiMo-V2-Pro专为高强度Agent工作场景打造,有超1T总参数量,采用创新架构,支持1M超长上下文长度,在排行榜上位置靠前,能完成复杂任务且成本低,还能参与代码工程构建。
MiMo-V2-Omni在哪些方面表现出色?
MiMo-V2-Omni在音频理解上能进行环境声分类等,图像理解展现强大能力,视频理解支持原生音视频联合输入,能跨模态处理复杂环境。
MiMo-V2-TTS的语音风格控制有什么优势?
MiMo-V2-TTS实现高度可控的多粒度语音风格控制,能精准调节语音,自然还原韵律,还能进行高质量歌声合成,支持多种方言和风格化演绎。
如何使用这些模型?
这些模型已登陆多个平台,通过特定接入方式可限时免费体验一周。MiMo-V2-Pro和MiMo-V2-Omni已开放API服务,访问相关网址即可接入使用。
简短标题:小米推出的三款大模型都是啥?有什么作用?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化
