小米推出的三款大模型都是啥?有什么作用?

2026-03-19 21:16:00  阅读 6100 次 评论 0 条
摘要:

3月19日凌晨小米宣布推出三款大模型MiMo-V2-Pro、Omni、TTS,已登陆多平台可限时免费体验一周。MiMo-V2-Pro专为高强度Agent工作场景打造,MiMo-V2-Omni用于复杂多模态交互与执行场景,MiMo-V2-TTS是语音合成大模型。

小米推出三款大模型

面向Agent时代的旗舰基座模型

XiaomiMiMo-V2-Pro专为现实世界中高强度的Agent工作场景而打造。它拥有超过1T的总参数量,采用创新的混合注意力架构,支持1M超长上下文长度。在ArtificialAnalysis排行榜上位列全球第八、国内第二。在智能体框架中,能完成复杂工作流编排等,且模型API定价仅为其他模型的1/5。该模型针对Agent场景深度优化,在相关评测榜单上效果顶尖,还能参与严肃代码工程构建。

全模态基座模型

XiaomiMiMo-V2-Omni专为现实世界中复杂的多模态交互与执行场景而生,可无缝接入各种Agent框架。音频理解方面表现出色,能进行环境声分类等;图像理解展现强大能力;视频理解支持原生音视频联合输入。它能跨模态理解复杂环境,自主制定并执行计划,遇到异常时实时修正策略。该模型已开放API服务,还为全球开发者提供限时免费接口支持。

语音合成大模型

XiaomiMiMo-V2-TTS是小米自主研发的语音合成大模型。基于自研架构,经过大规模预训练与多维度强化学习,实现高度可控的多粒度语音风格控制。支持从整体风格到局部情绪表达的精准调节,能还原自然韵律,还能进行高质量歌声合成。训练过程分多阶段,通过超大规模预训练、少量高质量监督数据微调及多维度强化学习,让模型具备丰富多元表达能力。

模型的特点与优势

强大的性能表现

MiMo-V2-Pro拥有超1T总参数量和创新架构,支持超长上下文长度,在排行榜上位居前列,能完成复杂任务且成本低。MiMo-V2-Omni在音频、图像、视频理解方面表现卓越,超越多个知名模型,能跨模态处理复杂环境。MiMo-V2-TTS实现高度可控的语音风格控制,能精准调节语音,自然还原韵律,还能进行高质量歌声合成。

小米推出的三款大模型都是啥?有什么作用?

广泛的应用场景

MiMo-V2-Pro适用于高强度Agent工作场景,如代码工程构建、智能体框架中的复杂任务处理。MiMo-V2-Omni可用于复杂多模态交互与执行场景,如智能客服、智能家居控制等领域。MiMo-V2-TTS可应用于有声读物、语音导航、语音助手等需要语音合成的场景。

技术创新与突破

三款模型在技术上均有创新。MiMo-V2-Pro的混合注意力架构和1M上下文长度拓展了智能动作空间。MiMo-V2-Omni的创新视频预训练使其具备情境感知与未来推理能力。MiMo-V2-TTS的自研架构和多维度强化学习实现了多粒度语音风格控制。

模型的开放与使用

开放API服务

MiMo-V2-Pro和MiMo-V2-Omni已正式开放API服务。MiMo-V2-Pro支持1M上下文长度,根据使用量分段计价;MiMo-V2-Omni支持256K上下文长度。用户访问特定网址即可接入API,方便开发者将模型集成到自己的应用和服务中。

限时免费体验

目前,这些模型已经登陆Xiaomimiclaw、MiMoStudio、金山办公、小米浏览器,通过OpenClaw、OpenCode、KiloCode、Blackbox、Cline接入,可限时免费体验一周。这为开发者和用户提供了一个了解和试用模型的机会,降低了使用门槛。

与其他生态的集成

MiMoClaw模块全面打通金山WebOffice生态,原生支持四大主流格式,覆盖超95%日常文档类型。XiaomiMiMo底层推理引擎与金山办公生态实现框架级集成,WPS灵犀接入MiMo-V2-Pro模型,提升办公效率。

小米推出的三款大模型都是啥?有什么作用?

相关问答

小米推出的三款大模型分别是什么?

小米推出的三款大模型是MiMo-V2-Pro、MiMo-V2-Omni和MiMo-V2-TTS。MiMo-V2-Pro是旗舰基座模型,MiMo-V2-Omni是全模态基座模型,MiMo-V2-TTS是语音合成大模型。

MiMo-V2-Pro有什么特点?

MiMo-V2-Pro专为高强度Agent工作场景打造,有超1T总参数量,采用创新架构,支持1M超长上下文长度,在排行榜上位置靠前,能完成复杂任务且成本低,还能参与代码工程构建。

MiMo-V2-Omni在哪些方面表现出色?

MiMo-V2-Omni在音频理解上能进行环境声分类等,图像理解展现强大能力,视频理解支持原生音视频联合输入,能跨模态处理复杂环境。

MiMo-V2-TTS的语音风格控制有什么优势?

MiMo-V2-TTS实现高度可控的多粒度语音风格控制,能精准调节语音,自然还原韵律,还能进行高质量歌声合成,支持多种方言和风格化演绎。

如何使用这些模型?

这些模型已登陆多个平台,通过特定接入方式可限时免费体验一周。MiMo-V2-Pro和MiMo-V2-Omni已开放API服务,访问相关网址即可接入使用。

本文地址:https://www.caiair.com/post/xiaomi-da-moxing-mimov2pro-356680-132386.html
简短标题:小米推出的三款大模型都是啥?有什么作用?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化