AI 配音从此终于可以告别生硬感和机械感了。

先问大家一个问题:假设我能在10秒钟之内“偷走”你的声音,并且不是简单录下来,而是把它变成一个随时可以调用、随时可以合成的声音模型,不但能无缝切换普通话、粤语、沪语、四川话、安徽话等21个方言,还能支持卖萌、唱歌、高兴、悲伤等基础情绪,甚至还能通过用户自定义提示词实现所谓“万能情绪”,更关键的是,它完全免费,那么你最想拿它干什么?是给自己做一个专属语音助手,还是做有声书、短视频配音、虚拟主播,或者把家人的声音留下来?没错,这就是我们今天要介绍的 xiaomi mimo TTS。


xiaomi mimo TTS 是小米在2026年3月19号推出的,支持 LLM 控制的 TTS。它的首个版本 V2 在2026年3月19日宣布免费,后续在4月3日发布的 V2.5 TTS 也进入了公测限免阶段。现在过去了将近小半年,它仍然还在免费阶段,公告里也没有具体写什么时候会开始付费。也就是说,到目前为止,大家依然可以比较低成本地去体验和接入这套能力。TTS 总共推出了三个模型,分别是 TTS、VoiceClone 和 Voicedesign。三个模型继承同一套能力,都支持切换不同的方言、使用不同的情绪,包括万能情绪,也支持流式调用。现在你可以在小米开放平台申请 API,把它填进自己的软件里,就可以直接调用了。


申请方法其实很简单,跟着我的音频一步一步来操作就可以了。首先,我们需要访问官方网站。官方网站是 https://platform.xiaomimimo.com,注意这里的顶级域名是 .com,不是 .cn。如果直接输入 .cn 的话,是访问不到这个 DNS 的,所以这一点一定要看清楚。来到主页之后,点击左上角控制台,登录你的小米账号。接着点击 API Keys,再点击新建 API Key,输入一个名字,点保存,然后复制这个 API Key,填进自己的软件里,就可以开始调用了。


这里分两种情况讲。如果你是走 HTTP 非流式,那么在 header 字段里的鉴权方式是 authorization,在 authorization 字段中应该填写自己的 API key。请求时要携带它,同时把请求的 Content-Type 设置为 application/json。服务端给你返回的音频也是 JSON,你需要用 JSON.parse 方法把里面的音频 URL 提取出来,然后发起 GET 请求拿到音频数据,就能播放了。如果你走的是 WebSocket 流式通道,那么同样需要在 headers 里面放 API key,不过发送方法有点不太一样,你需要以 message 的方式发出。角色设定上,你是 User,服务端是 Assistant。服务端在收到你的请求以后,会以流的方式把 Base64 字符串推给你。Base64 中包含音频数据,你边接收的同时,边就要用 android.util.base64.decode 方法把 Base64 解出来,然后喂给播放器播放。


如果在语音克隆状态下,你需要传一个音频的 Base64 串,或者传一个能够被公网访问的 URL,服务端会自行下载和解码。克隆成功以后,服务端会给你下发一个 JSON,里面包含你当前克隆的声音 ID,把它保存下来,下一次就能直接用了。在声音设计状态下,需要传递的附加参数是设计提示词。你可以这样写:“一位语速适中的新闻男主播,语气沉稳,专业可靠,适合播报权威性较高的正式类新闻内容。”但这里有一个问题,提示词每次请求都要传,这也就意味着每次请求都会重新设计一次声音,前次设计的声音直接作废,所以每次合成都是不一样的声音。


那今天的分享就到这里,接下来我们来看实际演示和音频教程。点击查看官方发布的演示点击查看我的音频教程

发表于:2026-09-21 13:56
12个回复
您还没有登录,登录后才可回复。 登录 注册