
本篇内容首发于 AI 破局俱乐部星球:https://t.zsxq.com/19y7e3fS5
大家好,我是元峰,累计获得过 22 颗 AI 之心,在开始分享之前,必须得聊聊最近的 AI 之心。熟悉我的都知道,自从进入破局之后,我疯狂在破局进行输出,参加各种活动,担任航海教练等,收获粉丝无数,也斩获了 22 颗 AI之心。为什么要聊这个呢?因为最近的 AI 之心不仅仅分红了,还能直接换为白花花的银子,一图胜千言。你没看错,AI 之心就是 Money!
在这里,不得不感谢洋哥,搭建了破局这么好的体系,制定了这个激励机制。也感谢所有的破局小伙伴们,每天默默为我们保驾护航。5 号那天,收到星球的推送,进入破局已经整整一年了,其实最大的感触是在破局认识了很多志同道合的伙伴们,因为能进入这里的伙伴都是有共同愿景,对 AI 有很高的热情,也都觉得在 AI 赛道能分到一杯羹。实践证明,这条路是完全走得通的,所以,我们一起加油,AI 之心卷起来!


好,我们书归正传,开卷!
最近,微软的 AI 声音克隆功能更新了,出来的 AI 声音竟然已经和真人一样了。这两天一直在做测试,下面我们先听一听效果。
然后呢,微软自己语音库的声音可以实现上面演示的效果。那是否可以克隆我们自己的声音呢?我先拿自己吃了一波螃蟹。

比较搞笑的是,三土兄看到这一条,竟然说**“吓我一跳,我以为还能模仿鼻塞**”。哈哈,我还以为我的 AI 数字人也感冒了呢。
微软上线 9 种更真实的 AI 语音
3月底,微软发布了 9 种全新的、超真实的语音,让你的对话场景更加丰富多彩。这些新声音特别适合那些需要真实语音互动的场合,比如聊天机器人、语音助手、游戏、在线学习、娱乐等等。
而且,微软新上的这批新上线的多语言声音,都是带着浓浓的对话风格的,覆盖了不同的主要语言。这样一来,我们就能更好地表达 91 种语言及其变体,这也体现了微软致力于打破语言障碍,推动一个更包容、更无障碍的全球通信环境的决心。
来看看我们他们新上线的 GA 语音吧:
| 模型名称 | 语言 | 国家 | 名字 |
|---|---|---|---|
| en-US-AvaMultilingualNeural | 英语 | 美国 | Ava |
| en-US-AndrewMultilingualNeural | 英语 | 美国 | Andrew |
| en-US-EmmaMultilingualNeural | 英语 | 美国 | Emma |
| en-US-BrianMultilingualNeural | 英语 | 美国 | Brian |
| De-DE-FlorianMultilingualNeural | 德语 | 德国 | Florian |
| De-DE-SeraphinaMultilingualNeural | 德语 | 德国 | Seraphina |
| Fr-FR-RemyMultilingualNeural | 法语 | 法国 | Remy |
| Fr-FR-VivienneMultilingualNeural | 法语 | 法国 | Vivienne |
| zh-CN-XiaoxiaoMultilingualNeural | 中文 | 中国 | Xiaoxiao |
最后这个 Xiaoxiao,就是我们开始的时候数字人视频中演示的音色。
这些新语音有啥特别的?
不管你是在打造一个语音聊天机器人、语音助手还是对话智能体,这些新声音都能让你们的互动更加真实、生动、吸引人。和那些通用型的语音比起来,这些专门为会话优化的语音读起来更自然、更有吸引力。而且,它们还能发出笑声、自然的停顿等,给你的 AI 对话增添几分人情味。
但我现在对这个职业的热爱还是非常的,呵呵,非常的,嗯,怎么说呢?日月可鉴的,哈哈,嗯还是希望可以把这个职业做下去或者做这个声音相关领域的工作,嗯,就是把自己的优势发挥的大一点,尽可能能用到自己擅长的东西,而不是说为了工作,为了挣钱而工作。
我们需要加的是生抽、老抽、料酒、白糖还有一点点的醋、盐,然后把它翻炒均匀就可以了。接下来就是收汁的阶段了哈,我们加入适量的水淀粉翻炒到这个鸡丁上色,而且汤汁呢,稍稍已经比较浓稠,啊不会轻易的滑落。
更多 GA 声音示例请移步微软官方博客
如何使用?
接下来我将带你了解如何在微软 Azure上免费获取这些声音,让你的内容制作更加引人入胜。如果新用户可以享受 12 个月的免费服务。
注册 Azure 账户
注册使用方法如下:登录:https://azure.microsoft.com/zh-cn/products/ai-services/text-to-speech

填写信息,直接选择中国就可以。

这里注册完需要有老外的 Visa 或者 Master 信用卡。


这里我用的是的是 WildCard,绑定卡片会扣除 0.99 美元。

绑卡成功之后,根据流程一直往下走即可。
如果遇到不符合免费试用条件的,直接点 通过 即用即付 定价注册 Azure 也是可以的,里面也会有一些免费额度,比如文字转语音每月可以有 50 万字的额度,足够我们平时使用了。
神经网络声音的免费配额上限为每月 50 万个字符,每个文件限制为 3000 个字符。


等所有注册流程跑完就进入 Azure 主页了。

创建新的语音资源




开始使用 Speech Studio 中的资源

Azure Speech Studio 介绍
Azure 语音工作室是微软 Azure 认知服务大家庭的一员,它提供了一系列 AI 驱动的语音服务,帮你处理、理解和生成人类的语音。这个云端平台提供了语音转文字、文字转语音、语音翻译和说话人识别等工具,是打造需要自然语言交互应用的得力助手。
语音转文字:这个功能能实时把咱们说的话变成文字,支持好多种语言和地方口音。对于应用里的语音识别、实时字幕和语音指令等功能,它可是大有用处。
语音翻译:Azure 语音工作室还能实时翻译语音,打破了语言沟通的障碍。它支持多种语言,对于那些需要实时翻译功能的应用来说,简直是利器。

文字转语音:这个服务用上了深度神经网络技术,能把文字变成各种语言的自然语音。开发者可以从多种声音中进行选择,并自定义语音模式以满足其应用程序的需求,从而提高用户参与度。

语音库
使用类似人类的语音浏览富有表现力的声音,为你的项目找到完美的说话人。
语言库中包含全球众多国家中 150 种语言,有490 多个不同的声音可以选择。

这个晓晓多语言 即为今天的主角,支持全球 90 多种语言。


有声内容创作
通过调整讲话内容的说话风格、节奏和发音,打造细致入微的语音。
然后点击 【转至有声内容创作】,即可自定义要讲的内容。
xiaoxiao
我们用下面一段文案做个测试。
Hello,大家好呀!我是由元峰派来进行测试这个微软最新AI声音功能的。呵呵,非常的,嗯,怎么说呢?我认为我自己还是很牛的,首先,我们来说点英语,看看这个系统能不能理解我的意图。Hello everyone, how are you today? 希望大家都有一个美好的一天! 哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi! 再给你们来个粤语玩玩吧! 现在,我们来点韩语,看看这个AI能跟上节奏不。안녕하세요 여러분, 잘 지내세요? 最后,假装生气地说:这个AI到底行不行啊,快给我一个满意的回答!

这是生成的音频文件,听听看吧。
俗话说没有对比就没有伤害哈,接下来我们看看以前的【晓晓】表现力如何?
还是拿前面这段文案来测试。我们一句一句来听。
Hello,大家好呀!我是由元峰派来进行测试这个微软最新AI声音功能的。呵呵,非常的,嗯,怎么说呢?我认为我自己还是很牛的,首先,我们来说点英语,看看这个系统能不能理解我的意图。Hello everyone, how are you today? 希望大家都有一个美好的一天!
对比下来旧晓晓的声音就很平淡,**呵呵,嗯,**这些语气词都是直接念出来的,不像新晓晓就是模仿人一样说出来的。 另外,旧晓晓说英文就很生硬,好像不会讲英文的人一样。新晓晓讲的时候就是地地道道的以英语为母语的一样,非常流程自然。
哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi!
这一句我用了 哈哈哈 来做测试,毫无疑问,新晓晓就真正的感觉像很开心的说哈哈哈一样,语气也比较到位。后面的法语更是不在话下,张口就来。但是,旧晓晓就显得有点窘迫,只能念单词。像不像初中刚开始学英文的你?
再给你们来个粤语玩玩吧!
这句新晓晓在讲玩玩吧的时候,把那种疑问的语气也讲出来了。又是吊打旧晓晓。
<粤语>现在,我们来点韩语,看看这个AI能跟上节奏不。안녕하세요 여러분, 잘 지내세요?
这里我测试了一下某一句中使用两种语言,前半句我用的是粤语,后面是韩语。 其实这一句不是旧晓晓讲的,因为旧晓晓不会粤语,是还为了一个叫 XiaoMin 声音发出的,而且,旧晓晓是不会讲韩语的,直接选择罢工不干。 当然,这一切肯定难不倒新晓晓的,信手拈来。
最后,假装生气地说:这个AI到底行不行啊,快给我一个满意的回答!
最后测试了一下语调,一般来说,生气的时候语调都是非常重的。这里我把后半句“这个AI到底行不行啊,快给我一个满意的回答!”语气加重测试了一下。 非常搞笑的是,虽然语气加重了,但实际效果听起来像萌妹子生气,根本生气不起来一样。
SSML
这里不得不提的一个功能就是 SSML,可以让我们的语音文本更加有情感。

那么问题来了,什么是 SSML 格式?
SSML(Speech Synthesis Markup Language)格式是一种基于 XML 的标记语言,专门用于控制和定制文本转语音(TTS)系统的输出。它允许用户精确地指定语音合成的各种方面,包括发音、音调、音量、语速、停顿等。通过 SSML,用户可以让合成语音更加自然、表情丰富,并能够适应特定的语境和应用需求。SSML 格式常用于开发高度个性化的语音应用,如虚拟助手、自动语音响应系统、有声读物等。
SSML 案例视频
我们看下今天我们测试这段内容的 SSML 格式是什么样的。
Hello,大家好呀!我是由元峰派来进行测试这个微软最新AI声音功能的。呵呵,非常的,嗯,怎么说呢?我认为我自己还是很牛的,首先,我们来说点英语,看看这个系统能不能理解我的意图。Hello everyone, how are you today? 希望大家都有一个美好的一天!
哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi!
再给你们来个粤语玩玩吧!
现在,我们来点韩语,看看这个AI能跟上节奏不。 안녕하세요 여러분, 잘 지내세요?
最后,假装生气地说 : 这个AI到底行不行啊 ,快给我一个满意的回答!
下面是这段 SSML 的详细解释:
-
版本和命名空间定义:这行定义了使用的SSML版本,相关的命名空间,以及默认的语言设置(简体中文)。
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="http://www.w3.org/2001/mstts" xmlns:emo="http://www.w3.org/2009/10/emotionml" xml:lang="zh-CN"> -
语音选择:指定使用的语音模型为“Xiaoxiao”,是微软的多语言神经网络语音模型,适用于中文。
<voice name="zh-CN-XiaoxiaoMultilingualNeural"> -
语速调整:在这一段中,
prosody标签用于调整语速(这里稍微加快了10%),rate属性用来控制语速。<prosody rate="+10.00%">Hello,大家好呀!...</prosody>

-
多语言内容和情感表达:SSML支持多种语言混合。此段中未显示使用
lang标签指定语言,但可以通过上下文或声音模型识别。哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi! -
音量调整:使用
prosody标签调整音量到非常大声。<prosody volume="x-loud">再给你们来个粤语玩玩吧!</prosody>

-
语言切换:这里使用
lang标签切换到香港中文,其实这里我们选择的是粤语,然后介绍了韩语内容。<lang xml:lang="zh-HK">现在,我们来点韩语,看看这个AI能跟上节奏不。</lang>

-
音高和音调调整:在这里,通过调整
pitch属性来模拟情绪(假装生气)。contour属性用来定义具体的音高变化轨迹,创造更多的情感表达。<prosody pitch="high">:</prosody> <prosody pitch="x-high" contour="(39%, +71%) (60%, +94%) (81%, +90%)">这个AI到底行不行啊</prosody> <prosody pitch="x-high">,快给我一个满意的回答!</prosody>

所以,为了使得 AI 声音讲出的内容更符合我们的语言习惯,以及准确表现出我们想要表达的情感,可以使用SSML来增强文本到语音转换的自然性和表现力,通过调整语速、音量、音调和使用多语言内容来丰富听觉体验。
本次微软更新了 9 个声音,我们再拿一个老外的声音让他说中文听听表现如何。
AvaMultilingual

反而,听这个外国声音讲中文却有点中规中矩的感觉,不像一个真正的老外讲中文的那种感觉。

然后,我又使用 Elebenlabs 克隆了 Ava 的声音,这发音,才是熟悉的老外讲中文的味道。
我们听下 AvaMultilingual 讲本土英文的案例。
Hmm, I'm not sure what to wear to the party tonight. I want to look nice, but I also want to be comfortable. Maybe I’ll wear my new dress and heels. Oh no, but what if my feet start hurting after a while? Maybe I should bring a pair of flats just in case.
嗯,我不知道今晚穿什么去参加聚会。我想要看起来漂亮,但我也想要舒服。也许我会穿我的新衣服和高跟鞋。哦不,但是如果我的脚在一段时间后开始疼痛怎么办?也许我应该带一双平底鞋以防万一。
正常讲英文方面,微软自己的声音和 Elevenlabs 克隆的效果都差不多,听不出来太大的差别。
In the garden of life, every rose has its dawn,
生命花园里,每一朵玫瑰都有黎明,
Petals strewn on the paths we've drawn.
花瓣散落在我们所画的道路上。
Thorns may prick, under the sun's keen light,
在阳光的强烈照耀下,荆棘可能会刺痛,
Yet, blooms stand proud, amidst the plight.
然而,在困境中,花朵依然傲然挺立。
在讲诗歌方面微软声音还是很有感情的,直接用 Elevenlabs 克隆的声音就感觉语气有点重。
所以,如果要用到纯英文讲文本,可以选择微软的这些声音,情绪表达更完美。但是如果要用到外国人讲中文的内容,就选择 Elevenlabs 进行克隆,声音更有感染力,听起来也更舒服一些。
个人语音/声音克隆
从人声示例轻松创建 AI 语音,为用户提供 100 种语言的个性化语音体验。 即我们平时常用的声音克隆。
那么除了官方的音频库,我们能不能克隆自己的声音,也实现这样的效果呢?
使用声音克隆功能体验,非常简单。只需要录下自己的声音,只需几秒钟即可创建 AI 分身。目前测试的每个标准语音资源最多可以免费试用 5 种声音。

我就读了上面的一段话“我元峰确认我的声音将会被格特拉使用于创建合成版本语音。”,就可以读出下面这些文案。

目前有 DragonLatestNeural,PhoenixLatestNeural,PhoenixV2Neural 三个模型可以选择。

DragonLatestNeural 模型
听了这些声音 Demo,虽然比不上新晓晓音色那么完美,但其在情感色彩的表达上已经有点感觉了。但目前我们普通人还无法自定义去使用这个克隆功能,所以还得等一等,后面完全开放了再使用。
而且官方也说了,若要将此服务用于商用个人是没法使用的,只有企业用户可以点击此链接申请 API 权限之后才可以。

总结
总而言之,微软的 AI 声音克隆技术不仅展现了人工智能在语音领域的强大潜力,也为我们的生活和工作带来了极大的便利和乐趣。随着技术的不断进步和应用的不断拓展,我们有理由相信,未来的语音交互将会变得更加智能、自然和人性化。让我们拭目以待,拥抱这个充满无限可能的 AI 时代!