元峰AI笔记 · AI数字人

微软上线 9 种更真实的 AI 语音

<title 我的 AI 数字人终于有情感了,声音不再生硬</title

我的 AI 数字人终于有情感了,声音不再生硬

图片展示了一个抽象的声波图案,背景为深色。图案由多条色彩斑斓的线条构成,线条从左向右延伸,线条间有紫色和蓝色的点状元素。线条呈现出波浪状,颜色从紫色渐变至蓝色,再过渡到黄色,最后是绿色。右侧有一个侧脸轮廓,轮廓线条与声波线条相呼应。该图片可能象征声音或数字人的情感表达,与文档中“我的AI数字人终于有情感了,声音不再生硬”的主题相契合。

本篇内容首发于 AI 破局俱乐部星球:https://t.zsxq.com/19y7e3fS5

大家好,我是元峰,累计获得过 22 颗 AI 之心,在开始分享之前,必须得聊聊最近的 AI 之心。熟悉我的都知道,自从进入破局之后,我疯狂在破局进行输出,参加各种活动,担任航海教练等,收获粉丝无数,也斩获了 22 颗 AI之心。为什么要聊这个呢?因为最近的 AI 之心不仅仅分红了,还能直接换为白花花的银子,一图胜千言。你没看错,AI 之心就是 Money!

在这里,不得不感谢洋哥,搭建了破局这么好的体系,制定了这个激励机制。也感谢所有的破局小伙伴们,每天默默为我们保驾护航。5 号那天,收到星球的推送,进入破局已经整整一年了,其实最大的感触是在破局认识了很多志同道合的伙伴们,因为能进入这里的伙伴都是有共同愿景,对 AI 有很高的热情,也都觉得在 AI 赛道能分到一杯羹。实践证明,这条路是完全走得通的,所以,我们一起加油,AI 之心卷起来!

图片展示了AI之心的动账通知界面。左侧显示用户已收款,资金存入零钱,金额为12000.00元,转账时间为2024年4月14日11:48:55,收款时间为2024年4月14日11:50:13,有“零钱通 七日年化1.80% 给小金库再添一笔”的提示及“转入”按钮。右侧是3月账单,提示查看账单,下方有“AI之心分红”字样,显示网银他行实时转入通知,转入金额为6600.00元,交易时间为2024年4月3日,有查看详情、活钱优化、开个收益等选项。

图片展示了用户在“AI破局俱乐部”的年度数据总结。界面顶部显示“Hi,很高兴在2023/4/5与你相遇,你与「AI破局俱乐部」同行365天啦”。下方白色框内列出数据:过去一年有39,104位星友一起成长,用户发布650条主题,共计51.2万字,收获60.5万阅读、11,851点赞和1,545评论。右下角有“AI破局俱乐部”二维码,可扫码与3.9万位星友一起学习。该图片与上文用户提到“5号那天,进入破局已经整整一年了”相呼应,直观呈现其一年成果。

好,我们书归正传,开卷!

最近,微软的 AI 声音克隆功能更新了,出来的 AI 声音竟然已经和真人一样了。这两天一直在做测试,下面我们先听一听效果。

然后呢,微软自己语音库的声音可以实现上面演示的效果。那是否可以克隆我们自己的声音呢?我先拿自己吃了一波螃蟹。

图片展示的是“试试你自己的声音”页面,可免费试用五种声音。页面上方有“语音列表”和“新语音”按钮,下方显示“元峰_20240415_115611”语音信息,包括发言人、口音声明、源语言等。下方有“使用采样脚本生成音频”区域,可选择输出语言、基础模型等,还展示了多条语音示例,如“当大规模震颤的水超过了自己的负荷,事情就很容易发生”等。该图片与上下文介绍的AI分身声音试用相关,直观呈现了试用界面及语音示例。

比较搞笑的是,三土兄看到这一条,竟然说**“吓我一跳,我以为还能模仿鼻塞**”。哈哈,我还以为我的 AI 数字人也感冒了呢。

微软上线 9 种更真实的 AI 语音

3月底,微软发布了 9 种全新的、超真实的语音,让你的对话场景更加丰富多彩。这些新声音特别适合那些需要真实语音互动的场合,比如聊天机器人、语音助手、游戏、在线学习、娱乐等等。

而且,微软新上的这批新上线的多语言声音,都是带着浓浓的对话风格的,覆盖了不同的主要语言。这样一来,我们就能更好地表达 91 种语言及其变体,这也体现了微软致力于打破语言障碍,推动一个更包容、更无障碍的全球通信环境的决心。

来看看我们他们新上线的 GA 语音吧:

模型名称语言国家名字
en-US-AvaMultilingualNeural英语美国Ava
en-US-AndrewMultilingualNeural英语美国Andrew
en-US-EmmaMultilingualNeural英语美国Emma
en-US-BrianMultilingualNeural英语美国Brian
De-DE-FlorianMultilingualNeural德语德国Florian
De-DE-SeraphinaMultilingualNeural德语德国Seraphina
Fr-FR-RemyMultilingualNeural法语法国Remy
Fr-FR-VivienneMultilingualNeural法语法国Vivienne
zh-CN-XiaoxiaoMultilingualNeural中文中国Xiaoxiao

最后这个 Xiaoxiao,就是我们开始的时候数字人视频中演示的音色。

这些新语音有啥特别的?

不管你是在打造一个语音聊天机器人、语音助手还是对话智能体,这些新声音都能让你们的互动更加真实、生动、吸引人。和那些通用型的语音比起来,这些专门为会话优化的语音读起来更自然、更有吸引力。而且,它们还能发出笑声、自然的停顿等,给你的 AI 对话增添几分人情味。

但我现在对这个职业的热爱还是非常的,呵呵,非常的,嗯,怎么说呢?日月可鉴的,哈哈,嗯还是希望可以把这个职业做下去或者做这个声音相关领域的工作,嗯,就是把自己的优势发挥的大一点,尽可能能用到自己擅长的东西,而不是说为了工作,为了挣钱而工作。

我们需要加的是生抽、老抽、料酒、白糖还有一点点的醋、盐,然后把它翻炒均匀就可以了。接下来就是收汁的阶段了哈,我们加入适量的水淀粉翻炒到这个鸡丁上色,而且汤汁呢,稍稍已经比较浓稠,啊不会轻易的滑落。

更多 GA 声音示例请移步微软官方博客

https://techcommunity.microsoft.com/t5/ai-azure-ai-services-blog/9-more-realistic-ai-voices-for-conversations-now-generally/ba-p/4099471

如何使用?

接下来我将带你了解如何在微软 Azure上免费获取这些声音,让你的内容制作更加引人入胜。如果新用户可以享受 12 个月的免费服务。

注册 Azure 账户

注册使用方法如下:登录:https://azure.microsoft.com/zh-cn/products/ai-services/text-to-speech

图片展示的是Azure官网页面,突出显示“文本转语音”功能,其下方有“免费试用文本转语音”和“创建新Azure账户”两个绿色按钮。该图片与文档中注册Azure账户部分内容相关,文档介绍了注册Azure账户的登录网址及后续绑卡流程,此图直观呈现了登录后可选择的“文本转语音”功能,辅助说明注册账户后可进行的相关操作。

填写信息,直接选择中国就可以。

图片展示的是注册ools addCriterion

这里注册完需要有老外的 Visa 或者 Master 信用卡。

图片展示的是创建Azure免费账户时的“通过卡进行身份验证”页面。页面提示需提供信用卡或借记卡,将临时授权,除非采用即用即定价,否则不会收费,不接受预付卡。可使用Visa或Master卡,需输入持卡人姓名、卡号、截止日期及CVV。该图片与文档中注册Azure账户部分内容相关,是注册流程中绑卡环节的展示,帮助用户了解绑卡的具体要求。

图片展示的是Azure账户注册时的付款方式界面。界面上方显示“付款方式”标题,下方有“默认付款方式”提示,说明默认付款方式为按月自动付款。中间区域显示一张MasterCard卡的图标及部分卡号,卡号以“****9033”形式呈现,到期日期为2/2026。下方有“替换”和“拆离”两个蓝色文字选项。该图片与文档中注册Azure账户时填写信息并绑定卡片的内容相关,展示了绑定卡片后的付款方式显示情况。

这里我用的是的是 WildCard,绑定卡片会扣除 0.99 美元。

图片展示的是WildCard的交易记录页面。页面显示总充值金额为20.00,总消费金额为0.99。交易记录中,2024年4月15日10:48的交易类型为消费,已支付,交易金额为$0.99,详细信息为Microsoft Store mobi.info WA US。该图片与上下文关系紧密,上下文提到使用WildCard绑定卡片会扣除0.99美元,此图直观呈现了该操作后的交易记录情况。

绑卡成功之后,根据流程一直往下走即可。

如果遇到不符合免费试用条件的,直接点 通过 即用即付 定价注册 Azure 也是可以的,里面也会有一些免费额度,比如文字转语音每月可以有 50 万字的额度,足够我们平时使用了。

神经网络声音的免费配额上限为每月 50 万个字符,每个文件限制为 3000 个字符。

图片展示的是Microsoft Azure平台的页面,显示“你不符合使用免费试用的条件”。页面下方有红色框突出显示的“通过即用即付定价注册Azure”文字,以及“联系支持人员”链接。该图片与文档中“如何使用?”部分内容相关,当遇到不符合免费试用条件时,可通过此链接进行即用即付定价注册Azure,文档中还提到文字转语音每月有50万字额度,足够日常使用。

图片展示了在Azure主页中使用Speech Studio时的提示信息。画面中有一个红色边框突出显示的提示框,内容为“你正在使用免费(F0)语音资源。神经网络声音的免费配额上限为每月50万个字符,每个文件限制为3000个字符。切换到付费50资源可享受完整功能。检查定价、查看当前使用情况指标。”箭头指向该提示框。该图片与上下文紧密相关,上下文在介绍如何使用Azure中的语音资源,此图直观呈现了当前使用的语音资源类型及配额情况。

等所有注册流程跑完就进入 Azure 主页了。

图片展示的是Azure主页界面。上方有“Microsoft Azure”标志及搜索栏,下方有“Azure服务”导航栏,包括资源管理、门户、资源组、快速入门CPU、虚拟机、共同使用服务、存储、SQL数据库、Azure Cosmos DB等选项。中间部分显示“资源”区域,有“最近”和“所有”选项,列出如MFAvatar、matcheng等语音资源及上载资源数量。导航栏下还有“工具”“实用链接”“Azure移动应用”等板块。该图与文档中介绍如何使用Azure相关资源的内容相关,展示了Azure主页的布局和资源情况。

创建新的语音资源

图片展示的是Azure主页界面。界面左上方有一个被红色框和箭头突出标识的“+ 创建资源”按钮。该图片对应文档中“创建新的语音资源”部分,说明在进入Azure主页后,可通过点击此“+ 创建资源”按钮来创建新的语音资源,是使用Speech Studio中资源的前期操作步骤之一,帮助用户明确在Azure主页上创建语音资源的入口位置。

图片展示了Microsoft Azure创建资源页面。页面左侧有类别分类,其中“AI + 机器学习”类别被红色框突出显示。右侧热门Azure服务中,“语音”服务被红色框突出显示,并有“创建 | 文档 | Microsoft Learn”的文字。该图片与上下文紧密相关,上下文在介绍如何在Azure主页创建新的语音资源,此图直观呈现了在Azure主页找到“语音”服务的路径,帮助用户快速找到创建语音资源的操作入口。

图片展示了在Microsoft Azure上创建语音服务的界面,处于“创建新的语音资源”步骤。界面中,项目详细信息部分可选择Azure订阅,资源组需新建;实例详细信息部分,区域推荐选East US,要设置名称,定价层优先选免费的Free F0。图中有五个步骤的红色数字序号标识:①先建一个资源组,②选择区域,③设置名称,④选择定价层,⑤点击创建。此图与上文创建语音资源的内容相呼应,指导具体操作步骤。

图片展示的是Microsoft Azure平台中Microsoft.CognitiveServicesSpeechServices - 20240415131926语音服务的概述页面。页面显示部署完成,部署名、订阅、资源组等信息,资源为MVoice。下方有“转到资源”按钮,以及“提供反馈”提示。该图片与文档中“开始使用Speech Studio中的资源”部分相关,用于说明在Azure主页完成语音资源部署后的页面展示情况。

开始使用 Speech Studio 中的资源

图片展示的是Microsoft Azure页面中“MPVoice”相关界面。画面中红框突出显示“开始使用Speech Studio中的资源”部分,其下有说明文字“试用所有神经网络和基于经典AI 模型的配音工具” ,并有蓝色的“启动Speech Studio”按钮。该图片与文档中“开始使用Speech Studio中的资源”上下文对应,直观呈现了文档中提及的在Azure主页上开始使用相关语音资源的操作入口界面。

Azure Speech Studio 介绍

Azure 语音工作室是微软 Azure 认知服务大家庭的一员,它提供了一系列 AI 驱动的语音服务,帮你处理、理解和生成人类的语音。这个云端平台提供了语音转文字、文字转语音、语音翻译和说话人识别等工具,是打造需要自然语言交互应用的得力助手。

语音转文字:这个功能能实时把咱们说的话变成文字,支持好多种语言和地方口音。对于应用里的语音识别、实时字幕和语音指令等功能,它可是大有用处。

语音翻译:Azure 语音工作室还能实时翻译语音,打破了语言沟通的障碍。它支持多种语言,对于那些需要实时翻译功能的应用来说,简直是利器。

图片展示了Azure Speech Studio的语音转文本相关功能。画面中有六个功能模块,分别为实时语音转文本、Azure OpenAI服务中的Whisper模型、批处理语音转文本、自定义语音识别、语音转换为文本的发音评估以及语音翻译。每个模块都有图标和简短说明,如实时语音转文本可在自己的端点上测试实时听写功能等。这些功能体现了Azure Speech Studio在语音转文本领域的多样化与实用性,与上下文介绍的文字转语音等服务共同展现了其语音处理能力。

文字转语音:这个服务用上了深度神经网络技术,能把文字变成各种语言的自然语音。开发者可以从多种声音中进行选择,并自定义语音模式以满足其应用程序的需求,从而提高用户参与度。

图片展示了Azure Speech Studio的文本转语音服务内容。分为“语音库”“定制声音”“个人语音”“有声内容创作”四个板块,分别对应使用语音库选择声音、使用自己的声音定制、从人类中转生成AI声音、通过内容创作声音。最下方是“文本转语音找形象”板块,可使用文本生成虚拟形象。图片与上下文紧密相关,直观呈现了文档中介绍的文本转语音服务功能。

语音库

使用类似人类的语音浏览富有表现力的声音,为你的项目找到完美的说话人。

语言库中包含全球众多国家中 150 种语言,有490 多个不同的声音可以选择。

图片展示的是Azure Speech Studio的语音库界面。界面上方有搜索框,可按语言、音色、语速等筛选语音。左侧是不同语音的列表,如晓晓多语言、云希等,每种语音有简要介绍。右侧是晓晓多语言的详细信息,包括音色、语速、语调、情感等可自定义选项,还设有试听按钮。该图片与上下文介绍的语音库功能相契合,直观呈现了语音库中语音的展示形式及可操作性。

这个晓晓多语言 即为今天的主角,支持全球 90 多种语言。

图片展示了Azure Speech Studio语音库界面。界面上方有版本等信息,下方是声音目录等板块。在声音目录搜索框中输入“xiaoxiao”后,显示“晓晓多语言”语音选项,其为中文(普通话,简体),有超90种语言支持,被红色框重点标出。界面还呈现了其他语音选项以及语音详细信息、试听、示例代码等功能按钮。该图片与上文介绍语音库中包含众多语言及声音,且“晓晓多语言”是主角的内容相呼应,直观呈现了其在语音库中的位置及相关信息。

图片展示的是Azure Speech Studio中语音库的相关内容。画面中有“晓晓多语言”等语音库选项,其中“晓晓多语言”被红色箭头指向,其下方有“转至有声内容创作”按钮。该图片与上下文紧密相关,上下文介绍了Azure Speech Studio的文字转语音服务,使用深度神经网络技术,可选择多种声音并自定义语音模式,此图直观呈现了“晓晓多语言”语音库及转至有声内容创作的操作入口。

有声内容创作

通过调整讲话内容的说话风格、节奏和发音,打造细致入微的语音。

然后点击 【转至有声内容创作】,即可自定义要讲的内容。

xiaoxiao

我们用下面一段文案做个测试。

Hello,大家好呀!我是由元峰派来进行测试这个微软最新AI声音功能的。呵呵,非常的,嗯,怎么说呢?我认为我自己还是很牛的,首先,我们来说点英语,看看这个系统能不能理解我的意图。Hello everyone, how are you today? 希望大家都有一个美好的一天! 哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi! 再给你们来个粤语玩玩吧! 现在,我们来点韩语,看看这个AI能跟上节奏不。안녕하세요 여러분, 잘 지내세요? 最后,假装生气地说:这个AI到底行不行啊,快给我一个满意的回答!

图片展示的是Azure Speech Studio的界面,左侧为文件管理区域,显示“所有文件”选项。右侧是音频内容创作界面,上方有“官方声音测试”标题,下方有音频播放按钮及SSML选项。画面中呈现了多条对话内容,如“Hello, everyone, how are you today? I hope that you have a beautiful day!”等。右侧还有语言、标点、静音等设置选项,以及“高级”“自定义”等标签。该图片与上下文介绍的有声内容创作相关,展示了在Azure Speech Studio中生成音频文件的界面情况。

这是生成的音频文件,听听看吧。

俗话说没有对比就没有伤害哈,接下来我们看看以前的【晓晓】表现力如何?

还是拿前面这段文案来测试。我们一句一句来听。

Hello,大家好呀!我是由元峰派来进行测试这个微软最新AI声音功能的。呵呵,非常的,嗯,怎么说呢?我认为我自己还是很牛的,首先,我们来说点英语,看看这个系统能不能理解我的意图。Hello everyone, how are you today? 希望大家都有一个美好的一天!

对比下来旧晓晓的声音就很平淡,**呵呵,嗯,**这些语气词都是直接念出来的,不像新晓晓就是模仿人一样说出来的。 另外,旧晓晓说英文就很生硬,好像不会讲英文的人一样。新晓晓讲的时候就是地地道道的以英语为母语的一样,非常流程自然。

哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi!

这一句我用了 哈哈哈 来做测试,毫无疑问,新晓晓就真正的感觉像很开心的说哈哈哈一样,语气也比较到位。后面的法语更是不在话下,张口就来。但是,旧晓晓就显得有点窘迫,只能念单词。像不像初中刚开始学英文的你?

再给你们来个粤语玩玩吧!

这句新晓晓在讲玩玩吧的时候,把那种疑问的语气也讲出来了。又是吊打旧晓晓。

<粤语>现在,我们来点韩语,看看这个AI能跟上节奏不。안녕하세요 여러분, 잘 지내세요?

这里我测试了一下某一句中使用两种语言,前半句我用的是粤语,后面是韩语。 其实这一句不是旧晓晓讲的,因为旧晓晓不会粤语,是还为了一个叫 XiaoMin 声音发出的,而且,旧晓晓是不会讲韩语的,直接选择罢工不干。 当然,这一切肯定难不倒新晓晓的,信手拈来。

最后,假装生气地说:这个AI到底行不行啊,快给我一个满意的回答!

最后测试了一下语调,一般来说,生气的时候语调都是非常重的。这里我把后半句“这个AI到底行不行啊,快给我一个满意的回答!”语气加重测试了一下。 非常搞笑的是,虽然语气加重了,但实际效果听起来像萌妹子生气,根本生气不起来一样。

SSML

这里不得不提的一个功能就是 SSML,可以让我们的语音文本更加有情感。

图片展示的是Azure Speech Studio的界面,突出显示了SSML开关。界面中呈现了语音合成测试内容,包括不同语种的语音指令及情感表达,如“你好,大家好啊,我是由我系统自动生成的这个微软智能AI声音功能的”等。该图片与上下文紧密相关,上下文在介绍SSML格式时提到其用于控制和定制文本转语音系统的输出,此图直观呈现了SSML在实际语音合成中的应用效果。

那么问题来了,什么是 SSML 格式?

SSML(Speech Synthesis Markup Language)格式是一种基于 XML 的标记语言,专门用于控制和定制文本转语音(TTS)系统的输出。它允许用户精确地指定语音合成的各种方面,包括发音、音调、音量、语速、停顿等。通过 SSML,用户可以让合成语音更加自然、表情丰富,并能够适应特定的语境和应用需求。SSML 格式常用于开发高度个性化的语音应用,如虚拟助手、自动语音响应系统、有声读物等。

SSML 案例视频

我们看下今天我们测试这段内容的 SSML 格式是什么样的。

Hello,大家好呀!我是由元峰派来进行测试这个微软最新AI声音功能的。呵呵,非常的,嗯,怎么说呢?我认为我自己还是很牛的,首先,我们来说点英语,看看这个系统能不能理解我的意图。Hello everyone, how are you today? 希望大家都有一个美好的一天!

哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi!

再给你们来个粤语玩玩吧!

现在,我们来点韩语,看看这个AI能跟上节奏不。안녕하세요 여러분, 잘 지내세요?

最后,假装生气地说这个AI到底行不行啊,快给我一个满意的回答!

下面是这段 SSML 的详细解释:

  1. 版本和命名空间定义:这行定义了使用的SSML版本,相关的命名空间,以及默认的语言设置(简体中文)。

    <speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="http://www.w3.org/2001/mstts" xmlns:emo="http://www.w3.org/2009/10/emotionml" xml:lang="zh-CN">
    
  2. 语音选择:指定使用的语音模型为“Xiaoxiao”,是微软的多语言神经网络语音模型,适用于中文。

    <voice name="zh-CN-XiaoxiaoMultilingualNeural">
    
  3. 语速调整:在这一段中,prosody 标签用于调整语速(这里稍微加快了10%),rate 属性用来控制语速。

    <prosody rate="+10.00%">Hello,大家好呀!...</prosody>
    

图片展示了Azure Speech Studio中语速调整的操作界面。界面中有“语速”选项,下方分为“相对值”和“常量值”两个标签,当前选中“相对值”。通过滑动条可调整语速,右侧文本框显示为“x 1.1”,即语速加快至原来的1.1倍(加快了10%),右侧还有一个确认按钮。此图片与文档中“语速调整”部分的内容相对应,直观呈现了使用prosody标签中rate属性控制语速的操作方式。

  1. 多语言内容和情感表达:SSML支持多种语言混合。此段中未显示使用lang标签指定语言,但可以通过上下文或声音模型识别。

    哈哈哈,接下来,我们用点法语加入测试吧。Comment ça va? J'espère que vous profitez de votre journée autant que moi!
    
  2. 音量调整:使用prosody标签调整音量到非常大声。

    <prosody volume="x-loud">再给你们来个粤语玩玩吧!</prosody>
    

图片展示了Azure Speech Studio中“音量”设置界面。左侧有“音量”选项,右侧有“相对值”和“常量值”两个标签,当前选中“常量值”。下方有一个下拉框,显示“超大声”选项。该图片与文档中“音量调整”部分内容相关,用于说明使用prosody标签调整音量到非常大声的操作,直观呈现了音量设置界面及“超大声”选项。

  1. 语言切换:这里使用lang标签切换到香港中文,其实这里我们选择的是粤语,然后介绍了韩语内容。

    <lang xml:lang="zh-HK">现在,我们来点韩语,看看这个AI能跟上节奏不。</lang>
    

图片展示了Azure Speech Studio中语言设置界面。画面中“语言”下拉菜单被红色框线突出显示,当前选中“中文(普通话,简体)”。下方有多个数字人头像,其中“晓晓 多语言”头像被红色框线圈出,其下方“语言技能”下拉菜单被红色框线框住,显示“中文(粤语,繁体)”。该图片与上下文介绍的“语言切换”内容相关,直观呈现了语言切换的操作位置及当前选择的粤语繁体语言。

  1. 音高和音调调整:在这里,通过调整pitch属性来模拟情绪(假装生气)。contour属性用来定义具体的音高变化轨迹,创造更多的情感表达。

    <prosody pitch="high">:</prosody>
    <prosody pitch="x-high" contour="(39%, +71%) (60%, +94%) (81%, +90%)">这个AI到底行不行啊</prosody>
    <prosody pitch="x-high">,快给我一个满意的回答!</prosody>
    

    图片展示了Azure Speech Studio中“音高”属性设置界面。界面中有“相对值”和“常量值”两个选项卡,当前选中“常量值”。下方有一个下拉菜单,显示“超高”选项。该图片与上下文紧密相关,上下文提到“contour”属性用来定义具体的音高变化轨迹,创造更多的情感表达,此图直观呈现了在Azure Speech Studio中设置音高常量值的操作界面,帮助理解如何通过SSML增强文本到语音转换的自然性和表现力。

图片展示了Azure Speech Studio中“编辑语调”界面。界面中有“编辑1”选项,下方有“原始”和“调整”两个选项卡,当前选中“调整”。画面中有一个蓝色的折线图,图上有“这个”“AI”“到底”“行”“不行”“啊”等词对应的点,下方有“语调”数值显示为“39% 71% 68% 94% 61% 90%”。画面右侧有“静音”“添加静默类型”“音高”“词典”“语调”“语速”“音量”“音商”等选项,其中“语调”选项被红圈突出显示。该图与上下文介绍的Azure Speech Studio中使用SSML调整语调的内容相关。

所以,为了使得 AI 声音讲出的内容更符合我们的语言习惯,以及准确表现出我们想要表达的情感,可以使用SSML来增强文本到语音转换的自然性和表现力,通过调整语速、音量、音调和使用多语言内容来丰富听觉体验。

本次微软更新了 9 个声音,我们再拿一个老外的声音让他说中文听听表现如何。

AvaMultilingual

图片展示的是Azure AI中的Speech Studio界面,用于有声内容创作。画面中突出显示了“声音”设置窗口,可选择“AvaMultilingual”声音,其描述为“明亮、有活力的声音,音调优美,非常适合播放搜索结果”。界面左侧有“所有文件”等导航栏,右侧有“声音”“角色”“角色组”等设置选项。该图片与上下文介绍的AvaMultilingual声音相关,直观呈现了其在Speech Studio中的设置界面及声音信息。

反而,听这个外国声音讲中文却有点中规中矩的感觉,不像一个真正的老外讲中文的那种感觉。

图片展示的是Azure Speech Studio的界面,左侧为聊天窗口,显示了“TEXT TO SPEECH”和“SPEECH TO TEXT”选项,以及一段中英文对话内容。右侧是“SPEECH TO SPEECH”设置区域,显示模型为ElevenMultilingual v2,可生成29种语言的语音,稳定性、相似度、风格夸张度等参数可调节,还有“Speaker boost”开关。该图片与文档中介绍的有声内容创作相关,展示了使用Azure Speech Studio进行语音合成的界面情况。

然后,我又使用 Elebenlabs 克隆了 Ava 的声音,这发音,才是熟悉的老外讲中文的味道。

我们听下 AvaMultilingual 讲本土英文的案例。

Hmm, I'm not sure what to wear to the party tonight. I want to look nice, but I also want to be comfortable. Maybe I’ll wear my new dress and heels. Oh no, but what if my feet start hurting after a while? Maybe I should bring a pair of flats just in case.

嗯,我不知道今晚穿什么去参加聚会。我想要看起来漂亮,但我也想要舒服。也许我会穿我的新衣服和高跟鞋。哦不,但是如果我的脚在一段时间后开始疼痛怎么办?也许我应该带一双平底鞋以防万一。

正常讲英文方面,微软自己的声音和 Elevenlabs 克隆的效果都差不多,听不出来太大的差别。

In the garden of life, every rose has its dawn,

生命花园里,每一朵玫瑰都有黎明,

Petals strewn on the paths we've drawn.

花瓣散落在我们所画的道路上。

Thorns may prick, under the sun's keen light,

在阳光的强烈照耀下,荆棘可能会刺痛,

Yet, blooms stand proud, amidst the plight.

然而,在困境中,花朵依然傲然挺立。

在讲诗歌方面微软声音还是很有感情的,直接用 Elevenlabs 克隆的声音就感觉语气有点重。

所以,如果要用到纯英文讲文本,可以选择微软的这些声音,情绪表达更完美。但是如果要用到外国人讲中文的内容,就选择 Elevenlabs 进行克隆,声音更有感染力,听起来也更舒服一些。

个人语音/声音克隆

从人声示例轻松创建 AI 语音,为用户提供 100 种语言的个性化语音体验。 即我们平时常用的声音克隆。

那么除了官方的音频库,我们能不能克隆自己的声音,也实现这样的效果呢?

使用声音克隆功能体验,非常简单。只需要录下自己的声音,只需几秒钟即可创建 AI 分身。目前测试的每个标准语音资源最多可以免费试用 5 种声音。

图片展示的是Azure Speech Studio中“试试你自己的声音”界面。左侧有“个人语音/声音克隆”选项,下方提示可录制语音创建AI分身,每个标准语音资源最多可免费试用5种声音。右侧是录制界面,有“新语言”输入框,下方是录制区域,显示“我元峰确认我的声音将会被格特拉使用于创建合成版本语音”字样,下方有“重试”按钮和进度条。该图片与上下文介绍的使用声音克隆功能体验内容相关,直观呈现了操作界面。

我就读了上面的一段话“我元峰确认我的声音将会被格特拉使用于创建合成版本语音。”,就可以读出下面这些文案。

图片展示的是Azure Speech Studio中“试试你自己的声音”页面。页面上方有“试试你自己的声音”标题及说明,下方有语音列表,当前选中“元峰_20240415_115611”。详细信息部分显示该语音的创建人为元峰,基础模型为DragonLatestNeural,语音类型为中文普通话(简体)。下方有使用采样脚本生成音频的示例文本,包括“当大坝里面灌的水超过了自己的负荷,溃坝就很容易发生”等,每个示例文本右侧有下载图标。

目前有 DragonLatestNeural,PhoenixLatestNeural,PhoenixV2Neural 三个模型可以选择。

图片展示的是Azure Speech Studio中“基础模型”设置界面。在“基础模型”下拉菜单中,有“DragonLatestNeural”“phoenixLatestNeural”“PhoenixV2Neural”三个选项,其中“PhoenixV2Neural”被蓝色框线突出显示。该图片与文档中介绍Azure Speech Studio中个人语音/声音克隆功能的内容相关,直观呈现了基础模型的选择界面,帮助用户了解模型选项。

DragonLatestNeural 模型

听了这些声音 Demo,虽然比不上新晓晓音色那么完美,但其在情感色彩的表达上已经有点感觉了。但目前我们普通人还无法自定义去使用这个克隆功能,所以还得等一等,后面完全开放了再使用。

而且官方也说了,若要将此服务用于商用个人是没法使用的,只有企业用户可以点击此链接申请 API 权限之后才可以。

https://customervoice.microsoft.com/Pages/ResponsePage.aspx?id=v4j5cvGGr0GRqy180BHbR7en2Ais5pxKtso_Pz4b1_xURFZNMk5NQzVHNFNQVzJIWDVWTDZVVVEzMSQlQCN0PWcu

图片展示的是Azure AI的“Custom Neural Voice and Custom Avatar Limited Access Review”页面。页面上方有“申请有限访问权限”按钮,下方说明提交注册表单后,将审核申请并在1 - 2个工作日内回复,部分申请可能需要更长时间。页面还详细列出了申请表单的使用说明,包括需填写的个人信息、申请目的、使用场景等,强调所有案例都需注册,且无需提交语音或图像文件。该图片与文档中介绍Azure AI个人语音/声音克隆服务申请权限的内容相关,是对申请流程的说明。

总结

总而言之,微软的 AI 声音克隆技术不仅展现了人工智能在语音领域的强大潜力,也为我们的生活和工作带来了极大的便利和乐趣。随着技术的不断进步和应用的不断拓展,我们有理由相信,未来的语音交互将会变得更加智能、自然和人性化。让我们拭目以待,拥抱这个充满无限可能的 AI 时代!