微软TTS最新模型,发布9种更真实的AI语音

news2024/11/28 0:31:08

很高兴与大家分享 Azure AI 语音翻译产品套件的两个重大更新:

视频翻译和增强的实时语音翻译 API。

视频翻译(批量)

今天,我们宣布推出视频翻译预览版,这是一项突破性的服务,旨在改变企业本地化视频内容的方式。随着全球市场对可访问且引人入胜的视频内容的需求不断增长,视频翻译提供了一种无缝解决方案来克服语言障碍。此次发布包括 Azure Speech,客户可以使用自己的视频资产进行试用,并具有以下交钥匙功能:

  • 对话提取和翻译字幕生成
  • GPT 重新表述,提高了翻译质量并实现了自动时间对齐
  • 预建神经语音,可进行内容编辑,以便手动进行精确对齐和翻译偏好设置
  • 使用个人语音功能(有有限的访问限制)

相应的视频翻译API也即将推出,可以先联系马上获得API早期访问权。视频翻译的客户场景

视频翻译通过授权的视频内容为广泛的商业场景释放商业价值,例如:

  • 电视节目、电影和纪录片:电影制片厂和制作公司可以翻译电影和电视节目以进行国际发行,从而覆盖更广泛的观众并最大限度地提高收入潜力。
  • 教育培训材料视频:教育机构和/或培训项目可以翻译和配音学习视频材料,为全球观众提供准确及时的信息。
  • 广告和营销视频:企业可以本地化他们的广告和营销视频,以引起不同市场目标受众的共鸣,提高品牌知名度和客户参与度。

视频翻译的语言覆盖范围

视频翻译支持下表中的语言对:

源语言目标语言
印地语英语
西班牙语英语
中国人英语
韩国人英语
英语印地语
英语西班牙语
英语中国人
英语意大利语
英语德语
英语俄语

我们还计划在未来的版本中迅速扩大我们的语言覆盖范围。

多语言语音翻译(实时)

除了视频翻译之外,我们还很高兴地宣布推出自动多语言语音翻译,这是我们实时语音翻译 API的一项重大增强。此次发布包含一系列新功能,可实现以前无法实现的更高级别的翻译功能:

  • 最大的变化是用户不再需要设置输入语言。API 现在允许用户接收多种语言的音频,而无需事先指定所使用的语言。这将使他们能够在可能不知道接收语言的情况下翻译音频,例如为多样化的全球客户群提供服务的联系中心。我们非常高兴推出此功能,因为它将为多语言用例开辟一个全新的可能性世界。
  • 除了接收翻译后的音频外,用户还可以通过语言识别 (LID) 支持了解输入音频中使用的语言。虽然模型仍以端到端方式运行,能够处理多种语言,但用户仍然可以收到会话期间使用的每种语言的列表。这对于文档目的或有多个发言者的场景(如多语言会议)非常有用。
  • 语音翻译服务现在还能够在同一会话中处理语言切换。我们允许用户接收多种语言的输入音频,并将它们全部翻译并输出为目标语言。无需设置输入语言,也无需在语言更改时进行新的 API 调用,同一会话可以自动处理语言更改并输出所需语言的翻译。这对于经常在多种母语之间切换的用户,或在商业或教育环境中的多语言会议中,将非常有用,这是一个非常令人兴奋的功能,将创造新的翻译能力水平。

实时语音翻译的客户场景

以下是多语言语音翻译实现的一些以前不可能实现的新客户场景:

  • 日常生活中的翻译:想象一下,您正在纽约这样一个多元化的城市中行走,一个外国人向您走来。他们开始用自己的语言向您询问一些事情,但您不仅不知道他们在说什么,甚至不知道他们在说什么语言。通过将我们的 API 集成到翻译移动应用程序等解决方案中,您不仅会知道用户在说什么语言,还会收到完整的文本翻译(如果您选择,还可以收到音频),让您可以自由地与这个人交流,就像完全没有语言障碍一样。
  • 视频实时翻译字幕:假设您正在尝试法国菜,并想跟着厨师制作红酒炖牛肉的视频一起看 — 全部用法语(您不会说法语)。使用由 Azure 语音翻译 API 提供支持的翻译移动应用,您现在可以播放视频并获得流式翻译字幕,就像厨师在实时教您一样!
  • 多语言会议:真正展示新多语言模型强大功能的独特用例是多语言母语人士参加的会议。假设有这样一种情况,例如外交会议,来自许多国家的代表正在相互交谈。如果他们都启用了我们的 API,他们就可以自由地互相交谈,进行自然的对话,而不必担心语言障碍。该 API 可以自动处理语言切换,并仍翻译成目标语言。即使多种语言的使用者都在同一个房间里,也可以实现无缝对话。

从上述场景可以看出,多语言语音翻译开辟了新的可能性,而这些可能性以前是繁琐、低效或完全不可能的。

多语言语音翻译的语言支持

在公开预览版中,多语言语音翻译将提供输入语言。这意味着这些是 API 将自动检测并从输入之间切换的语言。输出(目标)语言仍然可以是Azure 语音翻译服务支持的任何语言。40 种输入语言如下(以及语言代码):

  • 阿拉伯语 (ar)、巴斯克语 (eu)、波斯尼亚语 (bs)、保加利亚语 (bg)、简体中文 (zh)、繁体中文 (zhh)、捷克语 (cs)、丹麦语 (da)、荷兰语 (nl)、英语 (en)、爱沙尼亚语 (et)、芬兰语 (fi)、法语 (fr)、加利西亚语 (gl)、德语 (de)、希腊语 (el)、印地语 (hi)、匈牙利语 (hu)、印尼语 (id)、意大利语 (it)、日语 (ja)、韩语 (ko)、拉脱维亚语 (lv)、立陶宛语 (lt)、马其顿语 (mk)、挪威语 (nb)、波兰语 (pl)、葡萄牙语 (pt)、罗马尼亚语 (ro)、俄语 (ru)、塞尔维亚语 (sr)、斯洛伐克语 (sk)、斯洛文尼亚语 (sl)、西班牙语 (es)、瑞典语 (sv)、泰语 (th)、土耳其语 (tr)、乌克兰语 (uk)、越南语 (vi) 和威尔士语 (cy)。

在即将推出的版本中,我们计划支持语音翻译支持的所有输入语言。语言和区域设置支持将不断更新和扩展,以使我们的模型更易于所有人使用。

 目前企业需要通过微软官方合作伙伴获取服务,可以合规、稳定地提供企业用户使用Azure AI语音服务的可能,满足国内发票需求。

通过微软官方合作伙伴获取服务,可以合规、稳定地提供企业用户使用ChatGPT的可能,满足国内发票需求,同时也能解决连接不稳定/响应速度慢/并发配额低等问题。

参考链接:
微软 Azure AI服务免费申请试用

使用教程

第一步:注册账号进入官网:

https://azure.microsoft.com/zh-cn/products/ai-services/text-to-speech

点击“免费试用文本转语音”,新用户可获得使用额度,但很少,基本只够测试用

点击“免费开始使用”,这里需要使用微软账号进行登录。

然后进入添加个人信息资料的界面。

手机号验证勾选“其他电话号码”,地区选择中国,然后输入自己的手机号接收验证码即可:

填写完资料后,点击下一步进入信用卡验证,信用卡不会扣费,但要保证里面有1美金才能验证成功。

验证成功后会跳转到Azure主页,点击“转到Azure门户”进入Azure控制台:

第二步:部署语音服务展开左上角菜单栏,打开所有服务:

在所有服务下找到“AI+机器学习”类别,选择语音服务并创建:

创建界面的名称可以随便填,定价层选择“Free F0”,然后点击“审阅并创建”:

继续点击“创建”:

稍等十秒左右语音服务就部署完成了。

第三步:创建语音点击“转到资源”:

继续点击“转到Speech Studio”:

Speech Studio里有很多语音服务,比如“语音转文本”、“语音转字幕”等等,都可以直接使用。

下滑找到文本转语音服务的语音库,点击进入:

在这里我们就可以看到不同国家的各种声音模型,之后Microsoft Azure上新语音模型也会更新到这里。

每个声音模型也都配置了不同的对话场景和情绪,甚至还有各种方言,可以说是目前市面上最全的AI语音库了。

随便点击一个试听一下效果:



,时长00:22

 

效果虽然没法和开头展示的语音效果相媲美,但是已经非常接近真人声音了。

选择好想用的声音模型,点击转到有声内容创作。

把文本内容粘贴到文本框,点击播放按钮就可以进行语音合成。

右侧操作栏可以设置语言、声音模型和说话风格以及气口停顿等等功能,非常齐全。

语音制作完毕之后,点击保存并导出为本地文件,一份文本转语音文件就制作好了。

之后再制作有声读物、小说推文或者是其他有声内容时就可以直接使用Microsoft Azure。无论是声音模型的丰富度还是功能的易用性,Microsoft Azure基本上就相当于语音合成领域的OpenAI。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1844999.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

onlyoffice报错:这份文件无法保存。请检查连接设置或联系您的管理员当你点击

文章目录 一、onlyoffice报错:这份文件无法保存。请检查连接设置或联系您的管理员当你点击二、解决方法总结 一、onlyoffice报错:这份文件无法保存。请检查连接设置或联系您的管理员当你点击 二、解决方法 禁用防火墙 sudo ufw disable总结 作者&…

MySQL 面试突击指南:核心知识点解析1

MySQL中有哪些存储引擎? InnoDB存储引擎 InnoDB是MySQL的默认事务型引擎,也是最重要、使用最广泛的存储引擎,设计用于处理大量短期事务。 MyISAM存储引擎 在MySQL 5.1及之前版本,MyISAM是默认的存储引擎。它提供了全文索引、压缩、空间函数(GIS)等特性,但不支持事务和…

Linux ls-al命令实现,tree命令实现,不带缓存的文件IO(open,read,write)

shell命令 ls -al 实现 #include <43func.h> void error_check(int ret, const char *msg) {if (ret -1) {perror(msg);exit(EXIT_FAILURE);} }char get_file_type(mode_t mode) {if (S_ISREG(mode)) return -;//检查给定的文件模式&#xff08;通常是从 stat 或 lst…

36.6K star!Immich - 一款开源高性能的自托管照片和视频备份方案

大家好&#xff0c;今天给大家分享的是一个高性能的自托管照片和视频备份方案。 Immich 是一个图片管理和分享平台&#xff0c;它允许用户高效地组织、存储和访问他们的照片和视频集合。这个项目特别设计来优化个人和家庭的多媒体内容管理体验&#xff0c;提供了诸如自动备份、…

贾英才主任受聘担任“两个中心”专家委员会委员

近日&#xff0c;第二届海峡两岸中西医结合肾脏病学术大会授牌仪式在北京隆重举行。 这一盛会吸引了众多医学领域的专家学者&#xff0c;共同探讨中西医结合治疗肾脏病的最新进展和未来发展方向。 在此次大会上&#xff0c;崇文门中医医院的贾英才主任凭借其在肾脏病领域的卓…

绝地求生PUBG联名补偿奖励来了 补偿奖励介绍详情解析

绝地求生》(PUBG) 作为一款战术竞技型射击类沙盒游戏&#xff0c;从上线以来就深受玩家小伙伴们的喜爱&#xff0c;即便是没有玩过的小伙伴&#xff0c;对“吃 鸡”二字想必也是很耳熟的&#xff0c;这正是《绝地求生》(PUBG) 的别称。 在北京时间6月12日&#xff0c;由于绝地求…

挑战从不是终点,而是人生的起点

对于交易员来说&#xff0c;每一次市场的起伏都是对内心坚韧与技能精进的考验。无论遭遇的是挫败还是辉煌&#xff0c;它们都是通向卓越道路上不可或缺的磨砺。正是在这些磨难与历练中&#xff0c;我们不断重塑自我&#xff0c;锤炼技术&#xff0c;直至面对看似难以逾越的障碍…

行业唯一!三翼鸟场景品牌战略推动价值凸显

文 | 智能相对论 作者 | 佘凯文 当你的一只羊跑进别人的羊群中&#xff0c;怎么才能找到它&#xff1f; 从前人们为了区分自己的财产&#xff0c;会用烧红的铁块印在动物身上作为标记。在中世纪的欧洲&#xff0c;手工艺匠人用这种烧灼的方法在自己的手工艺品上烙下标记&…

会声会影2024 视频编辑创作利器 #AI智能剪辑 #特效资源库 #共创共享 #视频创作爱好者

&#x1f31f;【全新升级&#xff01;会声会影2024&#xff0c;视频编辑的革新之作】&#x1f31f; 嗨&#xff0c;CSDN的朋友们&#xff0c;今天要跟大家分享一款让我彻底震撼的视频编辑软件——会声会影2024最新版本&#x1f3ac;&#xff01;作为一位热爱创作的内容创作者&a…

昇思25天学习打卡营第3天|数据集 Dataset|数据变换 Transforms

学AI还能赢奖品&#xff1f;每天30分钟&#xff0c;25天打通AI任督二脉 (qq.com) 数据集 Dataset 数据是深度学习的基础&#xff0c;高质量的数据输入将在整个深度神经网络中起到积极作用。MindSpore提供基于Pipeline的数据引擎&#xff0c;通过数据集&#xff08;Dataset&am…

chatgpt: linux 下用纯c 编写一按钮,当按钮按下在一新窗口显示hello world

用这个程序模板&#xff0c;就可以告别只能在黑框框的终端中编程了。 在 Linux 环境下使用纯 C 语言编写一个按钮&#xff0c;当按钮按下时&#xff0c;在一个新窗口显示 "Hello World"。我们可以使用 GTK 库来实现这个功能。GTK 是一个用于创建图形用户界面的跨平台…

论文辅导 | 基于K-means聚类和ELM神经网络的养殖水质溶解氧预测

辅导文章 模型描述 1&#xff09;相似度统计量构造。数据归一化后&#xff0c;利用皮尔森相关系数确定环境因子权重&#xff0c;构造相似日的统计量&#xff0d;相似度。 2&#xff09;K-means 聚类。根据相似度应用 K-means 聚类法对历史日数据样本聚类&#xff0c;找出合适样…

clean code-代码整洁之道 阅读笔记(第十一章)

第十一章 系统 “复杂要人命,它消磨开发者的生命&#xff0c;让产品难以规划、构建和测试。” --RayOzzie&#xff0c;微软公司首席技术官 11.1 如何建造一个城市 每个城市都有一组组人管理不同的部分&#xff0c;有些人负责全局&#xff0c;其他人负责细节。 城市能运转&#…

昨天发的 npm 包,却因为 registry 同步问题无法安装使用

用过 HBuilderX 云打包的都知道&#xff0c;云上面的 Android 环境很有限&#xff0c;其实并不能覆盖 uniapp 生态所有的版本&#xff0c;甚至说只能覆盖最新的一两个版本。 如果你需要用到 HBuilderX 安卓云打包&#xff0c;就必须及时跟进 HBuilderX 的版本更新&#xff0c;…

【人机交互 复习】第7章 可视化设计

一、窗口界面类型 1.多文档界面 &#xff08;1&#xff09;优点 a.节省系统资源 b.最小的可视集 c.协同工作区 d.多文档同时可视化 &#xff08;2&#xff09;缺点 a.菜单随活动文档窗口状态变化&#xff0c;导致不一致性 b.文档窗口必须在主窗口内部&#xff0c;减弱多文档显…

[C++][数据结构][B-树][上]详细讲解

目录 0.常见的搜索结构1.B树概念2.B-树的插入分析1.流程分析2.插入过程总结 0.常见的搜索结构 种类数据格式时间复杂度顺序查找无要求 O ( N ) O(N) O(N)二分查找有序 O ( l o g 2 N ) O(log_2 N) O(log2​N)二叉搜索树无要求 O ( N ) O(N) O(N)二叉平衡树无要求 O ( l o g 2 …

【计算机网络仿真】b站湖科大教书匠思科Packet Tracer——实验5 交换机的自学习算法

一、实验目的 1.验证交换机的自学习算法&#xff1b; 2.了解交换机对帧的过滤特性&#xff1b; 3.学习交换机如何登记接收到的数据包&#xff1b; 4.学习交换机如何转发数据包&#xff08;明确转发&#xff0c;盲目转发&#xff0c;丢弃&#xff09;。 二、实验要求 1.使用Cisc…

自动化办公04 使用pyecharts制图

目录 一、柱状图 二、折线图 三、饼图 四、地图 1. 中国地图 2. 世界地图 3. 省会地图 五、词云 Pyecharts是一个用于数据可视化的Python库。它基于Echarts库&#xff0c;可以通过Python代码生成各种类型的图表&#xff0c;如折线图、柱状图、饼图、散点图等。 Pyecha…

养车小程序系统源码,汽修源码,仿途虎养车系统源码,车辆保养小程序系统

用户端&#xff0b;商家端&#xff0b;师傅端 功能介绍: 支持下单上门服务、到店核销&#xff0c;支持单独选择项目、 也支持选择服务人员、和选择门店多种下单方式&#xff0c; 支持上门服务和到店核销两种服务方式&#xff0c;支持自营和多商家联营两种运营模式&#xff…

静态路由(Static-Route)-Cisco

路由&#xff08;Route&#xff09; 世界上数亿的计算机大海 通过路由将世界连接 路由连接LAN、WAN、MAN&#xff0c;也连接世界 路由的工作 路由器将大块信息分解为小数据包 以实现可靠和高效的传输 过程称为“反汇编”和“封装数据有效负载” 路由表是一种逻辑数据结构…