【AI视野·今日Sound 声学论文速览 第三十六期】Mon, 30 Oct 2023

news2024/12/23 13:27:39

AI视野·今日CS.Sound 声学论文速览
Mon, 30 Oct 2023
Totally 7 papers
👉上期速览✈更多精彩请移步主页

在这里插入图片描述

Daily Sound Papers

Style Description based Text-to-Speech with Conditional Prosodic Layer Normalization based Diffusion GAN
Authors Neeraj Kumar, Ankur Narang, Brejesh Lall
在本文中,我们提出了一种基于扩散 GAN 的方法 Prosodic Diff TTS,根据风格描述和内容文本作为输入生成相应的高保真语音,从而仅在 4 个去噪步骤内生成语音样本。它利用新颖的条件韵律层归一化将风格嵌入合并到基于多头注意的音素编码器和基于梅尔频谱图解码器的生成器架构中以生成语音。风格嵌入是通过在音调、语速、情感、性别分类等辅助任务上微调预训练的 BERT 模型来生成的。

Whisper-MCE: Whisper Model Finetuned for Better Performance with Mixed Languages
Authors Peng Xie, XingYuan Liu, ZiWei Chen, Kani Chen, Yang Wang
最近,Whisper 在英语自动语音识别 ASR 方面的鲁棒性和准确性已接近人类水平,而在小语种和混合语言语音识别方面,仍然迫切需要进一步改进。在这项工作中,我们展示了 Whisper MCE 的令人印象深刻的结果,这是我们经过微调的 Whisper 模型,该模型是使用我们自己收集的数据集、粤语和英语混合音频数据集 MCE 进行训练的。同时,考虑到单词错误率 WER 在评估其在小语种和混合语言环境中的有效性时提出了挑战,我们提出了一种新颖的评级机制。通过将我们的模型与基线 Whisper Large v2 模型进行比较,我们展示了其准确捕获原始音频内容的卓越能力,实现了更高的识别精度,并表现出更快的识别速度。

Enabling Acoustic Audience Feedback in Large Virtual Events
Authors Tamay Aykut, Markus Hofbauer, Christopher Kuhn, Eckehard Steinbach, Bernd Girod
COVID 19 大流行将我们日常生活中的许多事件转移到了虚拟领域。虽然虚拟会议系统提供了实体会议的替代方案,但大型活动需要静音观众,以避免背景噪音和音频失真的累积。然而,表演艺术家强烈依赖观众的反馈。我们提出了一个虚拟观众框架的概念,该框架为所有参与者提供真实观众的氛围。本地收集观众反馈,允许用户通过选择鼓掌、吹口哨、嘘声、笑声等方式来表达热情或不满。该反馈作为抽象信息发送到虚拟观众服务器。我们向所有参与者广播组合的虚拟观众反馈信息,这些信息可以由客户合成为单个声音反馈。可以通过将观众的集体反馈转化为提示来完成合成,然后将提示输入到 AudioGen 等最先进的模型中。

Unified Segment-to-Segment Framework for Simultaneous Sequence Generation
Authors Shaolei Zhang, Yang Feng
同时序列生成是实时场景的关键任务,例如流式语音识别、同步机器翻译和同步语音翻译,其中目标序列是在接收源序列的同时生成的。实现低延迟高质量生成的关键在于确定生成的最佳时刻,这是通过学习源序列和目标序列之间的映射来完成的。然而,现有方法通常依赖于针对不同序列类型的特定于任务的启发式方法,限制了模型自适应学习源目标映射的能力,并阻碍了对各种同时任务的多任务学习的探索。在本文中,我们提出了一个用于同时序列生成的统一分段到分段框架 Seg2Seg,它以自适应和统一的方式学习映射。在同时生成的过程中,模型在等待源段和生成目标段之间交替,使该段成为源和目标之间的天然桥梁。为了实现这一目标,Seg2Seg 引入了一个潜在片段作为源到目标之间的枢轴,并通过建议的期望训练探索所有潜在的源目标映射,从而学习生成的最佳时刻。

TorchAudio 2.1: Advancing speech recognition, self-supervised learning, and audio processing components for PyTorch
Authors Jeff Hwang, Moto Hira, Caroline Chen, Xiaohui Zhang, Zhaoheng Ni, Guangzhi Sun, Pingchuan Ma, Ruizhe Huang, Vineel Pratap, Yuekai Zhang, Anurag Kumar, Chin Yun Yu, Chuang Zhu, Chunxi Liu, Jacob Kahn, Mirco Ravanelli, Peng Sun, Shinji Watanabe, Yangyang Shi, Yumeng Tao, Robin Scheibler, Samuele Cornell, Sean Kim, Stavros Petridis
TorchAudio 是一个为 PyTorch 构建的开源音频和语音处理库。它旨在通过提供设计良好、易于使用且高性能的 PyTorch 组件来加速音频和语音技术的研究和开发。其贡献者定期与用户互动,了解他们的需求并通过开发有影响力的功能来满足他们。在这里,我们概述了 TorchAudio 的开发原理和内容,并重点介绍了我们在最新版本 2.1 自监督学习预训练管道和训练配方、高性能 CTC 解码器、语音识别模型和训练配方、高级媒体 I O 功能和工具中包含的关键功能用于执行强制对齐、多通道语音增强和无参考语音评估。

Early Detection of Tuberculosis with Machine Learning Cough Audio Analysis: Towards More Accessible Global Triaging Usage
Authors Chandra Suda
结核病 TB 是一种主要影响肺部的细菌性疾病,是全世界导致死亡的主要原因之一。为了防止结核病在体内传播并导致危及生命的并发症,及时有效的抗结核治疗至关重要。咳嗽是结核病的客观生物标志物,是一种分类工具,可监测治疗反应并随着治疗的成功而消退。目前结核病诊断的黄金标准进展缓慢或难以实现,特别是在结核病最流行的农村地区。此外,当前的机器学习 ML 诊断研究(例如利用胸部 X 光片)效率低下,并且无法监测治疗进展。为了实现有效诊断,开发了一个集成模型,该模型使用新颖的机器学习架构分析智能手机麦克风的咳嗽声流行病学,以检测结核病。该架构包括 2D CNN 和 XGBoost,它们接受了来自 7 个国家的 724,964 个咳嗽音频样本和人口统计数据的训练。经过特征提取Mel谱图和数据增强IR卷积后,该模型在接收算子特征下的AUROC面积达到88,超过了WHO对筛选测试的要求。 15 秒内即可获得结果,并且可以通过移动应用程序轻松访问。

Music Recommendation Based on Audio Fingerprint
Authors Diego Salda a Ulloa
这项工作结合了不同的音频特征,以获得更强大的指纹,用于音乐推荐过程。这些方法的组合产生了高维向量。为了减少值的数量,将 PCA 应用于所得指纹集,选择与解释方差 95 相对应的主成分数量。最后,利用这些PCA指纹,计算每个指纹与整个数据集的相似度矩阵。该过程适用于个人音乐库中的 200 首歌曲,这些歌曲都标有艺术家相应的流派。如果推荐的歌曲类型与目标歌曲类型匹配,则具有最相似相似性的歌曲的推荐指纹被评为成功。

Chinese Abs From Machine Translation

Papers from arxiv.org

更多精彩请移步主页


pic from pexels.com

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1221748.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

开发知识点-前端-webpack

webpack技术笔记 一、 介绍二、 下载使用 一、 介绍 Webpack是一个现代 JavaScript 应用程序的静态模块打包器 打包:可以把js、css等资源按模块的方式进行处理然后再统一打包输出 静态:最终产出的静态资源都可以直接部署到静态资源服务器上进行使用 模…

达尔优EK87键盘说明书

EK87说明书连接说明: **有线模式:**开关拨到最右边,然后插线连接电脑即可使用 2.4G **接收器模式:**开关拨到中间,然后接收器插入电脑USB接口即可使用 **蓝牙模式:**开关拨到最左边,然后按FNQ长…

<Linux>(极简关键、省时省力)《Linux操作系统原理分析之Linux 进程管理 2》(6)

《Linux操作系统原理分析之Linux 进程管理 2》(6) 4 Linux 进程管理4.2 Linux 进程的状态和标识4.2.1 Linux 进程的状态及转换4.2.2 Linux 进程的标识4.2.3 进程标识哈希表 4 Linux 进程管理 4.2 Linux 进程的状态和标识 4.2.1 Linux 进程的状态及转换…

Navicat 基于 GaussDB 主备版的快速入门

Navicat Premium(16.2.8 Windows版或以上) 已支持对GaussDB 主备版的管理和开发功能。它不仅具备轻松、便捷的可视化数据查看和编辑功能,还提供强大的高阶功能(如模型、结构同步、协同合作、数据迁移等),这…

API接口怎么对接电商平台获取商品详情数据

对于api接口的对接,你可以按照以下步骤进行操作: 1. 确定需求:首先要明确你的对接需求,即想要通过对接api接口实现什么功能,例如获取数据、实现支付等。 2. 寻找文档:在对接之前,要找到相关ap…

一、认识STM32

目录 一、初识STM32 1.1 STM32的命名规则介绍 1.2 STM32F103ZET6资源配置介绍 二、如何识别芯片管脚 2.1 如何寻找 IO 的功能说明 三、构成最小系统的要素 一、初识STM32 1.1 STM32的命名规则介绍 以 STM32F103ZET6 来讲解下 STM32 的命名方法: &…

AH4056线性锂电池充电IC:高效、安全的充电解决方案

随着移动设备的普及,人们对电池续航能力的要求越来越高。为了满足这一需求,电池充电技术不断创新。本文将为您介绍一款AH4056线性锂电池充电IC,采用同步整流技术,具有宽输入电压范围、大充电电流、温度保护等优点,适用…

虾皮产品标题生成器:为您的商品打造吸引眼球的标题

在电商平台上,一个引人注目的商品标题是吸引潜在买家点击进入您的产品页面的第一步。然而,很多商家在创建商品标题时遇到困难,不知道如何吸引更多的目标受众。幸运的是,现在有一个名为知虾工具的强大工具,可以帮助商家…

【Git学习二】时光回溯:git reset和git checkout命令详解

😁 作者简介:一名大四的学生,致力学习前端开发技术 ⭐️个人主页:夜宵饽饽的主页 ❔ 系列专栏:JavaScript小贴士Git等软件工具技术的使用 👐学习格言:成功不是终点,失败也并非末日&a…

基于STM32的无线传感器网络(WSN)通信方案设计与实现

无线传感器网络(Wireless Sensor Network,简称WSN)是由一组分布式的无线传感器节点组成的网络,用于监测和收集环境中的各类物理信息。本文将基于STM32微控制器,设计并实现一个简单的无线传感器网络通信方案&#xff0c…

系统韧性研究(5)| 常用的系统韧性技术

如果不利事件或条件导致系统无法正常运行,则它们可能会对有价值的资产造成各种形式的损害。正如我在本系列的前几篇文章中概述的那样,系统韧性很重要,因为没有人想要一个无法克服“不可避免的逆境”的脆弱系统。 在本系列的第一篇文章中&…

nacos客户端连接服务端报Client not connected, current status:STARTING

说明&#xff1a; nacos服务端版本&#xff1a;v2.1.2 nacos客户端版本&#xff1a;2.1.2 结果启动项目报错&#xff1a; Client not connected, current status:STARTING 解决&#xff1a; 降低客户端版本至 1.4.1 就Ok了 <dependency><groupId>com.alibaba.naco…

AI监管规则:各国为科技监管开辟了不同的道路

AI监管规则&#xff1a;各国为科技监管开辟了不同的道路 一份关于中国、欧盟和美国如何控制AI的指南。 编译 李升伟 茅 矛 &#xff08;特趣生物科技有限公司&#xff0c;广东深圳&#xff09; 插图&#xff1a;《自然》尼克斯宾塞 今年5月&#xff0c;科技公司OpenAI首席…

List is a raw type. References to generic type List<E> should be parameterized

List is a raw type. References to generic type List<E> should be parameterized 都是代码习惯问题懒

syncthing 多设备同步

【精选】linux间文件实时同步(syncthing) ---带历史版本“后悔药”_syncthing linux_井底蛙-jdw的博客-CSDN博客https://blog.csdn.net/qq_41355314/article/details/116694273 wget https://gh-proxy.com/https://github.com/syncthing/syncthing/releases/download/v1.26.1/…

基于R语言平台Biomod2模型的物种分布建模与可视化分析

!](https://img-blog.csdnimg.cn/84e1cc8c7f9b4b6ab60903ffa17d82f0.jpeg#pic_center)

【C++初阶】STL详解(二)string类的模拟实现

本专栏内容为&#xff1a;C学习专栏&#xff0c;分为初阶和进阶两部分。 通过本专栏的深入学习&#xff0c;你可以了解并掌握C。 &#x1f493;博主csdn个人主页&#xff1a;小小unicorn ⏩专栏分类&#xff1a;C &#x1f69a;代码仓库&#xff1a;小小unicorn的代码仓库&…

Redis链表

前言 链表作为一种常见的数据结构&#xff0c;一般都会内置在很多高级语言中。由于Redis使用的是C语言并没有内置这种数据结构&#xff0c;所以Redis构建了自己的链表实现。 链表在Redis中应用广泛&#xff0c;比如列表建的底层实现之一就是链表。当一个列表键包含了数量比较多…

nodejs+vue面向中小学课堂教学辅助软件系统的设计与实现-微信小程序-安卓-python-PHP-计算机毕业设计

主要功能有&#xff0c;管理员通过后台会对此教学辅助进行审核&#xff0c;管理员在还可以进行首页、个人中心、学生管理、教师管理、班级信息管理、科目名称管理、课程信息管理、教学资料管理、作业信息管理、作业提交管理、作业成绩管理、在线考试管理、试题管理、考试管理、…

[PHP]关联和操作MySQL数据库然后将数据库部署到ECS

在Mac电脑上使用VS Code进行PHP开发并关联操作MySQL数据库&#xff0c;然后将数据库部署到ECS。 1.安装PHP和MySQL 确保你的Mac上已经安装了PHP和MySQL。你可以使用Homebrew来安装它们&#xff1a; $ brew install php $ brew install mysql 安装mysql完成后记住这一句: …