MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control
语音合成 | 7.5/10
语音合成 | 7.5/10
音频生成 | 7.5/10
语音情感识别 | 6.0/10
音频安全 | 7.5/10
Phonological Subspace Collapse Is Aetiology-Specific and Cross-Lingually Stable: Evidence from 3,374 Speakers
语音合成 | 7.5/10
语音情感识别 | 8.0/10
实时处理 | 6.5/10
语音生物标志物 | 7.0/10
音乐生成 | 7.0/10
共分析 21 篇语音/AI 论文
1. **问题**:当前口吃语音技术研究与口吃者(PWS)及言语语言病理学家(SLP)的实际需求存在系统性脱节,研究重点、任务定义和评估方法未能充分以用户为中心。 2. **方法核心**:通过两部分结合分析:1)对228篇相关论文进行范围综述,提出研究任务分类法并分析研究现状;2)对70名利益相
这篇论文旨在解决现有音频-文本检索方法无法处理查询和文档中音频与文本交错出现(如多轮对话、混合输入)的局限性。为此,作者定义了音频-文本交错上下文检索(ATIR)任务,并构建了一个包含约8.8万对样本的大规模基准。为解决直接应用多模态大语言模型(MLLM)时音频token冗余导致的效率和精度问题,论
这篇论文针对在公共场景(如会议、演讲)中,不可信录音设备可能导致声纹泄露且事后无法补救的问题,提出了EchoMask——首个基于声学超材料的物理层实时声纹匿名化系统。其核心方法是在声音到达麦克风前,通过精心设计的被动声学结构对特定低频段(300-700Hz)进行选择性干扰,该频段对说话人识别至关重要
这篇论文旨在解决一个关键问题:为什么近年来在动物个体自动识别(基于图像或声音)上报告的高准确率算法,却很少转化为生态学实践中的常规工具?其方法核心是提出一个“以生态目标为中心”的评估与部署框架,强调自动化识别的有用性取决于其服务的具体生态问题、可用数据以及错误类型带来的实际后果。与以往主要关注算法准
1. **问题**:现有视频扩散模型在生成人机交互(HOI)视频时,常出现手/脸结构崩溃和人机物理穿透等问题,根源在于模型缺乏对3D空间关系和交互结构的理解。 2. **方法核心**:提出CoInteract框架,核心是“空间结构化协同生成”范式。在一个共享的DiT骨干中联合训练RGB外观流和辅助的
1. **要解决什么问题**:传统故障强度诊断方法将各类故障视为独立标签,忽略了物理状态之间固有的层次依赖关系(如“空化”是“初期空化”、“稳定空化”等的父类),这限制了模型的性能和鲁棒性。 2. **方法核心是什么**:提出一个名为DHK的通用框架,其核心是设计两个新的损失函数:**层次树损失
1. **问题**:音乐源分离(MSS)领域常用的客观评估指标(BSS-Eval)与人类感知评分相关性较低,导致模型评估不够准确。 2. **方法核心**:提出两种基于嵌入的侵入式评估指标:在预训练MERT模型的嵌入空间上计算目标与分离信号的均方误差(MSE_MERT)和一种逐曲目的Fréchet音
这篇论文旨在解决达罗毗荼语言(Telugu和Kannada)在医疗领域自动语音识别(ASR)中面临的标注数据稀缺和语言形态复杂两大挑战。其核心方法是提出一个“置信度感知训练框架”,该框架通过一个混合置信度评分机制(结合静态的感知、声学相似性、WER分数和动态的模型熵),对混合了真实与合成语音的训练数
1. **问题**:耳语语音因缺乏声带振动,其声学特征与正常语音差异显著,导致现有的说话人验证系统性能严重下降。这在用户为保护隐私而低语、或因疾病无法正常发声等实际场景中构成挑战。 2. **方法核心**:在预训练的说话人验证骨干网络(ReDimNet-B6)之上,添加一个轻量级的编码器-解码器结构