共分析 29 篇论文


⚡ 今日概览

✅ 筛选入选 29 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#音频问答5 篇█████
#语音识别3 篇███
#联合声音事件检测定位2 篇██
#语音增强2 篇██
#音视频生成2 篇██
#音频事件检测2 篇██
#全双工语音交互1 篇█
#声场重建1 篇█

📊 论文评分排行榜(29 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇SEABED: SouthEast Asian Benchmark for Evaluating Audio…8.5前25%数据集与基准#音频问答
🥈BLINC: Blind Calibration For Training-Free Speech…8.2前25%方法研究#语音增强
🥉AVTR-1: Open Stack for Real-Time Interactive Avatars8.0前25%系统技术报告#音视频生成
4.ParA-LLM: A Unified Approach to Paralinguistic and…7.9前25%数据集与基准#音频问答
5.If You Hear It, Help Find It: Orthogonal Knowledge…7.9前25%方法研究#音频事件检测
6.Causal limits and optimal allocation for passive…7.5前25%理论研究#语音可懂度评估
7.Training Music Sample Identification Models on Real…7.4前50%方法研究#音乐检索
8.COT-TTS: Audio Context-Aware Text-to-Speech with Chain…7.4前50%数据集与基准#文本到语音
9.Adaptive Depth and Expert Refinement for Efficient…7.3前50%方法研究#语音增强
10.NemotronLabs VoiceChat: An Open Full-duplex Speech-to…7.2前50%模型报告#全双工语音交互
11.Vox-Infinity: Benchmarking the Limits of Long-Context…7.2前50%数据集与基准#音频问答
12.Bearings: Self-Supervised Soundfield Embeddings from…7.2前50%方法研究#联合声音事件检测定位
13.EquiSELD: Efficient training of equivariant sound…7.0前50%方法研究#联合声音事件检测定位
14.Beyond WER: Entity and Disfluency Recall in Accented…6.8前50%应用研究#语音识别
15.Low-Rank Frequency Convolution and Noise-Range…6.8前50%系统技术报告#音高与旋律提取
16.Low resource cross-modal alignment using HGNN to…6.7前50%方法研究#音频检索
17.Transsion’s Speaker-Attributed Multilingual ASR System…6.5前50%系统技术报告#语音识别
18.Enhancing Audio Reasoning via Semantic Summary…6.5前50%方法研究#音频问答
19.Reading Less While Writing: A Closed-Form Bandwidth…6.4前50%方法研究#语音识别
20.Investigating the Performance and Energy Costs of…6.4前50%系统技术报告#音乐源分离
21.Causal Localization of the Refusal Direction in Audio…6.3前50%方法研究#音频问答
22.Hi-Singers: A Comprehensive High-Quality Dataset for…6.2前50%数据集与基准#音视频生成
23.Discrete vs. Continuous: A Comprehensive Study of…6.2前50%数据集与基准#音频理解
24.Speech Language Models for Full-Meeting Speaker…6.0前50%方法研究#说话人分离标注
25.Curriculum-Based Noise Adaptation for Phoneme-to-Text…5.9前50%方法研究#静默语音接口
26.Signal-Informed Temporal Routing for Vinyl Defect…5.9前50%方法研究#音频事件检测
27.Spherical Harmonic Sliced Wasserstein Displacement…5.7前50%方法研究#声场重建
28.Partial Accent-Control Editing in Frozen Speech…5.6前50%方法研究#语音转换
29.Enhancing speech representation learning with cross…5.5前50%方法研究#音频分类

📋 论文列表

🖼️ 有图的论文会在这里展示首张原论文图;原图链接见对应独立页面。

🥇 听懂东南亚语音:SEABED 用六类可听推理把答对和讲对分开查

原论文 Figure 2:SEABED construction and evaluation pipeline.

英文题目:SEABED: SouthEast Asian Benchmark for Evaluating Audio Reasoning

标签:#音频问答 | #基准设计 | #多语言 | #语音

评分:8.5/10 | 创新 1.7/2 | 技术严谨 1/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Harshit Rajgarhia:Centific AI Research
  • Asif Shaik:Centific AI Research
  • Rachuri Lokesh:Centific AI Research
  • Sushanta Kumar Pani:Centific AI Research
  • Abhishek Mukherji:Centific AI Research

📌 核心摘要

东南亚语音推理要求模型仅凭音频回答问题,输入为印尼语、泰语和马来语真实录音,输出为选择或开放答案,难点在于转录会抹掉决定含义的音高、停顿、方言音系和情感韵律。构建链先从10个开放语料筛选结构与情感片段并统一重采样至16 kHz,再按四类固定金标任务用模板与受控干扰项实例化题目,接着对两类无现成标注任务用音频条件大模型生成内容问题,最后经泄漏检查、答案位置去偏和跨家族裁判完成评分。相对既有英语推理基准与东南亚识别类套件的机制差异在于干扰项锚定可听混淆而非话题,审计直接判定陈述推理是否被音频证据支撑。在SEABED基准下,Gemini 3.5 Flash的加权平均准确率为50.3%,高于MERaLiON-3-10B的加权平均准确率29.4%。结论仅适用于3个语言的6类任务与短至长时录音混合条件,尚未验证向千余种东南亚语言的外推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 不碰权重只改掩码:BLINC 用盲估计双峰分布做免训练校准

英文题目:BLINC: Blind Calibration For Training-Free Speech Enhancement Adaptation

标签:#语音增强 | #测试时自适应 | #语音 | #鲁棒性 | #高效推理

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Tobias Raichle:机构信息未在 arXiv HTML 中可靠披露
  • Ekaterina Gavrilko:机构信息未在 arXiv HTML 中可靠披露
  • Bin Yang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音增强(Speech Enhancement, SE)需从含噪时频谱中恢复目标语音,部署时说话人、噪声与语言偏移会使掩膜预测失去双峰校准并拖累质量。BLINC(Blind Calibration)先以经验分布函数估计预测掩膜的边际分布,再从含噪信号提取语音活动占比并经离线拟合的仿射映射得到目标分位函数的底、中点与锐度,最后用概率积分变换做保序直方图匹配并按盲估计信噪比恢复功率。与基于反向传播更新权重或在线优化非侵入式指标的测试时自适应(Test-Time Adaptation, TTA)不同,该方法冻结模型且单步重映射数值而不改变排序。在轻量幅度掩膜模型上跨9个目标域的平均感知语音质量评估(Perceptual Evaluation of Speech Quality, PESQ)从2.05提升至2.17并超越3个损失基线,同时实时因子保持在0.003。校准只能修复数值偏差而无法修复排序错误,因此在排序亦受损的强偏移与复数修正结构下增益收窄,拟合准则也决定了感知与信号级指标的取舍。该结论的适用边界受限于加性噪声掩膜任务,对混响等非加性退化场景尚未验证。在推理开销上,原文在英伟达硬件上测得实时因子与源模型持平,几乎不增加额外延迟与计算量。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 快推理不等于能对话:AVTR-1 把双人音频、连续渲染与延迟调度做进同一系统

英文题目:AVTR-1: Open Stack for Real-Time Interactive Avatars

标签:#音视频生成 | #流匹配 | #流式处理 | #实时处理 | #音视频

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Artem Kravtsov:机构信息未在 arXiv HTML 中可靠披露
  • Dmitrii Ziganshin:Avaturn Live
  • Vsevolod Poletaev:Core contributors: co-wrote the paper
  • Gleb Balitskiy:机构信息未在 arXiv HTML 中可靠披露
  • Anastasia Tikhonova:机构信息未在 arXiv HTML 中可靠披露
  • Egor Burkov:机构信息未在 arXiv HTML 中可靠披露
  • Vadim Lebedev:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

交互式虚拟形象需以双人语音为输入连续输出头部与表情视频,难点在于外部语音智能体输出不定长分片而生成器需定长音频窗,且无声倾听时仍须连续生成并处理打断。先音频编码负责提供短窗可用条件,以双路525ms语音分片为输入做自蒸馏对齐全上下文教师特征,其输出的双路音频特征直接作为运动生成的条件输入进入动作预测,再运动生成负责动作建模,以双路音频特征、75帧历史动作与静态参考为输入由153M参数条件流匹配Transformer自回归预测,其输出的五帧42维头部旋转与表情动作块直接进入渲染调度作为驱动,最后渲染与流媒体负责连续呈现,以动作块、缓存外观与不定长语音分片为输入组装定长呈现窗与未来窗并按媒体时间戳连续发布音视频。与已有实时双人系统相比,关键差异是将远近历史动作、双路音频与静态参考分离条件化并做分区制导,同时从调度规则解析出响应与打断延迟的上下界。在525ms短窗特征保真评测下,自蒸馏学生编码器的相对L1错误率为12%,低于原始HuBERT短窗直接编码的相对L1错误率50%。结论仅适用于短延迟双人倾听与固定窗调度,长延迟、可变延迟非线性响应及极端遮挡大角度外推尚未验证。单次五帧请求在L40S上TTFF为42 ms、处理耗时71 ms,满足25 fps连续播放。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 不只听懂说了什么:用 22 个副语言特征和两阶段课程统一说话方式与声学环境理解

原论文 Figure 2:Our end-to-end pipeline for paralinguistic and acoustic understanding.

英文题目:ParA-LLM: A Unified Approach to Paralinguistic and Acoustic Speech Understanding

标签:#音频问答 | #课程学习 | #数据集 | #基准测试 | #音频大模型

评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Nishit Anand:机构信息未在 arXiv HTML 中可靠披露
  • Jiaqi Su:机构信息未在 arXiv HTML 中可靠披露
  • Ke Chen:机构信息未在 arXiv HTML 中可靠披露
  • Yunyun Wang:机构信息未在 arXiv HTML 中可靠披露
  • Dinesh Manocha:机构信息未在 arXiv HTML 中可靠披露
  • Ramani Duraiswami:机构信息未在 arXiv HTML 中可靠披露
  • Rithesh Kumar:机构信息未在 arXiv HTML 中可靠披露
  • Zeyu Jin:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

现有音频大模型能转写说了什么,却难判断怎么说与在何种环境下说,输入为带混响噪声的语音,输出为对其声学环境与说话人内在特质及 utterance 动态的判断,难点在于多属性耦合且真实远场标注稀缺主观。方法先定义22维分类体系并用实测房间脉冲响应与城市噪声仿真声景生成带标注语音,再用模板生成单属性原子问答打基础。接着用大语言模型上下文学习生成多属性问答学联合推理,最后以Qwen2-Audio-7B-Instruct为基座分两阶段课程微调得到ParA-LLM,前阶段输出的单属性知识直接作为后阶段联合推理的初始化输入。与单属性分类器Vox-Profile与内容型音频大模型相比,差异在于把声学参数与说话人描述统一为可组合问答的推理任务,使多属性联合问答与自由生成控制成为可能。在ParA-Bench基准下,ParA-LLM的准确率为43.53%,高于Voxtral的准确率38.80%。该结论限于英文为主的仿真增强语音与选择题加LLM判分评测,对真实远场与开放式生成的迁移尚未验证。原文未披露训练时长与推理成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 听到不等于能定位:把不可靠的音频监督放在辅助通道的开放词汇音视定位

原论文 Figure 1.:Overview of OV-OrthKD. AV encoders, query-aware fusion, and temporal modeling produce a shared…

英文题目:If You Hear It, Help Find It: Orthogonal Knowledge Distillation for Open-Vocabulary Audio-Visual Event Localization

标签:#音频事件检测 | #知识蒸馏 | #音视频 | #0 样本

评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yi Xu:Tongji University, Shanghai, China
  • Cheng Chen:Tongji University, Shanghai, China
  • Wenzhuo Lei:Tongji University, Shanghai, China

📌 核心摘要

开放词汇音视频事件定位(Open-Vocabulary Audio-Visual Event Localization,OV-AVEL)依据文本查询从视频与音频中输出逐段二值掩码,难点在于视觉与音频教师的边界可靠性不对称且查询需泛化到未见类。所提开放词汇正交蒸馏(OV-OrthKD)先用轻量学生编码与查询门控融合得到共享时序表示,再分流为视觉对齐决策路径、音频对齐辅助投影与文本原型对齐分支。训练时视觉特征以平方欧氏距离塑造决策表示,音频特征仅以余弦方向约束辅助子空间,文本分支维持查询语义,正交损失压缩两类投影的方向重叠。与对称蒸馏的关键差异在于监督放置(Supervision Placement):不可靠音频只许丰富表示而不许直接塑造分割逻辑值。在 OV-AVEBench 测试集上该方法相对官方微调基线将 F1@0.5 提升2.7个百分点且未见类提升3.4个百分点,同时段级平均精度达到0.816。作者承认角色固定、单事件短片段与有限语言泛化仍未解决,跨数据集仅做无微调迁移验证。推理仅用约45.78M参数的学生模型,单片段延迟与显存有实测披露但完整训练成本未完全披露。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 通气耳塞的因果预算:体积除以孔径决定能省下多少分贝

原论文 Figure 1:(a) The audio-band budget \\mathcalB_ad of Eq.

英文题目:Causal limits and optimal allocation for passive frequency-selective hearing protection

标签:#语音可懂度评估 | #形式化分析 | #语音 | #理论分析

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:理论研究 | arXiv 原文

👥 作者与机构

  • Geonhwi Hwang:机构信息未在 arXiv HTML 中可靠披露
  • Jaewoo Lee:机构信息未在 arXiv HTML 中可靠披露
  • Hyunjun Kim:机构信息未在 arXiv HTML 中可靠披露
  • Hyeonwoo Na:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

被动耳塞输入为通气孔道声传输与耳甲尺度空腔体积,输出为频率选择性传输损失谱,难点在于开放通气要求直流透明而有限体积使宽带衰减受限且低频花费极高。方法先由通气加侧支的因果性导出f-2加权传输损失守恒积分并换算为音频带预算,其总量输出作为后续约束的可用资源。再叠加黏性不可达与旁路泄漏上限以判定预算可花费频段,其可达频段输出进入最优分配。最后以危害加权水填充在预算与发音加权语音代价双约束下求解最优谱分配,相对散射求和规则与反射式堵耳方案,关键差异在于仅约束直流透明两端口结构并把硬透明窗口松弛为连续语音价格,具有可计算的交换率。在0.3 ms爆震任务评测下,F2危害匹配设计E的ΔLA指标为6.42,高于F2低频选择设计A的ΔLA指标0.46。该结论适用边界受限于线性非时变单节点集总支路模型,不适用于堵塞式耳塞、非线性大声压与真实可懂度预测。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 真采样对为何还不够:用真实标注训练采样识别并拆分数据与配方的贡献

原论文 Figure 1:Effect of training SIE on nested random subsets of the WhoSampled130K training set pairs, with…

英文题目:Training Music Sample Identification Models on Real Sample Pairs

标签:#音乐检索 | #对比学习 | #音乐 | #数据增强

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 1/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • R. Oguz Araz:机构信息未在 arXiv HTML 中可靠披露
  • Joan Serrà:机构信息未在 arXiv HTML 中可靠披露
  • Xavier Lizarraga-Seijas:机构信息未在 arXiv HTML 中可靠披露
  • Emilio Molina:机构信息未在 arXiv HTML 中可靠披露
  • Xavier Serra:机构信息未在 arXiv HTML 中可靠披露
  • Yuki Mitsufuji:机构信息未在 arXiv HTML 中可靠披露
  • Dmitry Bogdanov:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

采样识别(Sample Identification)判定目标曲是否通过音乐性变换复用了源曲片段,输入为源与目标音频,输出为跨曲检索排序,难点在于切分(chopping)与搔擦(scratching)等制作变换无法被变速变调的参数化流水线模拟。样本识别嵌入模型即 SI Embeddings 与 SIE 先从 WhoSampled130K 真实采样对按 1 秒分辨率起始时间戳加负 2.5 秒到 2.5 秒独立抖动截取 10 秒音频,再经峰值归一化,然后提取起始于 27.5 Hz、每倍频程 36 bins、带宽参数 5 的 258 bins 可变 Q 变换(Variable-Q Transform),由 SampleID 前端与 ResNet50-IBN 主干加 GeM 池化输出 1024 维归一化嵌入,并以间隔 0.3 的三元组损失(Triplet Loss)挖掘批次内最难负样本。与人工对训练的前代 SampleID 相比,关键差异是用真实变换分布替代 stems 混合造对,并引入音频劣化(Audio Degradation)与信号操纵(Signal Manipulation)联合增强以兼顾制作变换与信道退化。在 Sample100 上 SIE 平均精度均值(mean Average Precision,mAP)为 0.758,相对 SampleID 的 0.603 提升约 26%,在 SamplePairs 上为 0.701,相对 0.450 提升约 56%。在 10444 查询的 WhoSampled130K 测试集上 SIE 为 0.389,超出 SampleID-R 的 0.299 与 SampleID 的 0.226。该结论依赖训练集已按构造排除 Sample100 与 SamplePairs 相关曲目,但大规模测试集仍包含小基准 71% 与 50% 曲目,跨域外推需谨慎解读。训练成本为单张 NVIDIA L40S 上约 25 小时,推理延迟吞吐原文未披露。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 先想好怎么说,再开口说:COT-TTS 把对话历史变成可检查的说话计划

原论文 Fig. 4:Overview of the end-to-end CoT-guided autoregressive model.

英文题目:COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning

标签:#文本到语音 | #自回归模型 | #数据集 | #基准测试 | #多语言

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Weizhen Bian:The Hong Kong University of Science and Technology, Hong Kong SAR, China
  • Sitong Cheng:The Hong Kong University of Science and Technology, Hong Kong SAR, China
  • Rongxiu Zhong:JIUTIAN Research, China Mobile, Beijing, China;The State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China
  • Jiahao Pan:The Hong Kong University of Science and Technology, Hong Kong SAR, China
  • Liumeng Xue:Nanjing University
  • Boyi Kang:The Hong Kong University of Science and Technology, Hong Kong SAR, China
  • Shilei Zhang:JIUTIAN Research, China Mobile, Beijing, China;The State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China
  • Jinglei Liu:China Mobile (Hong Kong) Innovation Research Institute, Hong Kong SAR, China
  • Yue Wang:China Mobile (Hong Kong) Innovation Research Institute, Hong Kong SAR, China
  • Junlan Feng:JIUTIAN Research, China Mobile, Beijing, China
  • Bei Liu:The Hong Kong University of Science and Technology, Hong Kong SAR, China
  • Wei Xue:The Hong Kong University of Science and Technology, Hong Kong SAR, China

📌 核心摘要

上下文感知语音合成要求以历史对话音频、目标文本与参考语音为输入,输出与语境相称的目标语音及可解释推理,难点在于历史音频副语言线索易丢失且缺乏显式推理监督。该方法先对影视与广播剧长音频做说话人分离、场景切分与层级情感及五维推理标注,形成结构化训练样本。接着统一自回归模型以上述标注样本为输入,依次生成带情感历史转写与多维推理分析,再生成目标语音语义与全局标记,使转写与推理成为语音生成的显式条件。最后以参考语音全局标记结合预测语义标记重建波形,并支持对中间推理直接检查与编辑后重新合成。与先转写再由大语言模型写风格指令的级联方案不同,该方法直接在音频标记上联合学习理解推理与合成,保留韵律与情感强度线索并以更少参数实现端到端优化。在源不相交的800样本中英基准下,COT-TTS-0.6B的时长误差指标为1.155,低于级联基线three-dia-a3b-fish的时长误差指标5.866。该结论限于影视类表演性对话与短历史窗口,跨域自然对话与长时一致性尚未验证。原文未披露训练硬件与成本,推理仅说明单张NVIDIA H800批量为1。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 共享一块做精修:ADER 用早停深度与单专家适配省掉冗余迭代

原论文 Figure 1:Overview of the proposed ADER framework.

英文题目:Adaptive Depth and Expert Refinement for Efficient Speech Enhancement

标签:#语音增强 | #混合专家模型 | #高效推理 | #语音

评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xikun Lu:机构信息未在 arXiv HTML 中可靠披露
  • Yujian Ma:机构信息未在 arXiv HTML 中可靠披露
  • Yunda Chen:机构信息未在 arXiv HTML 中可靠披露
  • Xianquan Jiang:机构信息未在 arXiv HTML 中可靠披露
  • Jinqiu Sang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

单通道语音增强需从含噪波形恢复目标语音,固定深度模型对简单样本仍执行全部迭代,造成冗余计算。所提自适应深度与专家精修(Adaptive Depth and Expert Refinement,ADER)先由编码器得到时频表示与 utterance 级上下文,再复用单个时谱 Transformer 块逐轮精修。条件专家路由器(Conditional Expert Router,CER)在每轮依据当前状态选择一个轻量残差适配器,自适应深度控制器(Adaptive Depth Controller,ADC)依据前后状态与上下文决定是否继续,退出感知中间监督(Exit-aware Intermediate Supervision,EIS)在训练中随机监督中间输出以匹配早退推理。与固定共享块复用相比,该机制把深度决策与状态相关变换解耦,使简单输入提前终止而复杂输入保留精修能力。在 VCTK-DEMAND 测试集上,阈值 0.50 配置宽带感知语音质量评估(Wideband Perceptual Evaluation of Speech Quality,WB-PESQ)为 3.37,短时客观可懂度(Short-Time Objective Intelligibility,STOI)为 95.67%,参数量 0.67 M,平均计算量 20.73 GMACs/s,相对 MP-SENet 参数量下降 70.4%、计算量下降 51.3%。结论限于该数据集与该骨干的输入相关早退有效性,跨噪声、跨语言与跨架构泛化尚未验证。训练需展开最大深度并附加路由与控制损失,推理成本随阈值变化,原文未披露训练时长、硬件与实测延迟。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 边听边说还要调工具:NemotronLabs VoiceChat 如何把全双工对话与函数调用装进一个流式系统

原论文 Figure 1:NemotronLabs VoiceChat Architecture Overview.

英文题目:NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities

标签:#全双工语音交互 | #端到端学习 | #语音识别 | #文本到语音 | #流式处理

评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Jagadeesh Balam:机构信息未在 arXiv HTML 中可靠披露
  • Travis Bartley:机构信息未在 arXiv HTML 中可靠披露
  • Edresson Casanova:机构信息未在 arXiv HTML 中可靠披露
  • Sanjay Chauhan:机构信息未在 arXiv HTML 中可靠披露
  • Chen Chen:机构信息未在 arXiv HTML 中可靠披露
  • Zhehuai Chen:机构信息未在 arXiv HTML 中可靠披露
  • Zijia Chen:机构信息未在 arXiv HTML 中可靠披露
  • Francesco Ciannella:机构信息未在 arXiv HTML 中可靠披露
  • Slyne Deng:机构信息未在 arXiv HTML 中可靠披露
  • Mikyas Desta:机构信息未在 arXiv HTML 中可靠披露
  • Harishchandra Dubey:机构信息未在 arXiv HTML 中可靠披露
  • Slim Essid:机构信息未在 arXiv HTML 中可靠披露
  • Nourchene Ferchichi:机构信息未在 arXiv HTML 中可靠披露
  • Boris Ginsburg:机构信息未在 arXiv HTML 中可靠披露
  • Mariana Graterol Fuenmayor:机构信息未在 arXiv HTML 中可靠披露
  • Negar Habibi:机构信息未在 arXiv HTML 中可靠披露
  • Kevin Hu:机构信息未在 arXiv HTML 中可靠披露
  • Anand Joseph:机构信息未在 arXiv HTML 中可靠披露
  • Viraj Karandikar:机构信息未在 arXiv HTML 中可靠披露
  • Myungjong Kim:机构信息未在 arXiv HTML 中可靠披露
  • Viacheslav Klimkov:机构信息未在 arXiv HTML 中可靠披露
  • Seelan Lakshmi Narasimhan:机构信息未在 arXiv HTML 中可靠披露
  • Lily Lee:机构信息未在 arXiv HTML 中可靠披露
  • Jason Li:机构信息未在 arXiv HTML 中可靠披露
  • Eileen Long:机构信息未在 arXiv HTML 中可靠披露
  • Ameya Mahabaleshwarkar:机构信息未在 arXiv HTML 中可靠披露
  • Aditya Malte:机构信息未在 arXiv HTML 中可靠披露
  • Adi Margolin:机构信息未在 arXiv HTML 中可靠披露
  • Sasha Meister:机构信息未在 arXiv HTML 中可靠披露
  • Valentin Mendelev:机构信息未在 arXiv HTML 中可靠披露
  • Oluwatobi Olabiyi:机构信息未在 arXiv HTML 中可靠披露
  • Ankita Pasad:机构信息未在 arXiv HTML 中可靠披露
  • Yifan Peng:机构信息未在 arXiv HTML 中可靠披露
  • Elena Rastorgueva:机构信息未在 arXiv HTML 中可靠披露
  • Jayda Ritchie:机构信息未在 arXiv HTML 中可靠披露
  • Jason Roche:机构信息未在 arXiv HTML 中可靠披露
  • Nikhil Srihari:机构信息未在 arXiv HTML 中可靠披露
  • Yuanhang Su:机构信息未在 arXiv HTML 中可靠披露
  • Yoshi Suhara:机构信息未在 arXiv HTML 中可靠披露
  • Viet Anh Trinh:机构信息未在 arXiv HTML 中可靠披露
  • Jinhan Wang:机构信息未在 arXiv HTML 中可靠披露
  • Piotr Zelasko:机构信息未在 arXiv HTML 中可靠披露
  • Hui Wang:机构信息未在 arXiv HTML 中可靠披露
  • Puhui Meng:机构信息未在 arXiv HTML 中可靠披露
  • Chaosen Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Yunsheng Liu:机构信息未在 arXiv HTML 中可靠披露
  • Shawn Wang:机构信息未在 arXiv HTML 中可靠披露
  • Wenjing Li:机构信息未在 arXiv HTML 中可靠披露
  • Zhonglei He:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为16 kHz用户连续语音流与含工具定义的系统提示,输出为同步的智能体语音流、增量用户转写与结构化工具调用,难点在于边听边说时的帧级轮次控制、打断与反向通道容忍,以及工具执行期间不破坏对话时间线。方法链第一步由流式语音编码器按80 ms帧连续编码用户音频并送入解码器语言模型跟踪对话演进,其隐状态同时进入第二步的双通道并行解码,分别生成智能体文本流与函数调用标记流,文本流右对齐到声学时间轴并延迟两帧提供前视,而函数通道不延迟以保留调用真值位置。第三步中独立RNN-T分支基于感知表征增量输出用户转写以支撑端点回退,流式TTS解码器跟随文本时间线持续发声并在工具执行期播放预设填充话术,待工具返回后经fast-inject将结果强制插入函数通道恢复响应生成。与将动作序列化到同一自回归通道的已有方案不同,本文用加权融合与独立函数头实现双通道并行解码并以填充监督抑制误触发。在 Full-Duplex-Bench 1.0 上暂停误抢率降至 15.3%与 25.5%,打断接管率 100%且打断后质量 4.33/5;在 Full-Duplex-Bench 3.0 真人口吃语音上工具选择 F1 达到 82.5%,超过 Gemini Live 3.1 的 81.7%,而在 VoiceBench 上获得 55.1 的归一化平均分。该结论仅适用于约两分钟内上下文、每会话不超过 5 个工具与中低噪声条件,长工具延迟、多工具并行与执行期打断尚未解决。其适用边界受限于两分钟内上下文与中低噪声训练增强范围,长延迟工具与执行期打断等失败条件仍尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 证据越远越难用:Vox-Infinity 按所需历史时长检验语音长上下文

原论文 Figure 5:Prompt template for QA generation.

英文题目:Vox-Infinity: Benchmarking the Limits of Long-Context Spoken Language Models

标签:#音频问答 | #基准设计 | #长音频处理 | #语音 | #语音情感识别

评分:7.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Xize Cheng:机构信息未在 arXiv HTML 中可靠披露
  • Wenxu Jia:机构信息未在 arXiv HTML 中可靠披露
  • Chenyuhao Wen:机构信息未在 arXiv HTML 中可靠披露
  • Dongjie Fu:机构信息未在 arXiv HTML 中可靠披露
  • Zehan Wang:机构信息未在 arXiv HTML 中可靠披露
  • Xinyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Tao Jin:Zhejiang University

📌 核心摘要

本文面向长上下文口语问答,输入为数分钟多轮语音历史加最终语音查询,输出为开放式或选择式答案,难点是语音编码密度低导致序列极长且语义与韵律线索交织易被遗忘。构建链分三步:先由真实语料沿轮次数量与单轮时长扩展出超多轮对话、个人独白与超语义对话三类场景,再用大模型按全对话生成问题并标注必需引用轮次以定义所需历史时长,最后经人工核查答案唯一性与证据溯源后按时长分箱组卷。相对已有音频基准只比总时长的做法,该设计以证据距离而非会话长度组织评估并分离词汇与声学情绪线索。在超多轮对话场景下,文本历史条件下Qwen3-Omni的准确率为84.8%,高于音频历史条件下Qwen3-Omni的准确率55.0%。结论限于数分钟级对话与转写加持的评测协议,对小时级会议与流式交互的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 耳朵只认内容、方向另学一路:Bearings 把声场与声学拆开预训练

原论文 Figure 1:Bearings overview. (A) Self-supervised pre-training: a masked ViT encodes seven-channel FOA…

英文题目:Bearings: Self-Supervised Soundfield Embeddings from First-Order Ambisonics

标签:#联合声音事件检测定位 | #自监督学习 | #空间音频信号 | #预训练 | #多通道

评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Goksenin Yuksel:机构信息未在 arXiv HTML 中可靠披露
  • Marcel van Gerven:机构信息未在 arXiv HTML 中可靠披露
  • Kiki van der Heijden:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

单通道自监督编码器仅能判别存在何种声音事件而无法估计声源方向,联合声音事件检测定位需从一阶Ambisonics同时输出类别与到达方向,而真实混响与多源重叠使空间线索与内容纠缠难以解耦。Bearings先从FOA提取四路对数梅尔谱加三维归一化有源强度向量的7通道时频特征并做管状掩码切分,仅可见块经6层ViT声场编码器得到声场嵌入。接着冻结单通道声学编码器提供内容嵌入,4层解码器经交叉注意力融合两流并在掩码位置重建量化方向分布与50ms和350ms双尺度扩散度,以声学条件迫使编码器只学习空间残差。下游保持声场与声学编码器双冻结,经频率注意力池化与重采样对齐到100ms标签网格后由轻量线性融合头送入双向GRU SELD头输出ACCDOA向量,实现可替换声学主干的外挂复用。与GRAM-Ambisonics等将内容与空间纠缠于同一主干不同,该设计把空间表示解耦为独立流,更换更强单通道模型时无需重复空间预训练。在TAU-NIGENS 2021评测任务下,GRAM-Clean加Bearings融合模型的位置相关F-score分数F20°为50.4,高于单通道声学基线的F20°2.8。结论限于 FOA 输入与短时静态评估协议,对多声源重叠和高混响泛化尚未充分验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. 把旋转和镜像写进网络:EquiSELD 如何用标量加向量做等变声事件定位与检测

原论文 Figure 1:EquiSELD architecture. Five invariant scalar features (orange) and two equivariant intensity…

英文题目:EquiSELD: Efficient training of equivariant sound event localization and detection networks

标签:#联合声音事件检测定位 | #注意力机制 | #空间音频信号 | #多通道 | #鲁棒性

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Goksenin Yuksel:机构信息未在 arXiv HTML 中可靠披露
  • Marcel van Gerven:机构信息未在 arXiv HTML 中可靠披露
  • Kiki van der Heijden:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

声音事件定位与检测(Sound Event Localization and Detection,SELD)以一阶 Ambisonics(First-Order Ambisonics,FOA)为输入,需同时输出事件类别活性与到达方向(Direction of Arrival,DOA),场景旋转或反射应只改变方向而不改变事件本身。EquiSELD 先将每时频 mel 单元拆为不变标量与等变强度向量,再经频率注意力与池化压缩频带,接着做时间与音轨间注意力建模,最后由 Multi-ACCDOA(Multi-track Activity-Coupled Cartesian DOA)读出不变幅度与等变方向。相对依赖旋转增强的普通网络与 Clebsch-Gordan 型等变网络,该机制把全部注意力权重与非线性限制在不变流,向量流只保留跨通道线性混合,从而获得严格 O(3) 等变。在含实测房间脉冲响应的合成场景 TAU2021 上其综合得分 \(\mathcal{E}_S=0.40\),优于最强增强基线的 \(0.47\) 与旧等变网络的 \(0.51\);在真实场景 STARSS23 上为 \(0.56\),优于最强基线的 \(0.60\) 与旧等变网络的 \(0.72\)。该结论限于一阶 Ambisonics、短片段监督训练与两套评测集,仰角先验利用与高阶 Ambisonics 扩展尚未验证。训练成本为单卡 A100 上约 0.77 小时,参数量为 2.25M,推理时延与部署开销原文未披露。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 词错率好看却漏掉关键信息:口音对话中实体与填充词如何被找回

原论文 Figure 1:Overview of the proposed three-stage pipeline: Stage 1: Heuristic SQL filters select entity-rich…

英文题目:Beyond WER: Entity and Disfluency Recall in Accented Conversational ASR

标签:#语音识别 | #LoRA | #语音 | #数据集构建 | #教育

评分:6.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Fiza Husain:机构信息未在 arXiv HTML 中可靠披露
  • Ankit Pandey:机构信息未在 arXiv HTML 中可靠披露
  • Yash Singh:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

面向印度、印度尼西亚和拉美口音的学习者自发英语对话,输入为对话音频,输出需同时给出保留填充词的逐字稿和修正实体拼写的教学稿,难点是口音变异大、实体稀疏且商业系统为降词错率而主动丢弃不流利片段。该工作先用词法启发式从生产日志中筛出实体密集话语并以Gemini 2.5 Pro听音频生成银标准双稿参考,再以区域独立的低秩适配微调Qwen2.5-Omni-3B实现单次前向双稿输出,最后用大模型判分器按六类错误做残差诊断,前序数据分布直接决定后序监督重心。与后处理检索纠错不同,该路线在训练时重塑数据分布且推理时不依赖外部知识库,兼顾实体可懂度与流利度评估。在约6k条三区域测试集上,微调后实体召回达到80-85%,填充词召回达到76-86%,词错率降至6-10%,显著高于原生产模型Parakeet并持平零样本Qwen3-Omni-30B。结论限于英语学习对话场景,银标准参考、封闭填充词表与代码切换未验证制约外推。经vLLM部署的P95延迟约为800 ms,单区域适配训练约需单卡6小时。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 参数减三成而精度不掉:低秩频率卷积把噪声范围调对再谈边缘实时

英文题目:Low-Rank Frequency Convolution and Noise-Range Augmentation for Real-Time Pitch Estimation on Edge Devices

标签:#音高与旋律提取 | #模型压缩 | #数据增强 | #端侧运行 | #实时处理

评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Venkat Suprabath Bitra:机构信息未在 arXiv HTML 中可靠披露
  • Homayoon Beigi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

单音基音估计需从单帧可变Q变换幅度谱直接输出基频分箱,在边缘端同时受闪存、10 ms帧周期与室内噪声三重约束。方法链分三步衔接:先将269分箱四通道幅度视图送入10个频率轴扩张卷积块,每个宽卷积被拆为经秩M=9瓶颈的因子对,前因子B以5点扩张卷积降维输出瓶颈特征,后因子A以1点卷积升维回传,瓶颈内通道轴均方根归一化输出直接作为升维输入并叠加残差。接着在变换域按功率归一化加性混合噪声,每样本独立抽样幅度比覆盖从干净到设定下限的连续区间以构造训练分布,最后以离散分箱分类输出单帧基频。与半正交低秩时延神经网络的关键差异是瓶颈内保留归一化而不施加半正交约束,且全程无时序上下文可单帧推理,因而归一化已调节尺度时再加约束反而损失精度。将训练噪声下限从 \(+6.02\) dB 降至 \(-20.00\) dB,低秩模型在 \(-20\) dB 评测下原始音高准确率(Raw Pitch Accuracy,RPA50)从 2.44 提升至 22.41,代价是干净音频损失 0.35 点。在MDB留出集评测下,低秩模型的RPA50为99.07,高于FrCN基线的RPA50 98.98。其适用边界受限于仅在参考浊音帧上评测且未提供发声判决,-20 dB下最佳结果仍远未可用而前端变换延迟已超过模型本身,需前置声源分离而非仅调增强范围。自研 C 内核仅需 83 kB 磁盘占用且除 libc 与 libm 外无运行时依赖,原文未披露训练硬件与训练时长。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 把对齐做成链路预测:异构图如何把文本知识搬进语音词表示

英文题目:Low resource cross-modal alignment using HGNN to enhance speech representation

标签:#音频检索 | #图神经网络 | #多模态学习 | #低资源 | #语音

评分:6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yannick Yomie Nzeuhang:Department of computer sciences, University of Yaounde I, Street, Yaounde, 812, Cameroon
  • Marie Tahon:IRD, UMMISCO, Street, Bondy, F-93143, France
  • Paulin Melatagia Yonta:Department of computer sciences, University of Yaounde I, Street, Yaounde, 812, Cameroon;LIUM, Le Mans Université, Avenue Olivier Messiaen, Le Mans, 72085, France

📌 核心摘要

该任务输入为词级语音片段及其转写,输出为向文本空间靠拢的增强定长语音词表示,难点是低资源语言缺乏大规模平行语料与算力,无法微调数亿参数声学编码器。方法链分三步:先构建声学子图、语言子图与跨模态连接组成的异构图,将同词强连接与异词转写相似度编码为边权,并用最大生成树过滤声学子图冗余边;再用单层 GraphSAGE 异构图神经网络做均值邻域聚合,使声学节点前向吸收文本邻居信息,语言侧表示冻结只推动声学侧移动;最后联合二值交叉熵链路回归、跨模态 InfoNCE 对比与声学内 InfoNCE 对比损失优化链路预测头。与 SAMU-XLSR 式整体微调学生编码器不同,该机制靠显式传边实现教师到学生知识迁移,更轻量可释。在Yemba归纳设置下,XLSR+HGNN+LaBSE的平均词重叠WO@5指标为20.0%,高于SAMU-XLSR的平均词重叠WO@5指标的0.0%。该结论限于词级孤立词检索与类内类间相似度内禀指标,未验证句子级与识别合成下游收益。该适用边界意味着跨语种与跨任务外推仍需谨慎检验。训练成本为 9M 参数、32 CPU 上 TIMIT 约 23 分钟、Yemba 约 2 小时、1000 轮迭代,远低于基线的 300M 参数、32 块 V100 与 6.8K 小时数据。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 先分清谁在说话、再转写说什么:Transsion 级联式多语说话人归属转写系统解读

英文题目:Transsion’s Speaker-Attributed Multilingual ASR System for the MLC-SLM 2026 Challenge

标签:#语音识别 | #LoRA | #说话人分离标注 | #多语言

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Zhecheng Ren:机构信息未在 arXiv HTML 中可靠披露
  • Xuanji He:机构信息未在 arXiv HTML 中可靠披露
  • Xiaoxiao Li:机构信息未在 arXiv HTML 中可靠披露
  • Zhichen Han:机构信息未在 arXiv HTML 中可靠披露
  • Gaoyang Dong:机构信息未在 arXiv HTML 中可靠披露
  • Gaosheng Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Minchuan Chen:机构信息未在 arXiv HTML 中可靠披露
  • Fengjie Zhu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

MLC-SLM 2026任务1要求在无预切分、无说话人标签条件下,对14种语言、21种变体的双人会话同时完成转写与说话人归属,难点在于自发停顿与快速轮转使识别错误和说话人分离标注(speaker diarization,SD)错误相互耦合。所提级联系统分两路并行:一路由局部端到端分离标注加全局聚类恢复说话人时间线,另一路将长录音切块后用Qwen3-Omni转写,再由CTC对齐模型给出词或字级时间戳,最后融合模块按时间重叠把词回填到说话人段。与端到端联合建模相比,该设计保留了大语音语言模型的转写能力,又避免说话人标签直接干扰解码。在官方评测集上,最终系统以时间约束最小置换混合错误率(time-constrained minimum-permutation mixed error rate,tcpMER)15.41%位列第2,明显优于同文微调的端到端对照。该结论仅在安静室内手机采集的双人会话上验证,对重叠密集、噪声远场或更多说话人的外推尚未证明。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 先锁定结论语义再推理:SPARE 如何把长思维链拉回音频

原论文 Figure 1:Overview of the SPARE training framework.

英文题目:Enhancing Audio Reasoning via Semantic Summary Prediction

标签:#音频问答 | #正则化 | #音频大模型 | #0 样本

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Francesco Bonzi:机构信息未在 arXiv HTML 中可靠披露
  • Pooneh Mousavi:机构信息未在 arXiv HTML 中可靠披露
  • Cem Subakan:机构信息未在 arXiv HTML 中可靠披露
  • Mirco Ravanelli:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

大型音频语言模型显式思维链推理时常出现推理差距,长推理逐渐偏离声学证据而依赖已生成文本,导致幻觉与逻辑漂移。本文以SALMONN 13B为基座研究音频问答,输入为问题加音频加选项,输出为分章推理与最终结论。方法SPARE先在上下文后推理前插入寄存器令牌并用因果掩码隔离其对后续的影响,再用冻结句向量编码器抽取结论语义目标。最后以余弦距离把寄存器末层状态拉向该目标并与交叉熵联合优化,权重为二点零,迫使早期自注意筛选结论相关声学特征。相比局部多词预测只建模邻近偏移,该设计用终点语义做自顶向下约束,为推理提供 grounded起点并在推理时丢弃寄存器与投影头。在MMAU基准零样本评测下,SPARE的准确率为58.03%,高于SFT基线的准确率54.65%。该结论适用边界受限于SALMONN 13B与YouTube8M加AF-Think子集验证,尚未验证可迁移到已含推理监督的大模型,且多寄存器变体存在不稳定等失败条件。推理开销方面原文称推理时丢弃辅助参数而无额外计算量,但训练成本未见系统披露。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 少看一点反而写得更好:用一个旋钮控制流式解码器能看多少

原论文 Figure 1:(a) Offline BLEU-4 versus \\gamma; blue dashed is the full-exposure baseline.

英文题目:Reading Less While Writing: A Closed-Form Bandwidth Dial for Streaming Multimodal Decoders

标签:#语音识别 | #注意力机制 | #流式处理 | #形式化分析

评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yasir Mehmood:机构信息未在 arXiv HTML 中可靠披露
  • Kashif Javed:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

流式跨模态解码需在视频或音频到达的同时逐词生成文本,固定前瞻既会因源端洪流稀释早期决策注意力,又难以兼顾长短与快慢不同的输入几何。ZENDAYA先由辅助长度头预测有效目标长度,该预测长度进入归一化进度幂律以计算每步源端可见horizon,再由该horizon经交叉注意力掩码逐层约束解码以保证非递减零泄漏依赖,最后将有限片段机制推广为按窗口携带历史文本的无界流式推理且仅改动损失掩码。与固定等待偏移相比,其窗口随实例预测长度自适应收缩或前伸,平均暴露量服从闭式预算因而兼具延迟旋钮与暴露预算意义。在Charades-STA流式任务下,ZENDAYA在γ=0.2时的METEOR指标为0.2279,高于wait-40的METEOR指标0.2210。该结论的适用边界受限于已测的三语料几何与窗口同步条件。结论仅在窗口同步到达与所测三语料几何内成立,异步链路已证明但未测量,学习型自适应策略尚未对比。训练在单个T4上完成但未披露时长与吞吐等部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 复刻缺全流程代码的乐器分离模型:性能差距与能量代价从何而来

原论文 Figure 1:Training the base model on the vocals track, with a patience of 10 (left) or 30 (right).

英文题目:Investigating the Performance and Energy Costs of Replicating Band-Split RNN for Music Source Separation

标签:#音乐源分离 | #RNN | #音乐 | #开源工具

评分:6.4/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Paul Magron:机构信息未在 arXiv HTML 中可靠披露
  • Romain Serizel:Université de Lorraine, CNRS;Inria, LORIA, F-54000 Nancy, France
  • Constance Douwes:Centrale Med, Aix Marseille Univ;CNRS, LIS, Marseille, France

📌 核心摘要

音乐源分离输入为44.1kHz立体声混音的复数短时傅里叶变换,输出为人声、贝斯、鼓与其他四路时域波形,频谱重叠、混响与长时音乐依赖交织,且官方缺失预处理与训练脚本使可复现性成为实际难点。复刻链第一步由频带切分投影按乐器特定的变带宽划分频带并映射至潜空间,其潜特征进入第二步的序列与频带建模。序列与频带建模交替堆叠双向长短期记忆残差网络分别捕捉时间与频带依赖,其输出送入第三步掩码估计。多层感知机为各子带预测复掩码并拼成全带掩码,与混合频谱相乘后经逆变换重建波形,再以时域与频域联合损失及随机混音训练,相对已有包模型与私有数据方案的关键差异在于乐器特定切分与公开流程重建。在MUSDB18-HQ测试集上,替代数据策略的大模型组块信失真比(chunk SDR,cSDR)平均为7.87 dB,低于原论文8.24 dB,差距集中在其他声部。该结论仅适用于44.1 kHz四乐器设定与museval评测,未验证跨数据集与主观听感外推。论文用绿色算法估算讨论模型训练耗电为33 MWh,总项目耗电为24.2 MWh,约为最优单模型训练的53倍。该复刻适用边界受限于上述语料与硬件条件,其跨场景泛化尚未验证,而延长早停耐心的训练成本与硬件开销明显增加。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 能解码不等于在用:语音拒绝的因果落点在文本主干的中后段

原论文 Figure 1:Ablation localizes the margin effect to an LM band.

英文题目:Causal Localization of the Refusal Direction in Audio Language Models

标签:#音频问答 | #评测协议 | #可解释性 | #语音 | #音频大模型

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Leonardo Haw-Yang Foo:机构信息未在 arXiv HTML 中可靠披露
  • Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

大型音频语言模型将语音前端接到已安全对齐的文本主干,当有害语音请求被拒时难以判断拒绝依赖音频通路还是继承文本能力,且首词元边际与长回复行为未必一致,定位需因果证据而非可解码性。方法第一步将有害与领域匹配良性提示经同一语音合成转为音频对,并在训练侧隔离四类有害类别以构造组别偏移评估。 第二步在投影器帧均值与语言模型残差读出位置分别拟合有害减良性均值差的一阶秩一方向,其输出作为待干预坐标。第三步逐点单层消融该方向并以首词元拒绝边际变化为读数,用随机方向对照区分因果必要性。相对已有探针与全层消融,该设计以类别隔离拟合评估、单层独立干预与文本骨干互迁移对照,将可解码性与因果依赖分开检验并检验跨模态复用。在组别隔离评估设置下,LM L16消融的指标边际变化ΔG为-7.10,低于投影器方向的指标边际变化ΔG -0.013。该结论适用边界受限于一阶秩一方向与首词元边际,不排除分布式或非线性音频机制,且边际搬动在多模型上未必改写长回复,人类实录语音尚未验证。原文未披露训练、推理或部署成本

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 唱歌头比说话头难在哪:Hi-Singers 用 170 小时野外数据补节奏与表情缺口

原论文 Figure 1.:The framework diagram of the data processing workflow illustrates the entire process from raw…

英文题目:Hi-Singers: A Comprehensive High-Quality Dataset for Expressive Audio-Driven Singing Head Synthesis

标签:#音视频生成 | #数据集构建 | #音视频 | #数据集 | #基准测试

评分:6.2/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yichi Zhang:University of Science and Technology of China, Hefei, China
  • Hui Zhang:University of Science and Technology of China, Hefei, China
  • Guanjun Liu:University of Science and Technology of China, Hefei, China
  • Yuefeng Zou:University of Science and Technology of China, Hefei, China
  • Fengzhao Sun:University of Science and Technology of China, Hefei, China
  • Jun Yu:University of Science and Technology of China, Hefei, China

📌 核心摘要

该任务以歌唱音频加单张人像为输入,输出口型同步且表情夸张、头部随节拍运动的人脸视频,难点在于伴奏干扰下的音视对齐、大张合咬字与严格节拍同步。所提方案是不设计新生成器,而建三阶段离线数据工厂:原始采集与预处理统一为 1080p 以上、25 fps 视频与 16 kHz 音频并转码为 H.264 后切片;自动化过滤依次做头部区域处理、运动特性过滤与人脸质量处理;人工过滤围绕歌唱内容相关性、美学质量、运动稳定性、咬字清晰度与人脸质量分做加权评分决定入选。相对 HDTF、TalkVid 等说话头数据,该路线把节拍对齐作为显式筛选与评测目标,更强调可学动态先验而非仅静态清晰度。在保留的 200 片段平衡测试集上,Hallo 经该数据训练后取得 23.15 的弗雷歇 inception 距离 (Fréchet Inception Distance,FID)、181.42 的弗雷歇视频距离 (Fréchet Video Distance,FVD)、7.72 的唇同步置信度 (Sync-C) 与 0.168 的节拍对齐分数 (Beat Alignment Score,BAS),同步优于通用权重基线。在200片段平衡基准下,Hallo(Hi-Singers)的节拍对齐分数为0.168,高于Hallo(Original Weights)的节拍对齐分数0.139。该结论的适用边界受限于中英双语流行主导的正向稳定特写,侧脸遮挡、舞蹈演奏大位移与极端妆造构成失败条件被系统性丢弃,域外泛化与显著性检验尚未验证。训练成本为8卡NVIDIA A100集群上每配置约一周收敛的硬件开销,原文未披露推理开销与部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 离散还是连续:语义约束决定音频理解上限

原论文 Figure 1:The UniARC evaluation framework. The modular design supports flexible configurations of encoders,…

英文题目:Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

标签:#音频理解 | #基准设计 | #统一音频模型 | #模型比较

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Jing Peng:机构信息未在 arXiv HTML 中可靠披露
  • Zichao Nie:机构信息未在 arXiv HTML 中可靠披露
  • Zhisheng Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Jingran Xie:机构信息未在 arXiv HTML 中可靠披露
  • Zhiyong Wu ID:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

统一音频理解要求同一大型音频语言模型处理语音转写、环境声分类与音乐描述等异构输入并输出文本,难点在于声学保真与语言推理空间的跨域对齐方式尚无定论且易受预训练偏置影响。本文构建统一音频表示比较框架UniARC,先将连续特征或离散索引统一映射为投影器可读嵌入,再经轻量微调或冻结主干探测送入大语言模型生成答案,最后跨数据量与模型规模系统比较语义密度与训练效率。与重建导向编解码器保留波形细节的机制不同,语义约束型表示更易与文本推理对齐,因而离散与连续之争实质是语义兼容性之争而非单纯保真度之争。在SmolLM2-135M微调下Whisper总体得分为0.735,显著高于Wav2Vec2的0.418,冻结Llama-3-1B探测中WavLM在UrbanSound8K上准确率为69.89%,而DAC在SLURP上仅为7.90%。该结论适用于理解类任务,不适用于高保真重建或生成,且未验证长音频、噪声鲁棒与多轮对话外推。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 整场会议的自回归日志:事件式输出更稳,跨段身份仍需显式链接

原论文 Fig. 1:Overview of the ESPnet-SpeechLM training sequence with single-stream task-output organization.

英文题目:Speech Language Models for Full-Meeting Speaker Diarization: Capabilities and Limitations

标签:#说话人分离标注 | #自回归模型 | #语音活动检测 | #重叠语音检测 | #会议转录

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jialu Li:College of Information Science, University of Arizona, Tucson, AZ, USA Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA
  • Jinchuan Tian:College of Information Science, University of Arizona, Tucson, AZ, USA Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA
  • Shinji Watanabe:College of Information Science, University of Arizona, Tucson, AZ, USA Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA

📌 核心摘要

完整会议说话人分离标注要求对整场远场多人会议录音输出谁在何时说话的时间边界与整场一致的说话人身份,难点在于长时依赖、重叠语音漏检与独立分窗解码导致的跨窗身份置换与说话人混淆。该工作以ESPnet-SpeechLM解码器为骨干,将输入波形编码为每帧八个神经编解码器令牌加一个XEUS自监督令牌,再以语音活动检测先给出粗粒度语音起止,为后续重叠检测提供语音区约束。随后按语音活动检测到重叠语音检测再到分离标注的由粗到精顺序在单流中自回归生成结构化事件令牌,最后用基于WeSpeaker嵌入的VBx聚类完成跨窗说话人链接并输出整场假设。与紧耦合自动语音识别并用词级归属评价的已有语音语言模型方法相比,该机制差异在于剥离识别并用零容忍含重叠整场错误率直接诊断时间结构与身份追踪,具有独立评估意义。在AMI评测设置下,事件表示链的错误率为24.40%,低于帧表示的错误率56.94%。其适用边界是语音语言模型仅提供局部时间假设,跨窗身份一致性与重叠区漏检仍受限并依赖外部链接与更强重叠建模,尚未验证超长会议外推。训练成本方面原文披露在单个英伟达H100图形处理器上微调十轮并在单个A100图形处理器上做模拟数据域自适应,所用硬件明确但未给出延迟与吞吐。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 从干净音素到真实唇读错误:用三阶段课程让重建模型适应噪声

原论文 Figure 1:Overview of the proposed PECT framework.

英文题目:Curriculum-Based Noise Adaptation for Phoneme-to-Text Reconstruction in Visual Speech Recognition

标签:#静默语音接口 | #课程学习 | #大语言模型 | #鲁棒性

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Matthew Kit Khinn Teng:机构信息未在 arXiv HTML 中可靠披露
  • Haibo Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Takeshi Saitoh:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音素中心视觉语音识别(Visual Speech Recognition,VSR)需先从唇动视频预测音素序列,再由重建模型恢复自然语句,而视觉歧义与协同发音使预测音素在推理时高度含噪,与干净训练条件严重失配,迫切需要面向真实误差的重建鲁棒性。该工作提出渐进误差课程训练(Progressive Error Curriculum Training,PECT),先用合成插入删除替换扰动建立容错映射,再用多域伪标签适配真实视觉误差统计,最后用目标域外折伪标签对齐目标词表与误差分布,三阶段输出逐级作为下一阶段初始化并在推理时直接承接视觉前端预测,以NLLB编码器解码器为重建主干并逐阶段十倍降低学习率。相比静态混合噪声或单阶段训练,其关键差异在于按真实度排序监督而非同时暴露,从而先稳定后适配,并使学到的纠错模式可跨视觉前端泛化,具有更强的实际可迁移意义。在LRS2上HP-VSR-FiLMFuse(L4)的词错误率(Word Error Rate,WER)由23.3%降至22.2%,在LRS3上HP-VSR-ResFiLM由30.3%降至29.7%。该结论仅适用于英语ARPAbet音素到文本重建且依赖一阶段音素质量,当否定词或连续关键音素丢失时仍不可恢复。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 先分证据再定修复模式:稀疏、突发与密集专家的时序路由

原论文 Fig. 1:Row-normalized held-out TEST confusion matrix for the final Viterbi-decoded router.

英文题目:Signal-Informed Temporal Routing for Vinyl Defect Regime Detection

标签:#音频事件检测 | #混合专家模型 | #信号处理 | #音乐 | #统计分析

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yi-Hung Kan:机构信息未在 arXiv HTML 中可靠披露
  • Homayoon Beigi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

黑胶修复需先将每帧路由至干净、稀疏点击、宽突发、致密爆裂声或混合重叠中的一种,再选择插值、修复或去噪,难点在于音乐瞬态与损伤形态相似且损伤密度跨度大。本文前端用线性预测残差与曲率构造核心分值并训练三个独立二值专家分别输出稀疏、突发与致密证据,后端将专家概率、置信交互与局部时序统计拼接后经分层多层感知机得到发射概率,再经混合门控与验证选择的转移惩罚做维特比解码输出稳定序列。在597个合成片段留出测试集评估设置下,完整系统的五分类宏F1指标为0.730,高于扁平帧级路由器的五分类宏F1指标0.687。干净与致密帧高度可靠而稀疏、突发与混合仍模糊,合并前两者为脉冲类后四分类宏F1更高。该结论的适用边界受限于受控合成语料与离线非因果解码场景。结论仅适用于受控合成损伤与离线非因果处理,真实磨损、更多曲目与因果流式均未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 把回声方向看成概率密度:球谐域切片 Wasserstein 如何搬运声源与反射

英文题目:Spherical Harmonic Sliced Wasserstein Displacement Interpolation for Acoustic Source and Reflection Density Modeling

标签:#声场重建 | #信号处理 | #空间音频信号 | #麦克风阵列

评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yuancheng Luo:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文输入为两端空间房间脉冲响应(Spatial Room Impulse Response,SRIR)在时长上聚合后的声源与反射方向样本,输出为中间源位置处连续演化的球面回声密度,用于解决移动声源下多径方向分布难以线性插值的问题。方法链分为三步:先以幅度平方和(Sum-of-Magnitude-Square,SOMS)球谐展开构造非负带限密度,再用平方和半定规划(Sum-of-Squares Semidefinite Programming,SOS-SDP)做最大似然估计并经特征分解降阶,最后对旋转后边缘累积分布做逆变换与切片Wasserstein最小二乘拟合得到插值密度。与线性混合直接淡入淡出能量、几何乘积只保留交集不同,切片位移插值沿大圆线性移动逆累积分布,因而能跟踪直达声与反射峰的空间迁移。在N=100均匀球面方向密度拟合评测设置下,最大似然模型的对数似然指标为-192.9,高于核密度估计的对数似然指标-222.5。结论目前仅适用于聚合掉时间的方向密度与镜像源仿真房间,未验证混响时间变化、真实阵列测量与大幅遮挡下的外推能力。该结论的适用边界受限于聚合掉时间的方向密度与镜像源仿真房间。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


28. 不训练生成器,只做部分编辑:PACE 在冻结表征里权衡口音与保留

原论文 Figure 1:Overview of PACE. Stage 1 performs an accent-predictive source update by estimating a…

英文题目:Partial Accent-Control Editing in Frozen Speech Representations for Accent Conversion

标签:#语音转换 | #检索增强 | #自监督学习 | #语音合成

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yangyang Qu:EURECOM Sophia Antipolis, France
  • Michele Panariello:EURECOM Sophia Antipolis, France
  • Massimiliano Todisco:EURECOM Sophia Antipolis, France
  • Nicholas Evans:EURECOM Sophia Antipolis, France

📌 核心摘要

非平行口音转换要求输入源说话人波形,输出贴近目标口音且保留内容与音色,但非平行参考无法提供帧对齐,强转换常损伤可懂度与说话人一致性。部分口音控制编辑框架先在冻结WavLM表征上估计口音预测子空间,再用非平衡最优传输估计源帧到目标口音库的加权参考并做约束性源端加性更新。随后在该子空间做top-k检索并在原始WavLM空间取平均参考特征,与编辑后源特征按融合权重融合,最后经固定kNN-VC后端合成波形。与训练口音条件生成器的做法不同,该方法将转换强度暴露为推理时可调的插值系数。在L2-ARCTIC的5000对跨口音协议下,PACE默认融合设置的准确率为39.0%,高于复现的DART的准确率28.2%,其WER为16.0%,低于复现的DART的WER29.7%。增大融合权重可提升分类器准确率却降低可懂度与说话人相似度,韩语目标上即使强替换仍仅约9.2%,说明其适用边界受限于目标口音与自动分类器口径。原文未披露训练、推理或部署成本,其结论尚未验证人耳感知下的口音强度与自然度外推。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


29. 声音不够时让文字来帮忙:用异构图把语言知识传给语音表示

英文题目:Enhancing speech representation learning with cross-modal knowledge transfer with HGNN under low resource settings: the case study of Yemba

标签:#音频分类 | #图神经网络 | #多模态学习 | #低资源 | #语音

评分:5.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yannick Yomie Nzeuhang:机构信息未在 arXiv HTML 中可靠披露
  • Paulin Melatagia Yonta:机构信息未在 arXiv HTML 中可靠披露
  • Marie Tahon:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为低资源孤立词语音及其词转写,输出为可用于识别与聚类的词级声学表征,难点在于Yemba等语言标注语音极少,传统特征与自监督表征难以泛化。方法链分四步:先以梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients,MFCC)构建声学子图并以音素包(bag of phonemes)构建语言学子图,再用在目标训练集上预训练的声学模型(Acoustic Model,AM)词后验搭建跨模态边形成异构图,接着用GraphSAGE均值聚合器做类型感知的消息传递,最后以节点分类交叉熵加声学邻接重构均方误差联合优化,并在归纳推理时为新语音节点动态加边。与在参数层面隐式共享的多语言自监督方法不同,该工作把语言学节点作为一等图实体并以显式边权重控制流向声学节点的信息。在Google Speech Commands精简集上跨模态表征的孤立词准确率为72.3%,相对MFCC基线49.0%与声学单模态图卷积网络(Graph Convolutional Network,GCN)66.3%均有提升。该结论目前仅在8词英语与13词Yemba孤立词任务及聚类指标上验证,尚未证明可外推到连续语音识别或大词表场景。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。