共分析 42 篇论文


⚡ 今日概览

✅ 筛选入选 42 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#文本到语音6 篇██████
#语音识别6 篇██████
#音频问答3 篇███
#说话人验证2 篇██
#音频分类2 篇██
#音频深度伪造检测2 篇██
#声场重建1 篇█
#声源定位1 篇█

📊 论文评分排行榜(42 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇MSI-Bench: Evaluating Multi-Speaker Voice Interaction…8.5前25%数据集与基准#语音对话系统
🥈MuLA-Bench: A Multilingual Long-Form Audio…8.3前25%数据集与基准#音频问答
🥉AURA: Uncertainty-Routed Activation Editing for…8.2前25%方法研究#语音识别
4.Corrective Forcing: Unified Post-Training for…8.2前25%方法研究#语音增强
5.MECT: Mixture of Experts with CNN-Transformer Network…8.1前25%模型报告#说话人验证
6.Listen, Critique, and Refine: RL-Based Self-Refinement…7.9前25%方法研究#文本到语音
7.ART-NAD: An Articulatory Inversion-based Neural…7.8前25%方法研究#语音可懂度评估
8.Generative Learning for Ambisonic Upscaling7.7前25%方法研究#声场重建
9.Entropy-aware logistic regression for fusion of large…7.6前25%方法研究#说话人验证
10.Audio-based UAV Localization with Adaptive Temporal…7.6前25%方法研究#声源定位
11.CycleSpeech: Reciprocal Alignment for Instruction…7.5前25%方法研究#文本到语音
12.OmniEcho: Spatial Audio Understanding for Embodied…7.4前50%数据集与基准#音视频问答
13.Synthesis and editing of multi-instrument audio…7.4前50%方法研究#音乐生成
14.Which Constraints Are Missing? Ask the Verifier…7.3前50%方法研究#符号音乐生成
15.TTS-Guard: Black-Box Ownership Verification of Text-to…7.3前50%方法研究#音频指纹
16.P2Flow: Phoneme-aware Progressive Flow Matching for…7.1前50%方法研究#语音超分
17.XSQ-AST: An Explainable Audio Spectrogram Transformer…7.1前50%系统技术报告#语音质量评估
18.ArtifactBench: Lineage-Aware Evaluation of AI…7.0前50%数据集与基准#音频深度伪造检测
19.Structure Before Sampling: Community-Aware Core-Set…7.0前50%方法研究#文本到语音
20.Automated Assessment of L2 Speech Rhythm Using Low…7.0前50%方法研究#语音属性识别
21.LiteCASS: A Lightweight End-to-End Network for Real…6.8前50%方法研究#音频分离
22.Misrecognition or Abstraction? Rethinking Outputs of…6.7前50%方法研究#音频分类
23.Vimarsha: Faithful ASR Evaluation for Indian Languages…6.7前50%数据集与基准#语音识别
24.Common Cause, Not Cross-Attention: Blocking Visual…6.6前50%方法研究#视频到声音生成
25.The Bairong System for MLC-SLM 2026: Dynamic Question…6.5前50%系统技术报告#音频问答
26.Reducing Speaker Residual by Considering Pinhole…6.5前50%方法研究#说话人匿名化
27.MoSAT: Human Motion Generation from Spatial Audio and…6.5前50%方法研究#音频理解
28.StreamTN: A Low-Latency Streaming Chinese Text…6.5前50%模型报告#文本到语音
29.NAVIR: Neuromorphic Audio-Visual Speech Recognition…6.5前50%系统技术报告#音视频语音识别
30.Synthetic speech detection in Brazilian Portuguese…6.4前50%方法研究#语音伪造检测
31.Morpho-VITS: Variational Inference with Morphological…6.4前50%方法研究#文本到语音
32.Fast Time-Varying Exponentiated Convolution Methods…6.4前50%方法研究#空间音频渲染
33.ToneCL: Contrastive Learning for Few-Shot Syllable…6.4前50%方法研究#音频分类
34.Beyond Encoder Fusion: Multi-View Discrete Token…6.3前50%方法研究#语音识别
35.Federated Multilingual Speech-LLMs: Architecture and…6.3前50%数据集与基准#语音识别
36.Listen Then Reason: Perception-Grounded Test-Time…6.2前50%方法研究#音频问答
37.HaikuS2S: A Cascaded System For Responding In Verse6.2前50%系统技术报告#文本到语音
38.Understanding Hyperspherical Geometry of ECAPA-TDNN…6.0前50%方法研究#语音转换
39.Long-Tail Rebalancing for Non-Verbal Vocalization…5.6前50%系统技术报告#语音识别
40.DFD-Lab: A Modular Audio-Visual Deepfake Detection…5.4后 50%系统技术报告#音频深度伪造检测
41.The design of an optomechanical microphone using a…5.1后 50%理论研究#音频质量评估
42.End-to-end Jordanian dialect speech-to-text self…5.1后 50%应用研究#语音识别

📋 论文列表

🖼️ 有图的论文会在这里展示首张原论文图;原图链接见对应独立页面。

🥇 多人同场说话时,助手先要判断该不该开口、再判断替谁做事

原论文 Figure 1:Overview of MSI-Bench. Rows are the three capability families; every cell is headed by its…

英文题目:MSI-Bench: Evaluating Multi-Speaker Voice Interaction for Collaborative AI Agents

标签:#语音对话系统 | #基准设计 | #多语言 | #人类参与评测

评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Chenxu Xiong:机构信息未在 arXiv HTML 中可靠披露
  • Dongming Shen:机构信息未在 arXiv HTML 中可靠披露
  • Yuzhi Tang:机构信息未在 arXiv HTML 中可靠披露
  • Wentao Ma:机构信息未在 arXiv HTML 中可靠披露
  • Mu Li:机构信息未在 arXiv HTML 中可靠披露
  • Alex Smola:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

多说话人语音交互(Multi-Speaker Interaction)的输入是含2至3个人类说话人的多轮混音语音场景与参与者上下文,输出是下一轮助手应答与可选工具调用,难点在于每句话的归属、权限、披露边界与约束优先级都随说话人变化。构建链分四步:输入固定说话人数、语言、主题、交互模式与声学素材,规划器生成角色阵容、故事线与背景声床,生成器扩展为以助手为目标的交接对话并派生原子量规与函数目录,合成器用克隆音色渲染并混入背景人声与突发噪声。相较既往全双工与说话人理解基准只评何时说话或答对问答,本文直接评在共享会话中该说什么与该做什么。与已有方法相比的关键机制差异是把记忆、指令遵循与推理拆为6种模式并绑定说话人范围的最小通过条件。在576例英文基准下,Gemini 3.1 Pro的全通过率(All-Pass Rate,APR)指标为66.8%,高于Qwen3-Omni-30B的全通过率(All-Pass Rate,APR)指标34.0%。该结论仅适用于中英双语合成脚本语音与单轮交接评测,未验证自发重叠、真实录音与长时协作下的外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 长音频不是更长,而是条件更多:MuLA-Bench 如何分离语言、证据与操作

原论文 Figure 3:Construction pipeline of MuLA-Bench.

英文题目:MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

标签:#音频问答 | #基准设计 | #多语言 | #长音频处理

评分:8.3/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Zeyu Yang:The Chinese University of Hong Kong, Shenzhen;Alibaba Token Hub, Alibaba Group
  • Xinyu Zhang:Alibaba Token Hub, Alibaba Group
  • Zibo Bi:Alibaba Token Hub, Alibaba Group;Xi’an Jiaotong University
  • Pei Zhang:Alibaba Token Hub, Alibaba Group
  • Xize Cheng:Alibaba Token Hub, Alibaba Group
  • Jin Xu:Alibaba Token Hub, Alibaba Group
  • Baosong Yang:Alibaba Token Hub, Alibaba Group
  • Satoshi Nakamura:The Chinese University of Hong Kong, Shenzhen

📌 核心摘要

该工作处理原生多语言长录音理解评测,输入为完整长音频与源语言开放问题,输出为需证据支撑的事实、推理、时序与远距答案,难点在于语言、领域、证据类型与操作需求交织且自然声学事件稀疏难控。构建链分四步推进:先按语言与领域组织原生录音并做字幕与配音清洗,再并行挖掘语义原子事实与验证自然声学事件,接着由解耦问答调用生成问题与独立求解答案,最后经自动捷径检验与单语专家回放审计定稿。相对翻译共享题干或注入目标声音的做法,该设计以语义轨道每语言乘领域格30题均衡布题支撑可比性,以声学轨道保留自然分布避免制造虚假平衡。在固定基准评测设置下,Gemini 3.8 Flash的准确率为73.40%,高于Gemini 3.7 Flash的准确率73.12%。结论仅适用于该评测空间内的条件比较,不能外推为语言固有难度排序或替换语音为声音的因果效应。该诊断的适用边界受限于固定模型队列与非配对证据子集,稀疏远距尾部等尚未验证的外推仍需谨慎。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 解码器不敢再自由发挥:用不确定性路由的稀疏编辑把语音识别拉回声学证据

原论文 Fig. 1:Overview of AURA. The pretrained encoder-decoder model is frozen.

英文题目:AURA: Uncertainty-Routed Activation Editing for Acoustic Grounding in Speech Foundation Models

标签:#语音识别 | #参数高效微调 | #注意力机制 | #语音 | #鲁棒性

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Natarajan Balaji Shankar:机构信息未在 arXiv HTML 中可靠披露
  • Zilai Wang:机构信息未在 arXiv HTML 中可靠披露
  • Zihan Wang:机构信息未在 arXiv HTML 中可靠披露
  • Mohan Shi:机构信息未在 arXiv HTML 中可靠披露
  • Kaiyuan Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Abeer Alwan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

注意力编码器解码器语音基础模型以语音波形为输入并输出转写文本,在无语音、弱声学证据或不可靠监督下易依赖内部语言模型先验而生成流畅却无声学支撑的内容。AURA冻结Whisper式预训练模型,仅在解码器交叉注意力头输出处施加稀疏缩放平移编辑以学习可干预位置。静态稀疏门选择可编辑头,其输出进入下一步的动态路由。逐词元不确定性门基于注意力集中度、熵与帧间偏移计算,并在确信时休眠、失稳时增强干预,再与静态门相乘后控制编辑强度。与静态头编辑相比,该路由区分何处可改与何时应改,使校正集中于对齐漂移的解码步并保持干净语音识别能力。在UrbanSound8K非语音评测下,AURA的HRnorm指标为1.94%,低于零样本基线的HRnorm指标89.18%。其适用边界是冻结编码器已提供充分声学表示的情形,口吃等编码器失配严重时仍需更大容量编码器适配。训练成本为单块NVIDIA RTX A6000上贪婪解码训练,推理开销上Whisper-Large-v3的解码实时率为0.133,训练峰值内存为8.36 GiB。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 训练走解析路径、推理走自生轨迹:纠正性强制如何统一后训练扩散与流

原论文 Figure 1:Performance comparison with and without CoF at different NFEs on WSJ0+WHAM (top) and WSJ0+REVERB…

英文题目:Corrective Forcing: Unified Post-Training for Diffusions and Flows in Generative Speech Enhancement

标签:#语音增强 | #扩散模型 | #流匹配 | #去混响 | #后训练

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Qing Yao:机构信息未在 arXiv HTML 中可靠披露
  • Lijian Gao:机构信息未在 arXiv HTML 中可靠披露
  • Qirong Mao:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音增强输入为退化语音谱图、输出为干净语音估计,实际难点在于训练用解析高斯路径状态而推理在自生成 rollout 状态上递归求值,预测与离散化误差沿采样轨迹累积导致分布偏移。预训练先在解析分布上学习SB-VE与OT-CFM的基础生成动力学,其输出进入后训练阶段的rollout采样。动态rollout矫正在动态采样调度下对自生成状态的干净语音预测施加复合重建损失,将其向真实干净端点矫正以保持重建保真。反事实转移一致性以指数滑动平均教师构造局部矫正的反事实转移,并以其预测为参考正则化事实转移处在线预测,降低对转移偏差的敏感性。与仅扰动训练状态的正则化桥及仅优化固定评估次数下最终调用的方法不同,该共享干净语音预测参数化的统一目标同时矫正预测并约束局部演化,适用于扩散与流两种公式。在VoiceBank+DEMAND评测基准下,CoF(SB-VE)在4次函数评估时的PESQ为3.21,高于SB-VE的PESQ 3.07。结论限于 16 kHz 短时傅里叶谱域去噪与去混响及 1 至 16 步评估,参考无关感知与真实远场泛化尚未验证。后训练的训练成本为4000步优化,SB-VE与OT-CFM平均每步分别约7.75与5.75次模型评估的计算量。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 把专家混合塞进卷积-Transformer:MECT 如何在小参数下做说话人确认与流式推理

原论文 Figure 1:The architecture of MECT Block.

英文题目:MECT: Mixture of Experts with CNN-Transformer Network for Speaker verification

标签:#说话人验证 | #混合专家模型 | #语音 | #流式处理 | #严格因果

评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前25% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Yu Zheng:机构信息未在 arXiv HTML 中可靠披露
  • Jinghan Peng:机构信息未在 arXiv HTML 中可靠披露
  • ChangHao Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Jian Liu:机构信息未在 arXiv HTML 中可靠披露
  • Weiqiang Wang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

说话人验证(Speaker Verification,SV)需从变长语音提取判别性说话人嵌入(Speaker Embedding),难点是兼顾局部频谱纹理与长时依赖并保持可部署的低复杂度。MECT 以 80 维对数梅尔滤波器组(Log Mel Filterbank)为输入,经卷积头、多阶段 MECT 块堆叠、跨阶段加权融合、注意力统计池化(Attentive Statistics Pooling,ASTP)输出 192 维嵌入,用 SphereFace2 损失训练,推理用余弦或自适应对称归一化(Adaptive Symmetric Normalization,AS-Norm)加质量测度函数(Quality Measure Function,QMF)打分。每个 MECT 块内卷积神经网络(Convolutional Neural Network,CNN)做局部建模,Transformer 做全局建模,混合专家模型(Mixture of Experts,MoE)替换 Transformer 前馈首层线性映射。工作系统比较 utterance 级与 frame 级、稠密与稀疏 4 种路由,VoxCeleb 最优为帧级稠密 4 专家,CN-Celeb 最优为帧级稀疏 Top-4 共 8 专家。在 VoxCeleb1-H 上 MECT-B2 相对 ReDimNet2-B6 将等错误率(Equal Error Rate,EER)从 0.99% 降至 0.85%,最小检测代价(minDCF)从 0.104 降至 0.082;联合 VoxCeleb2 与 VoxBlink2 训练并加 AS-Norm 与 QMF 后三协议 minDCF 为 0.012、0.026、0.048。流式采用因果卷积、因果多头注意力(Multi-Head Attention,MHA)与 ASTP 缓存重训,100 ms 块下与因果离线基线基本持平。结论限于 VoxCeleb 与 CN-Celeb 受控评测,跨信道、噪声远场与极短语音外推未验证。MECT-B2 参数量 9.57M,2 秒语音主干计算量 14.43 GMACs,原文未披露训练硬件型号与耗时。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 先说一遍再改一遍:让语音模型听见自己的草稿并真正改好

原论文 Fig. 1:Overview of the two-hop generate-critique-refine pipeline.

英文题目:Listen, Critique, and Refine: RL-Based Self-Refinement for Instruction-Following Speech Synthesis

标签:#文本到语音 | #强化学习 | #语音 | #音频大模型

评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Chee-En Yu:机构信息未在 arXiv HTML 中可靠披露
  • Yi-Cheng Lin:机构信息未在 arXiv HTML 中可靠披露
  • Sung-Feng Huang:机构信息未在 arXiv HTML 中可靠披露
  • Yun-Shao Tsai:机构信息未在 arXiv HTML 中可靠披露
  • Ho-Lam Chung:机构信息未在 arXiv HTML 中可靠披露
  • Xuanjun Chen:机构信息未在 arXiv HTML 中可靠披露
  • Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理指令跟随语音合成,输入为文本内容与描述音高、语速及情感的自然语言风格指令,输出为内容保真且风格一致的语音,难点在于单遍生成常只能满足部分声学属性。方法形成两跳链条:首遍由单个音频大模型生成草稿语音音频token序列作为听觉推理起点,随后同一模型回听该草稿并输出文本批评以指出与指令的声学偏差,最后模型以指令、文本、草稿音频与批评为联合条件生成精炼语音。训练采用组相对策略优化仅优化精炼遍,批评在线重采样以保持同策略,同时以低秩适配约束相对冻结参考模型的散度。与仅做单遍强化学习或线性改进奖励的方法不同,该工作以双曲正切非线性塑造首尾对比语言语音预训练增量,使共享基线在组内归一化后仍保留相对改进信号。在InstructTTSEval基准下,RL two-hop精炼输出的CLSP得分为0.538,高于零样本基线的CLSP得分0.505。该结论限于英语描述性与角色扮演类指令及CLSP与Gemini评审主导的自动评价,对长文本、多说话人及真实部署偏好尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 把可懂度比较搬进声道:九维收缩变量为何能替掉上千维自监督特征

原论文 Fig. 2:ART-NAD interpretability example.

英文题目:ART-NAD: An Articulatory Inversion-based Neural Acoustic Distance for Pathological Speech Intelligibility Assessment

标签:#语音可懂度评估 | #RNN | #病理语音评估 | #可解释性

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Bence Mark Halpern:Nagoya University Nagoya, Japan
  • Thomas Tienkamp:University of Cologne Cologne, Germany
  • Defne Abur:University of Groningen Groningen, the Netherlands
  • Tomoki Toda:Nagoya University Nagoya, Japan

📌 核心摘要

病理语音可懂度评估的输入是患者与同文本对照者的录音,输出是与听者转写得分一致的说话人级分数,难点在于首尾静音在动态时间规整下平凡对齐虚增相似度、跨病种与跨语言泛化以及临床要求的可解释归因。该方法先将16 kHz音频送入wav2vec2-Large第10层得到50 Hz、1024维表征并线性插值至100 Hz,再经两层双向门控循环单元反演为9通道准声道收缩变量轨迹,接着对测试与同文本参考轨迹做多变量动态时间规整距离并在参考和语句上平均、翻转符号得到分数。相对直接比较自监督特征的神经声学距离,该机制把不透明特征替换为具名收缩自由度,使偏差可定位到特定发音器官与音素区间。在20个参考音频协议上的平均说话人级Pearson相关为0.71,与NAD-FA持平并显著高于元音空间面积的0.15。适用边界是反演模型仅在英语HPRC电磁发音仪数据上训练,非英语连贯语句上落后0.06至0.15,且定位解释尚未经临床评定验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 混响下高阶缺失难定解:把上采样做成条件生成的取舍

原论文 Fig. 1:Schematic illustration of the overall architecture of the proposed generative Ambisonics upscaler.

英文题目:Generative Learning for Ambisonic Upscaling

标签:#声场重建 | #流匹配 | #扩散模型 | #空间音频信号 | #主观评测

评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Amit Milstein:机构信息未在 arXiv HTML 中可靠披露
  • Nir Shlezinger:机构信息未在 arXiv HTML 中可靠披露
  • Boaz Rafaely:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

环境声场重建中的Ambisonics上采样(Ambisonic upscaling)需从4通道一阶观测(\(N=1\))恢复16通道三阶信号(\(N'=3\)),混响下晚期反射形成扩散随机声场,稀疏假设与确定性回归易产生空间模糊与高频细节丢失。该工作将欠定线性逆问题约束为缺失12通道的条件生成,先对低阶时域信号做短时傅里叶变换(Short-Time Fourier Transform,STFT)与幅度压缩得到条件特征,再用条件连续时间模型只合成二、三阶通道,最后经逆压缩、逆短时傅里叶变换(Inverse STFT,ISTFT)与低阶实测拼接保证观测一致。同一噪声条件分数网络(Noise Conditional Score Network,NCSN)主干实现两种实例:流匹配(Flow Matching,FM)学习线性插值路径的确定性速度场并用欧拉法解常微分方程(Ordinary Differential Equation,ODE);分数扩散学习方差爆炸(Variance Exploding,VE)随机微分方程(Stochastic Differential Equation,SDE)下的条件分数并用预测校正采样。前者贴近条件均值因而在点式失真指标占优,后者单次采样更尖锐因而在指向性保真占优。在HARP混响评测上FM平均达7.53 dB STFT-SDR,显著高于卷积Transformer网络(Convolutional-Transformer Network,CTN)的4.90 dB与Diffusion的4.69 dB。该结论限于静态说话人、16 kHz、N3D归一化三阶与训练覆盖的混响分布,移动声源、高采样率与更高阶外推未验证。原文未披露训练硬件、优化器与推理延迟。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 固定系数不够:用模型熵给每一次比对单独加权的话者融合

原论文 Fig. 1:The additional procedures (panels (b) and (d)) inserted into the training and test phases (panels…

英文题目:Entropy-aware logistic regression for fusion of large-scale speaker recognition systems

标签:#说话人验证 | #模型集成 | #语音 | #多语言

评分:7.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Pierre-Michel Bousquet:LIA, Avignon University, France
  • Mickael Rouvier:LIA, Avignon University, France

📌 核心摘要

大规模说话人验证需判断注册语音与测试语音是否同属一人,难点是语言、时长、信道等多维失配使单系统嵌入不可靠,而常规逻辑回归(Logistic Regression,LR)融合只给每个系统固定权重。论文先为每个系统估计话语级模型熵可靠性:训练后抽取训练嵌入经分类Softmax得到说话人后验,计算说话人级交叉熵、对称Kullback-Leibler Divergence(Kullback-Leibler Divergence,KLD)平滑度、说话人间成对对称KLD非相似度三类统计;测试时计算待评估语音对训练说话人的后验并取其Top训练说话人,在其上平均上述三项再加Top个数构成4维原始指标,经开发集最小最大值归一化后平均为0至1的话语可靠性,试次可靠性取注册与测试最小值。再把连续可靠性映射为1至10的分位数序数权重并归一化使各系统权重和为1,按权重取值把加权分数散射到10维稀疏向量并训练熵感知逻辑回归(entropy-aware LR,e-LR),最终分数为常规LR与e-LR各占0.5的平均。与已有方法相比,关键差异是从系统依赖系数转向可靠性依赖系数,低可靠系统的贡献被动态抑制。9系统融合在自建7,366,675试次集上把等错误率(Equal Error Rate,EER)从1.60%降至1.44%,在CommonBench上6系统融合从2.82%降至2.59%。该结论适用于多系统互补且有域内开发集估计分位数与回归系数的场景,对单系统、极短注册或熵估计失准架构的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 固定窗长不够用:用探针状态让强化学习逐次决定听多久

原论文 Fig. 1:Illustration of the fixed-window dilemma in audio-based UAV localization and our adaptive…

英文题目:Audio-based UAV Localization with Adaptive Temporal Correspondence via Reinforcement Learning

标签:#声源定位 | #强化学习 | #状态空间模型 | #麦克风阵列

评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Haoxiang Lei:机构信息未在 arXiv HTML 中可靠披露
  • Mingzheng Feng:机构信息未在 arXiv HTML 中可靠披露
  • Daotong Wang:机构信息未在 arXiv HTML 中可靠披露
  • Shenghai Yuan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频反无人机预警需从多通道音频估计运动无人机三维位置,难点在于短窗证据不足而长窗引入运动失配与报告延迟,且所需证据随运动与干扰动态变化。本文提出自适应时间对应框架:先用最小探针窗提取声学累积一致性状态,再由近端策略优化控制器输出窗长与时序特征权重,最后将所选变长窗梅尔谱送入Mamba定位网络做加权融合与位置回归,跟踪反馈回流至下一时刻状态形成闭环。与固定窗基线不同,该机制在线按声学可靠性动态平衡证据量与时间对应延迟。在MMAUD-V1屋顶场景上,音频方法三维欧氏误差为0.30 m,接近最强音视频基线Lei et al.的0.29 m,而时间对应延迟降至0.136 s,平均窗长仅0.23 s。在MMAUD-V2停车场景零样本迁移中,控制器自动延长至0.72 s,误差0.96 m,仍优于所有对比基线。在MMAUD-V1场景下,Ours-Adaptive的E指标为0.30,低于Ours-Fixed的E指标0.63。该结论适用边界受限于MMAUD采集阵列与屋顶和停车两类场景,远距离强噪声下失败条件显著暴露,实验硬件为单个RTX 4090且V1时间对应延迟为0.136 s。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 用可恢复的声音档案让合成与理解互相验算:CycleSpeech 的双向对齐

原论文 Figure 1:Generation–understanding paradigms.

英文题目:CycleSpeech: Reciprocal Alignment for Instruction-Controlled Speech Synthesis and Paralinguistic Understanding

标签:#文本到语音 | #强化学习 | #语音属性识别 | #多语言

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Huan Liao:机构信息未在 arXiv HTML 中可靠披露
  • Haonan Han:机构信息未在 arXiv HTML 中可靠披露
  • Xingwen Han:机构信息未在 arXiv HTML 中可靠披露
  • Dekun Chen:机构信息未在 arXiv HTML 中可靠披露
  • Yuancheng Wang:机构信息未在 arXiv HTML 中可靠披露
  • Zhizheng Wu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

指令控制语音合成以自然语言指令、转写文本与说话人参考为输入,输出兼顾可懂度、音色一致与开放式风格落实的语音,难点在于自然度高仍可能听不出情感、韵律与质感且缺乏可验目标。CycleSpeech先构建中英双语结构化语音画像作为共享监督目标,再经联合监督微调让生成适配器独立预热2000步后引入在线生成波形训练理解适配器以兼容分布。随后CycleGRPO以5步为间隔交替优化,前向循环由理解器从合成语音恢复画像并与固定目标比对以约束生成,后向循环由生成器依据预测画像经确定性桥接器重建源风格以检验画像信息量。在1077条生成提示与2127条理解样本的中英文评测上,相对同骨干Step-Audio-2-mini,指令匹配率中文提升4.50个百分点至79.00%,英文提升10.06个百分点至85.53%,理解总体分中文78.36%、英文76.84%,同时说话人验证保持99.50%与98.53%。在VccmDataset外域生成评测下,CycleSpeech(Phase2)的WER为2.50±0.40,高于Step-Audio-2-mini的WER 1.93±0.40。该结论适用边界受限于中英文闭集属性与三类模板化指令,失败条件包括英文可懂度轻微回退与外域情感准确率仅40.0%左右,跨语言与开放属性外推尚未验证。原文未披露训练、推理或部署成本

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 听声辨位再行动:OmniEcho 用四通道空间音频补上具身感知的方向感

原论文 Figure 2:Overview of OmniEchoBench-QA, which comprises 2,972 QA pairs across 197 scenes and 600 bird’s-eye…

英文题目:OmniEcho: Spatial Audio Understanding for Embodied Agents

标签:#音视频问答 | #多模态学习 | #空间音频信号 | #基准测试

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Ruixun Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yuxuan Wang:机构信息未在 arXiv HTML 中可靠披露
  • Jiacheng Xie:机构信息未在 arXiv HTML 中可靠披露
  • Yuhuan You:机构信息未在 arXiv HTML 中可靠披露
  • Donghua Cai:机构信息未在 arXiv HTML 中可靠披露
  • Junming Lin:机构信息未在 arXiv HTML 中可靠披露
  • Xiong-Hui Chen:机构信息未在 arXiv HTML 中可靠披露
  • Zhifang Guo:机构信息未在 arXiv HTML 中可靠披露
  • Yunfei Chu:机构信息未在 arXiv HTML 中可靠披露
  • Qize Yang:机构信息未在 arXiv HTML 中可靠披露
  • Xize Cheng:机构信息未在 arXiv HTML 中可靠披露
  • Jin Xu:机构信息未在 arXiv HTML 中可靠披露
  • Yiwu Zhong:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理具身智能体在真实室内场景中联合 4 通道 FOA 音频、单视角视频与语言指令完成空间问答和声源导航的问题,难点在于真实空间音频采集昂贵、仿真音频与视觉几何难对齐、预训练全模态模型缺乏空间听觉通道。方法链分四步推进:先在 197 个真实场景采集 OmniEchoBench-QA 的 2,972 个问答并在 30 个真实场景采集 OmniEchoBench-Nav 的 900 个导航样本与 12,900 条 FOA 接收记录,再用统一球谐编码渲染器合成大规模问答与导航训练数据,然后分两阶段预训练轻量 FOA 编码器以获得语义对齐和查询条件定位能力,最后将冻结的 FOA 编码器与原生语义音频塔并联接入 Qwen3-Omni-30B-A3B 并只训练投影器与语言模型。与仅用单通道音频或缺乏视觉监督的基线相比,双通路设计保留语义能力同时显式注入方向与距离线索。在 OmniEchoBench-QA 音视频设置下总体准确率为 28.5%,在 OmniEchoBench-Nav 声引导导航下成功率(Success Rate,SR)为 16.2%,已接近部分文本引导基线。结论仅适用于近场室内 FOA 条件,细粒度方位角、距离估计与自主停止仍不可靠。原文未披露推理延迟与部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. 在 25 Hz 潜变量上修音符:标量量化与 MIDI 跨度如何支撑多乐器混合的再合成

原论文 Figure 1:Frame-aligned conditioning and MIDI Span.

英文题目:Synthesis and editing of multi-instrument audio mixtures using scalar-quantised latents with MIDI Span conditioning

标签:#音乐生成 | #流匹配 | #音乐 | #Transformer

评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Sungkyun Chang:机构信息未在 arXiv HTML 中可靠披露
  • Keshav Bhandari:机构信息未在 arXiv HTML 中可靠披露
  • Simon Dixon:机构信息未在 arXiv HTML 中可靠披露
  • Emmanouil Benetos:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

多乐器混合修订需在重建目标区段的同时保留并发未改音符与乐器音色并与两侧上下文衔接,低帧率下帧量化会丢失帧内 timing 而序列化又难以处理并发。SpanSynth-Edit先用冻结HeartCodec编码器将48kHz单声道音频映射为25Hz、128维标量量化隐变量并以流匹配建模,上下文帧以已知插值固定以引导音色与声学衔接。接着MIDI Span将每乐器标注音符全生命周期的起止与剩余时长编码为带连续属性的无序事件集,再经置换不变编码器池化为每音频隐帧单个条件向量。最后25层扩散变换器拼接噪声隐变量、固定音频上下文、MIDI特征与二值掩码,经欧拉积分生成目标隐变量并仅解码最终序列。与按帧量化timing的钢琴卷轴或序列化并发音符的音符序列不同,该表示保留帧内起止与剩余时长并对槽位顺序不变。在Slakh含鼓合成基准下,Ours的FOn分数为54.06%,高于SpecDiff的FOn分数为51.84%。其适用边界是依从评估依赖 YourMT3+ 转录而不可靠,对弦乐与管乐等非打击乐细微 timing 响应弱,且无专家听测。训练成本为在660小时17个乐器数据集族上以Adam训练125k步,推理开销在GH200硬件上以32步欧拉与CFG生成每20.48秒音频需0.93秒且峰值保留3.37GiB。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 缺哪条补哪条:用验证器把乐谱约束变成可分级的训练信号

原论文 Figure 2:Overview of MusicRLVR. Left: Multi-constraint prompts make binary all-satisfied rewards sparse,…

英文题目:Which Constraints Are Missing? Ask the Verifier: Graded Rewards for Constraint-Following Music Generation

标签:#符号音乐生成 | #强化学习 | #基准测试 | #音乐

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Haoyue Liu:School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen 518172, China;Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)
  • Ye Chen:XJTU-POLIMI Joint School, Xi’an Jiaotong University, Xi’an 710049, China
  • Zhichao Wang:School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen 518172, China
  • Xiaoyu Ma:School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen 518172, China
  • Haoran Shou:School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen 518172, China
  • Xiaoying Tang:School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen 518172, China;Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)

📌 核心摘要

约束跟随音乐生成要求根据自然语言规格一次性输出满足调性、节拍、长度、音域、终止音、节奏词汇、跳进与曲式的单声部ABC乐谱,多约束合取导致任一失败即整体失败,约束增多时联合满足急剧下降。所提MusicRLVR先用硬验证门拦截不可解析或畸形输出,再对过门样本按请求约束族计算分级信用并附加全满足奖励,最后以组相对优势做GRPO更新。与二值全满足奖励相比,该机制保留了部分合规排序并恢复了零方差组的梯度信号。配套MusicConstraintBench覆盖8个约束族与混合、单约束、已见组合、未见组合、高约束数、曲式、密度与参数外推测试,共2180项加400项改写。在Mixed混合约束基准下,直接训练的MusicRLVR的联合满足率指标为0.807,高于Qwen3-4B基线的联合满足率指标0.160。结论限于短单声部民谣风格与程序化可验属性,不保证感知质量与长结构音乐性。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 把归属藏进说话人行为:TTS-Guard 如何用对抗说话人对验明黑盒语音模型

原论文 Figure 1:TTS-Guard pipeline. (1) Dual-space KSP selection identifies a source/target speaker pair (S_x…

英文题目:TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints

标签:#音频指纹 | #对抗训练 | #语音合成 | #鲁棒性

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xubin Yue:机构信息未在 arXiv HTML 中可靠披露
  • Zhenhua Xu:机构信息未在 arXiv HTML 中可靠披露
  • Zhebo Wang:机构信息未在 arXiv HTML 中可靠披露
  • Mengting Li:机构信息未在 arXiv HTML 中可靠披露
  • Zijie Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Wenpeng Xing:机构信息未在 arXiv HTML 中可靠披露
  • Dezhang Kong:机构信息未在 arXiv HTML 中可靠披露
  • Meng Han:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

零样本文本到语音(Text-to-Speech,TTS)模型被窃后经微调剪枝量化再以黑盒应用程序接口(Application Programming Interface,API)转售,权属方只能用参考音频加文本提示查询可疑服务并观察合成波形,常规信号水印易被编解码与净化抹除。TTS-Guard先在Resemblyzer与ECAPA-TDNN双验证空间选出声学相近的关键说话人对(Key Speaker Pair,KSP),再用自适应课程影子优化(Adaptive Curriculum Shadow Optimisation,ACSO)逐步引入低秩适配(Low-Rank Adaptation,LoRA)微调、剪枝、量化与蒸馏影子模型优化对抗扰动,最后以多查询验证置信分数(Verification Confidence Score,VCS)做二项检验判决。与单空间匹配和分类边界探测的跨域移植相比,该机制把凭证从波形载体转到说话人编码器输入输出行为并显式抑制非目标模型响应。在五个主流TTS系统评测下,TTS-Guard的FSR指标为0.964,高于随机对基线的FSR指标0.374。风格迁移与INT4加重微调组合仍可使成功率跌至0.46到0.55,且英语评估受限尚未验证多语种外推,构成适用边界上的失败条件。单模型完整指纹生成在单个A800硬件上的训练成本约为6 GPU小时。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 极端缺频下补高频:音素先验与分频渐进如何分工

原论文 Figure 2:Overview of the proposed P2Flow framework for hr speech restoration from lr speech.

英文题目:P2Flow: Phoneme-aware Progressive Flow Matching for Extreme Speech Super-Resolution

标签:#语音超分 | #流匹配 | #语音学与音系 | #后训练

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ningyuan Yang:机构信息未在 arXiv HTML 中可靠披露
  • Yize Li:机构信息未在 arXiv HTML 中可靠披露
  • Pu Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Diego A. Cuji:机构信息未在 arXiv HTML 中可靠披露
  • Kanad Sarkar:机构信息未在 arXiv HTML 中可靠披露
  • Ryan M. Corey:机构信息未在 arXiv HTML 中可靠披露
  • Xue Lin:机构信息未在 arXiv HTML 中可靠披露
  • Andrew C. Singer:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

极端语音超分辨率(Speech Super-Resolution)面向1 kHz或2 kHz低分辨率(Low-Resolution)输入恢复16 kHz高分辨率(High-Resolution)语音,此时2 kHz以上频谱大面积缺失,谐波与包络线索严重不足。所提P2Flow为三阶段流水线:先用HuBERT编码器加线性头从重采样至16 kHz的低分辨率波形估计39类帧级音素后验,再将后验与低分辨率梅尔谱、流状态拼接输入渐进式流匹配(Flow Matching)网络分频预测速度场,最后用估计梅尔谱后训练HiFi-GAN声码器合成波形。在TIMIT 2 kHz到16 kHz下取得LSD 0.935、LSD-HF 0.997、ViSQOL 3.954、STOI 0.908,在1 kHz到16 kHz下取得LSD 1.026、ViSQOL 3.434,均优于AP-BWE与FLowHigh;在VCTK上一致领先,且在4 kHz与8 kHz到16 kHz仍保持优势。与直接全带预测的通用超分基线不同,音素后验以概率形式约束谐波与包络结构,倒金字塔渐进分频让高频估计复用低频表示,声码器后训练缓解估计梅尔与自然梅尔失配从而提升波形保真度。在TIMIT 2 kHz到16 kHz评测设置下,P2Flow的ViSQOL为3.954,高于FLowHigh的ViSQOL 3.712。该结论适用边界受限于Chebyshev Type-I低通模拟退化与英语朗读语料,跨信道失真与非英语及自发语音等场景尚未验证,音素混淆与边界模糊时仍可能失败。训练与推理在单卡硬件NVIDIA RTX A6000上完成,默认推理开销为5步ODE采样,1步与10步ViSQOL分别为3.946与3.954,未披露延迟与吞吐实测。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 不重训也能定位合成语音毛刺:XSQ-AST 把质量分投影到音素与时间上

原论文 Figure 1:Signal flow for XSQ-AST, containing SQ-AST \\[22\\] and WhisperX \\[2\\] models.

英文题目:XSQ-AST: An Explainable Audio Spectrogram Transformer Framework for Localising Synthetic Speech Artifacts

标签:#语音质量评估 | #注意力机制 | #语音 | #主观评测 | #可解释性

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Ben Heritage:机构信息未在 arXiv HTML 中可靠披露
  • Luca Resti:机构信息未在 arXiv HTML 中可靠披露
  • Mónica Villanueva Aylagas:机构信息未在 arXiv HTML 中可靠披露
  • Timothy Mehlenbacher:机构信息未在 arXiv HTML 中可靠披露
  • Konrad Tollmar:机构信息未在 arXiv HTML 中可靠披露
  • James Alfred Walker:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

合成语音评估输入为单语言多说话人合成话语,输出应为定位到时间与音素的伪影诊断,而全局平均意见分已饱和且无法解释局部断裂、噪声与音色退化。本文方法链分四步:先用SQ-AST对平均意见分(Mean Opinion Score,MOS)、噪声感、非连续性、音色与响度五个1到5分维度打分并过滤低分样本,再从音频频谱Transformer(Audio Spectrogram Transformer,AST)提取时频显著图。接着用WhisperX转写与音素对齐获得边界与音素后验图,最后经核密度估计(Kernel Density Estimation,KDE)与音素离散化显著图(Phoneme Discretized Saliency Maps,PDSMs)生成话语级与系统级报告。与需修改训练目标加段一致性约束的帧级质量方法不同,该框架完全以后验方式复用冻结模型,无需帧级标注与重训练即可将质量分映射为时序分布。在VoiceMOS 2022手选30样本与40名听者参与的评测设置下,Attention Rollout的整体中位Spearman’s ρ为0.444,高于Raw Attention的整体中位Spearman’s ρ-0.020。结论仅适用于短话语英语合成的明显局部伪影,对弱伪影、长音频分段边界与跨系统泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 分母不清的检测比较不可比:用内容血缘重定 AI 音乐检测评估

原论文 Figure 1:Per-source TPR for synthetic strata and FPR for real strata on the paired test intersection.

英文题目:ArtifactBench: Lineage-Aware Evaluation of AI-Generated Music Detectors under Distribution Shift

标签:#音频深度伪造检测 | #基准设计 | #音乐 | #基准测试 | #鲁棒性

评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Heewon Oh:Intrect

📌 核心摘要

面向整轨全曲合成音乐与人类制作音乐的二分类检测,输入为完整音频波形、输出为合成或真实标签,难点在于生成器换代、真实域偏移、清单失配与适配器静默丢文件导致 headline 分数不可比。该工作先法医审计三套历史清单并为每轨绑定内容摘要(SHA-256)、来源层、生成器版本与谱系标识,再在来源层内按谱系以20/10/70划定校准、验证与密封测试,最后用版本锁定运行器对ArtifactNet v9.4、SpecTTTra-α-120s、Deezer ISMIR 2025公开逻辑检测器、CLAM执行统一单声道解码与冻结阈值评测。与直接比较聚合分数不同,其机制差异在于把训练暴露、推理缺失与阈值选择显式建模为可审计产物而非隐藏预处理。在562首四模型共同成功密封测试交集上,ArtifactNet v9.4以0.982的ROC曲线下面积和0.918的平衡准确率领先,公开Deezer检测器为0.761和0.776,SpecTTTra与CLAM低于0.30。该结论仅适用于冻结混合队列与校准阈值,不支持向未来生成器或广播信道的无条件外推。原文未披露训练与部署成本,推理在单台Apple Mac Studio M1 Max上执行。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 先验证结构再采样:社区感知的语音合成核心集选择

原论文 Figure 4:Communities of G_u and the utterances Community Representative selects at a 10% budget.

英文题目:Structure Before Sampling: Community-Aware Core-Set Selection for Data-Efficient Text-to-Speech

标签:#文本到语音 | #统计分析 | #语音 | #语音学与音系 | #语音可懂度评估

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Mizbaul Haque Maruf:机构信息未在 arXiv HTML 中可靠披露
  • Muhammad Nur Yanhaona:Department of Computer Science and Engineering;Brac University, Dhaka, Bangladesh

📌 核心摘要

面向文本到语音(Text-to-Speech,TTS)语料录制成本问题,本文输入为带时长的大规模转写语句池,输出为满足音频时长预算的高信息密度训练子集,难点在于冗余语句多而稀有音位组合少且随机抽样难以触达分布尾部。方法链条首先将语句表示为音素与词内二元组的TF-IDF向量并构建k近邻语句图,接着用随机图与保度零模型检验聚类与模块度以确认结构可用,随后按Louvain社区划分预算并在社区内从稀有音素种子出发做最远点扩展,最后用稀有二元组覆盖率与合成语音可懂度分别验证语言覆盖与下游效果。与忽略语句关系的Phoneme Balance与随机选择相比,该机制把全局预算分层到图社区并在层内强制分散,从而兼顾区域覆盖与尾部召回。在孟加拉语语料下游可懂度评测设置下,Community Representative的CER为3.93%,低于随机选择的CER 4.90%。结论目前仅在单说话人朗读语料与固定评测链路下成立,多说话人下游合成与跨录音质量外推尚未验证。孟加拉语按相同轮次训练时子集训练耗时11.3小时约为全量50.4小时的五分之一,英文则采用固定30000更新步数比较而未主张同等算力超越全量。该时长缩减直接降低了对应训练成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 不用对齐音素也能评节奏:包络变化率为何在低分段更稳

原论文 Fig. 2:Example audio from the speechocean762 dataset consisting of a reading of the utterance “we call it…

英文题目:Automated Assessment of L2 Speech Rhythm Using Low-Frequency Amplitude Modulations

标签:#语音属性识别 | #CNN | #语音 | #教育 | #韵律

评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • João Lima:机构信息未在 arXiv HTML 中可靠披露
  • Lucas Ueda:机构信息未在 arXiv HTML 中可靠披露
  • Paula Costa:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为二语朗读语音波形,输出为流利度与韵律维度的1至10分proficiency回归值,难点在于非母语误读与不流利导致强制对齐边界不可靠且韵律感知线索复杂难捕捉。方法链分三步:先用Bark临界带加权求和提取低频振幅包络及其一阶导数以保留音节prominence地标,再经三层一维卷积下采样与双向长短记忆网络建模长时节奏依赖,最后经Sigmoid注意力池化聚合成句向量并由多层感知机回归打分。与依赖元音与辅音间隔时长的时长基线相比,该机制差异在于省去音素对齐并直接利用包络变化率的锐峰对应感知元音起点。在speechocean762自建分层划分测试集上,包络导数模型EnvRate在流利度达Spearman相关0.70,优于时长归一化模型DurZ的0.67,且在低流利子集均方误差2.85显著低于DurZ的4.32。结论限于英语朗读与普通话母语者短句,平均时长3.98秒,未验证自发长语音与其他母语及二语。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 先分对白再分音乐音效:LiteCASS 用两级子带 U-Net 做立体声实时分离

原论文 Figure 1:Illustration of the Cinematic Audio Source Separation (CASS) task.

英文题目:LiteCASS: A Lightweight End-to-End Network for Real-Time Stereo Cinematic Audio Source Separation

标签:#音频分离 | #端到端学习 | #多通道 | #实时处理 | #高效推理

评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yuanxin Guo:机构信息未在 arXiv HTML 中可靠披露
  • Qiang Ji:机构信息未在 arXiv HTML 中可靠披露
  • Mengmei Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yuhan Lv:机构信息未在 arXiv HTML 中可靠披露
  • Ningning Pan:机构信息未在 arXiv HTML 中可靠披露
  • Gongping Huang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

电影音频源分离需将双通道立体声混合分解为对白、音乐与音效三路立体声波形,难点在于三类源频谱与时域特性异质性强,且分离时须保留电平差与时间差等空间线索。方法先对混合做短时傅里叶变换并取幅度谱,经无参数子带重排将频率轴折叠进通道维以缩短卷积频率长度而不丢失频谱信息。第一级紧凑子带U型网络以全混合频谱为输入分离对白与预测非语音残差,输出残差谱直接作为第二级的输入。第二级同构子带U型网络继续从残差中分离音乐与音效,预测实值掩码作用于原始复数谱后经逆变换重建三路波形,并以波形域多任务ℓ1损失联合监督。与多分辨率循环和频带分割等重型方案的关键差异在于用确定性频率折叠替代可学习频带划分,并将语音优先的分层归纳偏置写入两级结构,从而降低高分辨率层计算量而保持全频带建模。在DnR v3-stereo评测设置下,LiteCASS-K8的平均SI-SDR为9.50 dB,高于BandIt的平均SI-SDR 9.43 dB。该结论适用边界受限于线性空间化合成语料,对真实影视混音、强混响与动态声像的外推尚未验证。LiteCASS-K8仅用1.06 M参数与每秒0.72 G计算量,在单核中央处理器硬件上以0.014实时率实现推理开销远低于实时阈值,训练成本为在NVIDIA A800上训练200轮,适合嵌入式与移动部署。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 误识别还是抽象化:置信度不足时声音识别该输出什么

原论文 Fig. 1:Conventional output of SER system

英文题目:Misrecognition or Abstraction? Rethinking Outputs of Sound Event Recognition

标签:#音频分类 | #多模态学习 | #环境声 | #主观评测

评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Naoya Tomida:机构信息未在 arXiv HTML 中可靠披露
  • Yuki Okamoto:机构信息未在 arXiv HTML 中可靠披露
  • Keisuke Imoto:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

声音事件识别以环境音频片段为输入,需输出支撑用户理解周围环境的信息,难点在于真实声音常模糊难辨而传统系统仍强制给出确定性类别标签。先以环境音频的对数梅尔谱为输入,冻结预训练CLAP音频与文本双编码器提取嵌入,并训练文本投影器将拟声词嵌入向音频嵌入对齐,输出对齐后的音频—拟声词共享嵌入空间。再将上一步得到的同一音频嵌入送入多层分类器预测事件类别并估计置信度,同时以该音频嵌入为查询与候选拟声词嵌入做最近邻检索,输出类别标签、置信分数与声学模仿描述。最后将上一步得到的标签、分数与拟声词一并输入,按置信度切换预设模板或交由大语言模型组织话术,输出随不确定性变化的最终表达。与仅输出标签的传统范式相比,关键差异在于以拟声词抽象保留不确定下的有效声学信息而非丢弃为误识别,但重叠声与开放集下的表现尚未验证。在ESC-50的31类子集五折交叉验证评测下,提案方法的Micro-F score为98.54 ±0.51%,高于同编码器基线的Micro-F score 97.81 ±0.66%。该结论仅适用于短片段单标签英文拟声词检索场景,未验证重叠声、开放集与多语言拟声词生成的外推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 乐观的录音与悲观的转写:Vimarsha 如何同时校正印度语 ASR 评测的两端偏差

原论文 Figure 1:Two evaluation biases in Indian language ASR benchmarks.

英文题目:Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

标签:#语音识别 | #基准设计 | #多语言 | #基准测试

评分:6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Kaushal Santosh Bhogale:机构信息未在 arXiv HTML 中可靠披露
  • Srija Anand:机构信息未在 arXiv HTML 中可靠披露
  • Sadakopa Ramakrishnan Thothathiri:机构信息未在 arXiv HTML 中可靠披露
  • Tahir Javed:机构信息未在 arXiv HTML 中可靠披露
  • Sshubam Verma:机构信息未在 arXiv HTML 中可靠披露
  • Mitesh M. Khapra:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

印度语言自动语音识别任务以含背景噪声、信道失真、方言口音与语码混杂的连续语音为输入,输出可接受的转写文本,实际难点在于干净受控音频掩盖真实声学难度且单一规范参考将合法拼写变体误判为错误。为此Vimarsha先按年龄性别地域分层在三百五十六个地区采集四十三点三小时受控外场语音以覆盖人口统计与地域多样性,再从公开互联网视频中以三模型转写分歧与声学事件检测筛选出五十六点一小时在野难例以注入噪声与信道失真。接着将多模型假设对齐生成变体格初稿并经一百三十三名标注者校验增补形成每词平均一点五个变体的多参考,最后以正字法感知词错率取格中最佳路径计分从而同时纠正乐观与悲观双向偏差,该多参考按最佳路径计分相对单参考刚性评测构成关键机制差异并直接改变模型排序与部署判断。在IW评测条件下,AWS Transcribe的WER为36.8,高于COF条件下AWS Transcribe的WER12.2。该外推的适用边界尚未验证方言接触与极端声学事件下的稳定性。该结论限于默认API配置与一次性评测,未验证训练增益、统计显著性与长时部署稳定性。原文未披露训练、推理与部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 共因不等于去捷径:音频视频生成中视觉捷径的阻断需要干预

原论文 Figure 2:The counterfactual intervention do(n:=n^\\prime) made concrete (Colored-MNIST): the event—the…

英文题目:Common Cause, Not Cross-Attention: Blocking Visual Shortcuts in Audio-Video Generation

标签:#视频到声音生成 | #数据增强 | #音视频 | #鲁棒性

评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jian Xu:RIKEN iTHEMS;RIKEN AIP
  • Delu Zeng:South China University of Technology
  • John Paisley:Columbia University
  • Qibin Zhao:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

联合音频视频生成以视频与场景为输入、以相符声音为输出,难点是外观与事件在训练中高度耦合导致模型走视觉捷径。作者先构建事件与干扰外观解耦的结构因果模型并定义反事实测试,再用直接预测与共享隐变量基线暴露捷径,接着施加对干扰干预不变的反事实一致性约束并只保留事件路径。该机制与仅重塑表示的瓶颈或解耦做法本质不同,前者限定假设类而后者仍可编码外观代理。在Colored-MNIST真实模态评测设置下,CC+CF方法的事件准确率为0.930,高于直接模型的事件准确率0.160。真实像素与运动时间线索上的验证进一步表明共享先验与瓶颈均无法阻断捷径,而干预一致性能保持因果路径稳定,该外推在大规模真实联合生成器上尚未验证。结论仅在已知且可忠实干预全部混杂干扰时成立,未知干扰与大规模真实联合生成器仍未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 长对话问答不缺音频而缺取舍:按问题动态分配文本与声学证据

英文题目:The Bairong System for MLC-SLM 2026: Dynamic Question-Aware Evidence Routing for Multilingual Conversational Speech Understanding

标签:#音频问答 | #多模态学习 | #语音识别 | #说话人分离标注 | #多语言

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Shangkun Huang:机构信息未在 arXiv HTML 中可靠披露
  • Junchao Hu:机构信息未在 arXiv HTML 中可靠披露
  • Huan Shen:机构信息未在 arXiv HTML 中可靠披露
  • Guoji Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yingao Wang:机构信息未在 arXiv HTML 中可靠披露
  • Shaosai Li:机构信息未在 arXiv HTML 中可靠披露
  • Wei Zou:机构信息未在 arXiv HTML 中可靠披露
  • Yunzhang Chen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

长多语言双人会话口语问答输入为长录音波形与多选题问句,输出为选项预测,难点是长程话语语义与稀疏声学及说话人归属线索需按题取舍。系统先以级联前端生成带时间戳与说话人标识的转写文本,再由混合路由器仅根据题干与选项推断证据类型与上下文范围,最后按标签物化出完整转写、局部音文融合、说话人关联或全局紧凑声学输入并送入问答模型。与固定转写或固定音频策略相比,该机制以转写为骨干并按需激活音频,保留全局语境又隔离稀疏声学干扰。该按题分配证据的方式避免了无关长音频稀释注意力,也弥补了纯转写丢失韵律与说话人线索的缺陷。在开发集多选题任务评测设置下,最终系统的准确率为94.84%,高于全转写基线的准确率93.16%。结论仅在含显式锚点与说话人线索的会话问答上得到验证,对无锚点隐式检索与评估集泛化尚未证明。该结论的适用边界受限于显式时间戳解析与转写质量,隐式证据检索仍尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 残留说话人属性聚成可链接性:用针孔损失微调已训好的匿名框架

原论文 Figure 2:Theoretical illustration of the pinhole effect, used as the motivation of the proposed…

英文题目:Reducing Speaker Residual by Considering Pinhole Effect in Voice Anonymization

标签:#说话人匿名化 | #SFT | #隐私保护 | #语音

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zeyan Liu:机构信息未在 arXiv HTML 中可靠披露
  • Weili Jiang:机构信息未在 arXiv HTML 中可靠披露
  • Liping Chen:机构信息未在 arXiv HTML 中可靠披露
  • Kong Aik Lee:机构信息未在 arXiv HTML 中可靠披露
  • Boyu Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Kai Gao:机构信息未在 arXiv HTML 中可靠披露
  • Zhenhua Ling:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音匿名化需将输入语音转为隐藏源说话人身份但保留语言内容与韵律的匿名语音,难点是身份线索会残留在内容与韵律表征中形成可链接的残余说话人属性。微调时对批内所有输入强制使用共享伪说话人并合成匿名语音,使残余可分性在统一伪身份下充分暴露。接着用冻结的说话人编码器抽取匿名语音嵌入,并计算源说话人间与说话人内的散度比作为针孔损失,以显式度量链接性。然后仅更新内容编码器、韵律编码器与波形生成器以最小化该损失,同时联合保留原始生成目标以维持合成质量与可用性。与仅在内容单流做量化瓶颈或修改基频的已有方法不同,该方法以跨源说话人可分性为全局显式目标直接优化链接性。在LibriSpeech评测设置下,采用x-vector任意到一配置的微调后方法的平均EER为21.650%,高于未微调基线的平均EER 5.712%。该结论限于论文的自动说话人验证与情感识别评测及utterance级匿名协议,尚未验证对更强自适应攻击者与主观隐私感知的外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 文本定意图、空间音频定方位与时机:MoSAT 的分层条件动作生成

原论文 Figure 1:(Left) A Motion VAE is pre-trained to compress high-dimensional (272D) motion features into a…

英文题目:MoSAT: Human Motion Generation from Spatial Audio and Textual Description

标签:#音频理解 | #流匹配 | #空间音频信号 | #变分自编码器 | #数据集

评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Shuyang Xu:The University of Hong Kong
  • Zhiyang Dou:The University of Hong Kong;Massachusetts Institute of Technology
  • Yiduo Hao:University of Pennsylvania
  • Zekun Li:Brown University
  • Liang Pan:The University of Hong Kong
  • Jingbo Wang:Shanghai AI Lab
  • Cheng Lin:Macau University of Science and Technology
  • Yuan Liu:Hong Kong University of Science and Technology
  • Wenping Wang:Texas A&M University
  • Mingmin Zhao:University of Pennsylvania
  • Taku Komura:The University of Hong Kong

📌 核心摘要

输入为双耳空间音频加自然语言描述与初始声源到达方向,输出为10秒共300帧的全身人体运动,要求同时满足文本语义意图与声音方位时序引导。方法先用运动变分自编码器将272维逐帧骨骼特征压缩为75个潜token,再由音频素描融合器让时序声学序列对全局素描序列做交叉注意力得到接地声学token,最后由Transformer流匹配模型在潜空间回归从高斯先验到数据分布的线性插值速度场并解码为运动。全局素描提供方向、句级CLIP嵌入、30个词级token与中性genre槽,时序声学来自帧对齐CLAP特征,HumanML3D联合训练时以零音频与默认方向补齐。混合测试集5088样本上条件到运动检索R@1为56.96,运动到条件检索R@1为55.74,FID为0.35,优于MoMask与T2M-GPT。结论限于单人场景与初始帧方向假设,强噪声与模态错位下性能下降,多人与场景交互未验证。训练在单张RTX 4090约16小时,推理默认无分类器引导尺度2.0,原文未披露吞吐与实时性。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


28. 不等整句到齐就开口:双轨延迟如何换来可控的首包文本规范化

原论文 Fig. 1:The architecture of our proposed StreamTn model.

英文题目:StreamTN: A Low-Latency Streaming Chinese Text Normalization Model for Streaming TTS in Dialogue Systems

标签:#文本到语音 | #SFT | #流式处理 | #基准测试

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Wenhao Li:机构信息未在 arXiv HTML 中可靠披露
  • Jinrui Liang:机构信息未在 arXiv HTML 中可靠披露
  • Haoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
  • Xiaming Ren:机构信息未在 arXiv HTML 中可靠披露
  • Hanke Xie:机构信息未在 arXiv HTML 中可靠披露
  • Huakang Chen:机构信息未在 arXiv HTML 中可靠披露
  • Chengyou Wang:机构信息未在 arXiv HTML 中可靠披露
  • Dake Guo:机构信息未在 arXiv HTML 中可靠披露
  • Linhan Ma:机构信息未在 arXiv HTML 中可靠披露
  • Su Feng:机构信息未在 arXiv HTML 中可靠披露
  • Houdun Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yunxiang Chen:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

级联口语对话系统需将大语言模型生成的含非标准词文本转换为可读的语音合成输入,难点在于上游文本逐词到达而数字读音高度依赖右向上下文,早吐易错晚吐则首包延迟恶化。首先StreamTN以Qwen3-0.6B为基座,将原始输入轨与延迟归一化历史轨经共享词嵌入映射并相加融合,形成双轨对齐表示送入因果Transformer。接着模型按固定延迟d仅依据已见原始词元与已生成历史自回归预测下一个归一化词元,上一步输出回填为下一步历史输入以衔接解码。然后在输入耗尽后以补零表征延续解码直至结束符,从而解耦输入到达与输出生成。相比等待整句的离线规则与提示式大模型,该机制无需复杂提示即可增量输出,并以延迟帧数可控权衡上下文与时延。在1262条覆盖14类的对话基准上,4帧延迟配置取得Micro-F1 0.8937,精度与BiLSTM基线基本持平而支持流式,复杂数学方程等长结构化类别仅0.750。该结论适用边界受限于中文对话基准与现有类别分布,复杂数学方程与化学式为主要失败条件且跨语言与跨领域外推尚未验证,4帧配置延迟为213ms且推理开销在单张A6000上测得。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


29. 在只允许二维卷积的神经形态芯片上做音视融合:NAVIR 的分解与受限解码

原论文 Fig. 1:NAVIR audio-visual pipeline.

英文题目:NAVIR: Neuromorphic Audio-Visual Speech Recognition for Robust Human-Robot Interaction on Edge Hardware

标签:#音视频语音识别 | #CNN | #端侧运行 | #鲁棒性 | #高效推理

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Leonidas Delimpasis:机构信息未在 arXiv HTML 中可靠披露
  • Panagiota Moraiti:机构信息未在 arXiv HTML 中可靠披露
  • Antonis Porichis:机构信息未在 arXiv HTML 中可靠披露
  • Panos Chatzakos:机构信息未在 arXiv HTML 中可靠披露
  • Michail Karamousadakis:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

工业噪声下语音交互的输入为同步唇部视频与受损音频,输出为命令文本,难点在于低信噪比摧毁纯音频识别而边缘芯片又不支持三维卷积与注意力。该工作先用滑动窗口对视频与语谱图做中心对齐切分,再以逐帧卷积编码器提取空间特征并堆叠为时间图做时序卷积,同时用独立编码器处理梅尔倒谱系数,最后拼接双流嵌入并经多层感知机输出连接时序分类损失下的词元分布。与主流音视频方法相比,其机制差异在于将空时建模完全分解为顺序二维卷积并配合受限文法束搜索,用硬件兼容性换取表达能力。在GRID未见说话人划分噪声条件下,量化音视频融合模型的WER为14.0%,低于同条件纯音频基线的WER 22.5%,并在工业命令语料上取得98.6%命令准确率。该结论仅适用于小词汇固定文法与受控采集条件,未验证未见说话人、大词表与真实车间混响的外推。部署成本上论文给出了芯片与中央处理器及图形处理器的实测功耗对比,理论能耗则基于操作计数与互补金属氧化物半导体工艺常数估算。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


30. 合成语音露出口音破绽:巴西葡萄牙语方言不一致如何成为可解释的鉴伪线索

原论文 Fig. 1:t-SNE plot for phonological features.

英文题目:Synthetic speech detection in Brazilian Portuguese through accent-related features

标签:#语音伪造检测 | #信号处理 | #社会语音学 | #可解释性 | #语音

评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Pedro H. L. Leite:机构信息未在 arXiv HTML 中可靠披露
  • Pedro Benevenuto Valadares:机构信息未在 arXiv HTML 中可靠披露
  • Luiz Wagner Pereira Biscainho:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理巴西葡萄牙语(Brazilian Portuguese,pt-BR)合成语音判别问题,输入为同一说话人或同一文本转语音(Text-to-Speech,TTS)音色的多句语音,输出为自然或合成的说话人级判定,难点在于商用TTS把多方言混为单一分布且缺乏方言标注数据。方法链分为三步:先用多语言音素识别器定位高地理变异的辅音与元音时刻,再用经典信号处理提取共振峰与频谱矩等音系特征并按说话人聚合为语音剖面,最后用仅在自然语音上拟合的核密度估计(Kernel Density Estimation,KDE)做分布外检测或接入基础模型增强判别。与仅用基础模型相比,该机制差异在于显式度量方言实现一致性而非通道痕迹。在自建精选集留一系统验证上,ZIPA加XLS-R的逻辑回归达到97.1%准确率与1.5%等错误率(Equal Error Rate,EER),优于纯基础模型对照。在BRSpeechDF官方划分上最优融合为97.14%准确率与2.00% EER。该结论适用于多说话人通用语音,对语音克隆跟随目标口音时效果下降,且依赖每说话人约50句的聚合。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


31. 声调写不出来时,让词素先把语法说清楚:Morpho-VITS 的形态建模

原论文 Figure 1:The overall architecture is based on he VITS framework \\[9, 11\\].

英文题目:Morpho-VITS: Variational Inference with Morphological Modeling for End-to-End Speech Synthesis of a Tonal Bantu Language

标签:#文本到语音 | #变分自编码器 | #注意力机制 | #语音 | #韵律

评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Antoine Nzeyimana:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为无调号正字法的卢旺达语(Kinyarwanda)文本,输出为波形,要求在缺失声调与音节时长标注下恢复词汇调与语法调,难点在于声调由词干词缀的词汇属性与句法语境共同决定且具有自切分(autosegmental)特性。方法链分三步:先用音节切分器得到音素序列并用形态分析器得到语素序列,前者承载发音时序而后者承载形态句法身份;再用语素Transformer编码器学习高维形态表征,用双向音素到语素交叉编码器让每个音素在同词范围内关注对应语素并融合形态信息;最后将融合后的文本先验经单调对齐搜索(MAS)与流模型接入条件变分自编码器(CVAE)与波形解码器,训练时联合学习时长与声学潜变量。与拼接语言模型嵌入或句法图增强相比,关键差异是把声调先验显式定位到语素槽位而非泛化语义上下文。在10000句新闻域合成语音的自动语音识别(ASR)评测中,Morpho-VITS词错率(WER)相对VITS基线由13.4%降至9.4%。结论仅在训练语素覆盖充分时成立,含未登录语素时性能明显退化,外推到其他班图语与跨说话人克隆尚未验证。训练成本上双模型均用4卡分布式训练,Morpho-VITS耗时149小时显著高于基线的96小时。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


32. 用随时间指数增长的卷积造出方向相关的混响:从高斯噪声到球谐混响场

原论文 Figure 2:Runtimes (Matlab, Mac M1, 20 run averages) for exponentiating and recursive Algorithms 2, 4 of…

英文题目:Fast Time-Varying Exponentiated Convolution Methods for Generative Direction Dependent Reverberation

标签:#空间音频渲染 | #信号处理 | #空间音频信号 | #生成模型

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yuancheng Luo:NuSpace Audio, Cambridge, MA, USA

📌 核心摘要

该任务输入为高斯噪声、随机压力场或既有房间脉冲响应,输出为球谐编码且具有方向相关频变衰减的空间脉冲响应,难点在于多通道测量与数值仿真昂贵而衰减需同时随时间频率方向平滑变化。方法先定义固定输入与阶数递增滤波器幂加权求和的时变指数化卷积算子,将频率衰减率编码为可指数化的滤波器幅值。接着用分治递归将其加速到近对数线性复杂度,其输出进入下一步的方向扩展。然后证明该算子与线性变换可交换,从而可直接作用于球谐系数或球面网格并经球谐乘积实现方向滤波。最后由非平稳高斯过程采样方向相关混响时间,并经二阶锥规划拟合近最小相位滤波器以生成目标衰减场。相对固定核平滑或镜像源法,关键差异是噪声经指数化卷积直接长成混响而无需额外延迟,使频率衰减与方向调制统一在同一算子内。原文未提供可核对的关键定量结果。其结论适用边界受限于低阶球谐与平滑混响时间假设,高频小混响与稀疏网格下会出现空间混叠等失败条件,尚未验证高阶复杂房间的外推范围;该工作的计算量为近对数线性复杂度,实验在Matlab与Mac M1硬件上测得运行曲线。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


33. 音节不够一秒、标签只有十个:ToneCL 用保调增强做对比预训练

原论文 Figure 1:Random MFCCs for four different Mandarin tones from (a) Google Translate text-to-speech, (b) the…

英文题目:ToneCL: Contrastive Learning for Few-Shot Syllable-Level Tone Classification

标签:#音频分类 | #对比学习 | #少样本 | #跨语言 | #语音

评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Qisheng Liao:机构信息未在 arXiv HTML 中可靠披露
  • Youngah Do:Department of Linguistics;The University of Hong Kong

📌 核心摘要

输入为时长不足1秒的孤立或伪孤立音节语音,输出为该音节的声调类别,难点在于连续语音中共发音遮蔽声调线索、多说话人音高差异大且田野场景仅能提供每类数十个标注样本。方法链分三步推进:先将无标注长句截取首秒固定长度片段并施加保持声调同一性的随机增强以构造正样本对,再用轻量卷积编码器与投影头通过InfoNCE损失学习对增强不变而对不同音节可区分的嵌入,最后丢弃投影头并接入线性分类层,仅用少量目标语言样本微调编码器。与依赖长上下文的大型语音基础模型相比,该机制不依赖秒级语境建模而直接在音节尺度学习基频轮廓不变性,因而更适配短输入与极少标注。在六说话人普通话Tone Perfect的10样本每声调评测设置下,ToneCL-ZH的准确率为91.6%,高于CNN基线的准确率87.8%。跨语言预训练亦能迁移曲折声调的共享结构,减少目标语言对无标注数据的依赖。结论适用边界受限于孤立音节引文调,跨性别与连续语音变调等外推场景尚未验证,跨语言结论也仅限声学线索相近的曲折声调对。硬件层面原文披露预训练与微调均在单卡NVIDIA RTX 4090上分别执行500轮与200轮小批量训练,训练成本未给出完整耗时。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


34. 不拼向量而是换切分:用三种编码器视角训练同一个解码器

原论文 Fig. 1:Discrete speech tokenization.

英文题目:Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR

标签:#语音识别 | #数据增强 | #向量量化 | #大语言模型

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Paul Moïse Gangbadja:机构信息未在 arXiv HTML 中可靠披露
  • Mickael Rouvier:机构信息未在 arXiv HTML 中可靠披露
  • Fabrice Lefèvre:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

离散令牌自动语音识别(Automatic Speech Recognition,ASR)以语音波形为输入并输出文本转写,难点在于单一自监督学习(Self-Supervised Learning,SSL)编码器的量化偏置会传导给大语言模型(Large Language Model,LLM)解码器。所提多视角离散令牌增强先用 HuBERT-Large、WavLM-Large 和 MMS-300M 等冻结编码器分别提取特征并经 K 均值、去重和字节对编码(Byte-Pair Encoding,BPE)生成互补令牌视图,再用编码器标签分隔词表并以共享 Qwen2.5-0.5B 解码器将全部视图映射到同一转写。推理时既可用单编码器保持原有成本,也可对多视角假设做投票式系统组合(Recognizer Output Voting Error Reduction,ROVER)。与已有融合方法相比,该方法不在输入端拼接嵌入或令牌流,而是把编码器差异保留为训练正则。与独立基线相比,LibriSpeech test-other 上最佳单视角词错率(Word Error Rate,WER)从 9.55%降至 8.13%,test-clean 上从 4.08%降至 3.30%,ROVER 进一步降至 3.03%和 7.38%。在LibriSpeech test-clean评测设置下,多视角训练后WavLM视角的WER为3.30%,低于独立基线WavLM的WER 4.08%。该结论适用边界受限于LibriSpeech 960小时训练的英文朗读语音,在Loquacious通用域上仅部分视角改善,YODAS子集出现95%至121%的严重失配构成失败条件。训练成本方面原文仅说明硬件为NVIDIA A100或V100 GPUs且训练5个epoch,推理开销未见延迟或吞吐实测,向新域外推尚未验证。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


35. 联邦多语语音大模型:编码器与解码器谁更怕客户端漂移

原论文 Figure 1:Speech-LLM architecture: encoder \\mathcalE maps speech \\mathbfx to frame-level features; connector…

英文题目:Federated Multilingual Speech-LLMs: Architecture and Aggregation Strategy Benchmarking

标签:#语音识别 | #联邦学习 | #多语言 | #LoRA | #音频大模型

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Jordi Luque:机构信息未在 arXiv HTML 中可靠披露
  • Aleix Sant:机构信息未在 arXiv HTML 中可靠披露
  • Fernando López:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理多语言自动语音识别的联邦学习问题,输入为分散在316个说话人客户端的8种欧洲语言语音,输出为对应语种转写文本,难点是语言、说话人、信道三重异构引发的客户端漂移。方法链分4步推进:语音编码器将波形映射为帧级声学特征,跨模态连接器经帧堆叠与线性投影把声学表征对齐到文本嵌入空间,语言解码器以自回归方式生成转写,联邦服务器以FedAvg或FedProx聚合各客户端的低秩适配器与连接器更新。相比以往整体微调单体编码器的做法,该文按编码器、连接器、解码器拆分优化对象并引入近端正则对抗漂移,意义在于揭示语言先验容量对联邦鲁棒性的调节作用。在Multilingual LibriSpeech测试集上,Whisper加EuroLLM在解冻编码器并差异化调参后词错率达到0.117,相对同架构冻结编码器FedAvg基线0.133有明显下降。结论仅适用于朗读类英语主导数据与1.1B至3B规模解码器,未验证自发对话、强噪声及更大规模模型的迁移能力。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


36. 先听清再推理:用声音证据校准无标签测试时更新

原论文 Figure 2:Layer-wise perceptual reliance across MMAR and MMAU for Qwen2.5-Omni-3B and Qwen2.5-Omni-7B.

英文题目:Listen Then Reason: Perception-Grounded Test-Time Reinforcement Learning for Large Audio-Language Models

标签:#音频问答 | #测试时自适应 | #强化学习 | #音频大模型

评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jiaheng Dong:机构信息未在 arXiv HTML 中可靠披露
  • Xiaofeng Yu:机构信息未在 arXiv HTML 中可靠披露
  • Jean Honorio:机构信息未在 arXiv HTML 中可靠披露
  • Abhirup Ghosh:机构信息未在 arXiv HTML 中可靠披露
  • Hong Jia:机构信息未在 arXiv HTML 中可靠披露
  • Ting Dang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理音频问答(Audio Question Answering,AQA),输入为音频片段 \(a\)、自然语言问题 \(q\) 与 \(J\) 个候选项,输出为解析答案与推理轨迹,难点在于大音频语言模型(Large Audio-Language Model,LALM)易绕开声学证据而依赖语言先验作答。方法链分为三步:先对每条采样轨迹做完整音频条件与文本不可见音频遮蔽条件两次教师强制(teacher-forcing)前向,以平均对数概率差量化轨迹级声学 grounded 程度 \(g_i\);再对比支持多数伪标签 \(m\) 的轨迹与异议轨迹的平均得分差得到声学 grounded 边际 \(s\),并在小批量内标准化后映射为可靠性权重 \(r\);最后将该权重乘以投票边际 \(v(\hat{o}_i)-1/J\) 形成感知 grounded 优势 \(A_i\) 并代入分组相对策略优化(Group Relative Policy Optimization,GRPO)更新。与标准无标签测试时强化学习(Test-Time Reinforcement Learning,TTRL)只奖励多数一致不同,该机制在声学不支持多数票时压低更新幅度,从而保留低概率正确路径。在 MMAR 上 Qwen2.5-Omni-7B 的 Avg@8 相对基线提升 4.6 个点,在 MMAU 上提升 4.9 个点,显示了声学 grounded 对期望准确率的增益。该结论目前仅在选择题推理与同系模型上验证,对开放式问答与跨架构迁移尚未证明。原文仅说明使用 1 张 H100 与 1 张 A100 做 LoRA 更新,未披露训练时长与推理延迟等部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


37. 俳句的停顿为何难念:HaikuS2S 用两段微调把 5-7-5 念出节奏

原论文 Figure 1:Block diagram showing our cascaded haiku spoken dialog system deployed in ESPnet-SDS.

英文题目:HaikuS2S: A Cascaded System For Responding In Verse

标签:#文本到语音 | #SFT | #韵律 | #语音 | #数据集

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Devangi Sharma:机构信息未在 arXiv HTML 中可靠披露
  • Sophia Judicke:机构信息未在 arXiv HTML 中可靠披露
  • Glenda Tan:机构信息未在 arXiv HTML 中可靠披露
  • Conrad Schaumburg:机构信息未在 arXiv HTML 中可靠披露
  • Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作针对口语俳句回应任务:输入为用户语音查询,输出为满足英语5-7-5音节结构、带分行停顿的俳句朗读音频,难点在于通用合成难以复现诗体节奏、行末停顿与情感语调。系统采用单说话人三级级联流水线:自动语音识别(automatic speech recognition,ASR)将语音转写为文本,大语言模型(large language model,LLM)按提示生成三行俳句并经字形到音素(grapheme-to-phoneme,G2P)元音计数校验触发重生成,最后文本到语音(text-to-speech,TTS)将含专用换行标记的文本合成为波形。前级输出依次作为后级输入,专用换行标记为停顿学习提供显式条件。与仅通用诗歌微调相比,先通用诗歌再俳句数据的两阶段策略使极小领域数据仍可收敛。在498首自录测试集评测下,为检验朗读可懂度与韵律对齐效果,Stage 2的WER为0.324,低于Baseline的WER 0.425,表明先通用诗歌再俳句数据的两阶段微调有效提升了发音准确性与诗体节奏还原能力。该结论仅适用于单说话人英语手机录音朗读,未验证多说话人、其他诗体与开放噪声对话的外推。原文未披露训练硬件成本与推理延迟。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


38. 原型挤在一处时,零样本换声为何更难泛化到没见过的说话人

原论文 Fig. 1:Histogram of pairwise angles between ECAPA-TDNN speaker prototypes directly after initialization,…

英文题目:Understanding Hyperspherical Geometry of ECAPA-TDNN Embedding and Its Impact on Zero-Shot Voice Conversion

标签:#语音转换 | #正则化 | #0 样本 | #语音 | #主观评测

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Mathilde Abrassart:机构信息未在 arXiv HTML 中可靠披露
  • Nicolas Obin:机构信息未在 arXiv HTML 中可靠披露
  • Axel Roebel:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

零样本语音转换以源语音内容与目标说话人短参考为输入,输出保留内容但贴近目标音色的语音,难点在于说话人编码器对训练未见说话人的条件空间覆盖不足。论文先以旋转不变角统计与全局及局部参与率刻画 ECAPA-TDNN 分类器原型在单位超球面的集中与塌缩,再对原型施加铰链式 Riesz 对数能量与参与率最大化联合约束以推开近邻并抬升有效维度,最后将对应编码器接入 Fast-VGAN 联合训练并在未见说话人上评测泛化。相对仅调尺度的角间隔基线,该几何约束直接优化原型全局布局而非依赖批次采样间接分离。在 LibriTTS-R 约 250 小时训练并于 VCTK 未见说话人以每条件 20 个性别均衡转换对评测时,正则化 Fast-VGAN 词错误率由 6.54% 降至 5.97%,Resemblyzer 余弦相似度由 0.65 升至 0.69,UTMOSv2 由 2.47 升至 2.70。作者承认远距离泛化仅为关联证据且双正则未分离,单一种子与小规模听测限制外推。原文未披露训练推理计算成本与优化器超参数。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


39. 长尾之下适度再平衡:平方根采样为何优于自然与均匀采样

原论文 Figure 1:Overview of our data-centric NVV-aware ASR pipeline, consisting of cross-dataset label…

英文题目:Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track~1 System for the NVVSpeech Challenge

标签:#语音识别 | #SFT | #多语言 | #低资源 | #语音

评分:5.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Shangyue Jia:机构信息未在 arXiv HTML 中可靠披露
  • Jingru Ma:机构信息未在 arXiv HTML 中可靠披露
  • Yangzhuo Li:机构信息未在 arXiv HTML 中可靠披露
  • Daoping Luo:机构信息未在 arXiv HTML 中可靠披露
  • Bowen Tian:机构信息未在 arXiv HTML 中可靠披露
  • Hanchen Lu:机构信息未在 arXiv HTML 中可靠披露
  • Wenze Ren:机构信息未在 arXiv HTML 中可靠披露
  • Yunxiang Chen:机构信息未在 arXiv HTML 中可靠披露
  • Houdun Liu:机构信息未在 arXiv HTML 中可靠披露
  • Shuo Feng:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露
  • Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理含16类非言语发声的语音识别,输入为音频波形与语种标识,输出为词与行内非言语标记交织的单一序列,难点在于跨数据集标签异构与严重长尾导致尾部学习不足。首先将8个异构数据源映射至官方16类分类并剔除不可靠映射,形成统一训练集并保留完整词与标记序列,其输出直接作为采样调度的训练池。接着以平方根类别采样进行第一阶段全参数微调以平滑分布,再从该检查点出发以均匀类别采样继续微调以强化尾部曝光,骨干目标与损失全程固定仅改变样本分布。相对自然采样与完全均匀采样,该调度不改动目标与损失而只调节类别曝光强度,在保留头部监督的同时提升尾部曝光以避免过度均衡带来的整体下降。在本地验证集设置下,平方根采样的验证分数为66.25,高于自然采样的验证分数62.33。该结论限于Qwen3-ASR 1.7B固定骨干与当前数据组合,未验证跨骨干与开放场景外推。其跨语种开放场景与跨骨干迁移效果尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


40. 变换放在训练还是评估?DFD-Lab 用三组实验拆开跨数据集检测的排序与判决

英文题目:DFD-Lab: A Modular Audio-Visual Deepfake Detection Pipeline

标签:#音频深度伪造检测 | #多模态学习 | #音视频 | #数据增强 | #评测协议

评分:5.4/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:后 50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Jan Rybarczyk:机构信息未在 arXiv HTML 中可靠披露
  • Mateusz Roszkowski:机构信息未在 arXiv HTML 中可靠披露
  • Jacek Komorowski:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音视频深度伪造检测以配对的人脸视频与语音为输入,输出二分类真伪判决,难点在于数据集组织、时序对齐与模态融合方式各不相同导致结果难以横向比较。本文所述系统技术报告构建了DFD-Lab统一流水线,先由数据集适配器解析元数据与标签并送入共享预处理,再将人脸裁剪与梅尔特征按时序索引成片段存档,最后由可互换检测器输出二值逻辑值并统一计算排序与分类指标。该工作与已有基准的关键机制差异在于把公共配对表示与私有的融合时序计算彻底解耦,使晚期分数取最大、循环时序聚合与跨模态特征映射三种异构模型共用同一训练评测外壳。在以FakeAVCeleb为训练集、约1000条的Deepfake-Eval-2024过滤子集为外部测试的设置下,Xception最大融合的外部受试者工作特征曲线下面积(area under receiver operating characteristic curve,AUROC)从基线0.504升至JPEG50训练增强后的0.691,而准确率从0.655降至0.538,揭示了排序与决策的背离。结论仅适用于所选外部子集与三种实现,不支持向完整基准或纯架构优劣的外推。原文未披露训练、推理或部署成本,实现声明公开可获取。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


41. 把应变写进光路:振膜集成波导干涉传声器的上限分析

英文题目:The design of an optomechanical microphone using a photonic waveguide interferometer

标签:#音频质量评估 | #形式化分析 | #工业应用 | #模型评估

评分:5.1/10 | 创新 1.1/2 | 技术严谨 0.8/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5

排名:后 50% | 文档类型:理论研究 | arXiv 原文

👥 作者与机构

  • Xiaoyu Niu:机构信息未在 arXiv HTML 中可靠披露
  • Yuqi Meng:机构信息未在 arXiv HTML 中可靠披露
  • Zihuan Liu:机构信息未在 arXiv HTML 中可靠披露
  • Ehsan Vatankhah:机构信息未在 arXiv HTML 中可靠披露
  • Neal Hall:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文任务是以声压为输入、光电流为输出的波导光机械麦克风建模,难点是膜面机械形变与马赫-曾德尔干涉仪余弦非线性耦合决定了线性工作范围。第一步由声学机械转导负责,将声压经薄板弯曲模型转为膜面应变与多圈波导伸长量,输出光程差。第二步由光学转导负责,将上一步的光程差送入片上参考臂与膜上传感臂构成的干涉仪,经多模干涉器合束把相位差转为输出光功率。第三步由读出与噪声评估负责,将光功率经光电探测转为电流,并计入散粒噪声与背腔热机械噪声以推导信噪比、最小可探测压力、过载声压与动态范围。相对电容式与光栅式读出,该拓扑把干涉做在振膜上,使光程本身成为传感元件,省去背极板或光栅背板与高输入阻抗放大环节,但仍需评估探测器及后续电子噪声。在1毫米直径硅膜MEMS麦克风场景的评测设置下,光波导麦克风的指标信噪比为78 dB,高于Knowles 2021器件的指标信噪比73 dB。该结论仅在弯曲刚度主导、无波导力学加载、无传输损耗、小挠度线性与直接强度读出等上限假设下成立,未覆盖频响、指向性、激光相对强度噪声与超声带宽。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


42. 约旦方言低资源语音转写:用自监督预训练加噪声学生训练吃掉未标注语音

英文题目:End-to-end Jordanian dialect speech-to-text self-supervised learning framework

标签:#语音识别 | #自监督学习 | #低资源 | #数据增强

评分:5.1/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:后 50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Ali A. Safieh:机构信息未在 arXiv HTML 中可靠披露
  • Ibrahim Abu Alhaol:机构信息未在 arXiv HTML 中可靠披露
  • Rawan Ghnemat:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文任务是将约旦阿拉伯方言连续语音转写为无变音符号正字法文本,输入为多说话人、多主题社交视频长音频,输出为词序列,难点是方言音系偏离现代标准阿拉伯语且有标语音极缺。方法为四段流水线:先从网红录制、街访、新闻政治讨论等多源采集音视频,经基于静音的语音活动检测切分短句并降采样至16 kHz,剔除短于1秒长于20秒片段并检查语音文本时长比,文本侧去特殊符号、标点、变音符号、重复字符并归一化易混字母;再用Google Cloud Speech初标加速Doccano协作人工校对,形成种子有标集与无标池;然后以53语言跨语言无监督预训练的Wav2Vec 2.0为骨干,冻结特征编码器、加随机线性层以联结时序分类目标微调为教师;最后做噪声学生自训练迭代,教师为无标批生成伪标签,混合干净有标、伪标与高斯噪声、时间伸缩、音调偏移增强批训练更大容量学生,学生经保留验证集评估后成为下一代教师。与仅做预训练加微调范式的区别是在后训练阶段继续注入无标数据并以噪声强制一致性。在12.5小时有标启动、每批2.5小时共5批无标、保留20%验证的同一划分下,第5代学生词错误率0.515、字错误率0.264,相对教师基线0.568/0.279绝对下降约5.3/1.5个百分点。结论仅在该自采子集与单次划分下成立,未验证跨方言、跨领域与多轮方差。原文未披露优化器、学习率、批量、轮数、解码与语言模型配置,训练推理成本仅给出首个教师微调83小时。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。