共分析 34 篇论文


⚡ 今日概览

✅ 筛选入选 34 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#语音识别4 篇████
#全双工语音交互3 篇███
#目标说话人提取2 篇██
#言语神经解码2 篇██
#语音对话系统2 篇██
#语音翻译2 篇██
#主动降噪1 篇█
#文本到语音1 篇█

📊 论文评分排行榜(34 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇Training-Free Pronunciation Transcription via Text…8.5前25%方法研究#语音识别
🥈THA: Weighted Finite-State Text Normalization and…8.5前25%系统技术报告#文本到语音
🥉All In Good Time: Causality-Aware Framework for LLM…8.2前25%方法研究#语音翻译
4.MuseTimbre: Zero-Shot Timbre Transfer by Controlling a…8.2前25%方法研究#音乐生成
5.Seeing Speech: Learning Visible Articulatory Dynamics…8.0前25%方法研究#音视频生成
6.Don’t CLAP: Are Music-Text Models Bag-of-Words?8.0前25%数据集与基准#音乐文本检索
7.A Comprehensive Study of Content Representations for…7.8前25%方法研究#语音合成
8.Evaluating Real-Time Voice Agents: From Component…7.6前25%综述#全双工语音交互
9.Who Says What: Symbolic Trimodal Binding Mechanisms in…7.6前25%方法研究#音视频问答
10.I-Parakeet: Integer-Only Conformer ASR on Mobile NPU7.4前50%系统技术报告#语音识别
11.Adapting Personalized Speech Enhancement for Low…7.1前50%方法研究#目标说话人提取
12.Tracing and Relearning Detection Evidence in Text-to…7.1前50%方法研究#音频深度伪造检测
13.Dialogue-Based Streaming Audio-Visual Target Speaker…7.0前50%方法研究#音视频语音分离
14.Music Source Separation via Stem Discovery7.0前50%方法研究#音乐源分离
15.Synth-JEPA: Joint Embedding Prediction for Renderer…7.0前50%方法研究#音频生成
16.Acoustic-to-Text KV Compression for Full-Duplex Speech…7.0前50%方法研究#全双工语音交互
17.AcoustiClaim: A Numeric Claim Benchmark with…6.9前50%数据集与基准#语音属性识别
18.Symbiotic Architecture for Post-Hoc Audio Extension of…6.9前50%方法研究#音频理解
19.LUMO (Lightweight Unified Multilingual Orchestrator)…6.8前50%系统技术报告#语音对话系统
20.Coupled Meta-Adaptive Filtering for Active Noise…6.8前50%方法研究#主动降噪
21.Inquesto Score: A reliability Protocol For Voice Agents6.7前50%数据集与基准#语音对话系统
22.Training-Free Contextual ASR via SpeechLLM-Based Error…6.7前50%方法研究#语音识别
23.BAT-CLIP: Trimodal Alignment of Brain, Audio and Text6.6前50%方法研究#言语神经解码
24.CLEAR: Online Speech Content Leakage Estimation…6.4前50%方法研究#语音可懂度评估
25.Inference-Time Target Speaker Unlearning in LLM-Based…6.4前50%方法研究#语音识别
26.Learning Natural Conversational Behavior in Tandem…6.4前50%方法研究#全双工语音交互
27.BreathGRU: A Novel Semi-Supervised Bidirectional Gated…6.3前50%方法研究#音频事件检测
28.Attention-Based Adaptive Policies for Simultaneous…6.2前50%方法研究#语音翻译
29.Why Alzheimer’s Speech Screening Fails to Generalize…6.2前50%方法研究#病理语音评估
30.Room Impulse Response Embeddings for Speech…6.0前50%方法研究#语音增强
31.Nearest but Not Dearest: Shared Curator-Feedback…5.9前50%系统技术报告#音乐推荐
32.Asymmetric Classifier-Free Guidance for Target-Speaker…5.8前50%方法研究#目标说话人提取
33.Subject-Invariant Cross-Modal Decoding of Perceived…5.8前50%方法研究#言语神经解码
34.Audio emotion recognition for atypical hearing5.8前50%方法研究#语音情感识别

📋 论文列表

🖼️ 有图的论文会在这里展示首张原论文图;原图链接见对应独立页面。

🥇 文本定范围、语音做选择:不训练也能转写实际读音

原论文 Figure 2:Training-free pronunciation transcription.

英文题目:Training-Free Pronunciation Transcription via Text-Constrained Acoustic Rescoring

标签:#语音识别 | #模型融合 | #语音 | #多语言

评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Hikaru Asano:机构信息未在 arXiv HTML 中可靠披露
  • Yotaro Kubo:机构信息未在 arXiv HTML 中可靠披露
  • So Kuroki:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

面向语音合成数据准备的发音转写任务,输入为语音x与文本w,输出为录音中实际读出的发音序列y,难点在于日语一形多读与口语变体无法仅由单侧线索确定。该方法先由形态分析将文本切分为N个跨度并用词典、字形到发音与规则生成有限候选集与默认读法。接着将完整候选拼接为全序列并用冻结语音到发音模型计算负对数似然声学得分,融合第二打分器时采用级联策略。最后经从左到右贪心搜索逐跨度固定最优读法并辅以裕量检查,将声学证据不足的改动回退至默认读法。与需发音标注训练的语音加文本到发音模型不同,该管线仅在推理时融合词典约束与声学证据,无需三元组训练因而可低成本扩展。在JVS-dev参考文本评测条件下,级联系统的字符错误率(Character Error Rate,CER)为0.15%,低于文本默认基线的字符错误率(Character Error Rate,CER)0.85%。该结论适用边界受限于候选覆盖与冻结打分器匹配,英语仅在开发说话人上初步验证尚未验证大规模外推,且在单块H100硬件上测得推理开销显示贪心搜索比束搜索快3-3.5倍、级联比直接解码快2倍。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 整行一次标注的高棉语归一化:用权重与音节边界过滤器代替分词器

原论文 Figure 4:Size of each class grammar before it is combined into the classifier.

英文题目:THA: Weighted Finite-State Text Normalization and Inverse Text Normalization for Khmer

标签:#文本到语音 | #信号处理 | #语音识别 | #开源工具

评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Seanghay Yath:Digital Government Committee, Cambodia

📌 核心摘要

高棉语文本归一化需把含数字符号的书面串转为可读口语词序列,逆归一化则需把口语词转回书面符号,难点是词间无空格且短数字词常嵌在普通词内部无法逐词分类。Tha先用分类器对整行做最短路径标注,交替生成普通文本与半符号标记以实现分类即切分,再用边界过滤器剔除起止于高棉音节内部的切分以避免误读词内片段。随后逐标记 verbalizer 将每个半符号标记写成目标形式,逆向另加柔性连接处理粘连与空格变体,上一步的标注格输出直接进入下一步约束与改写。与依赖预切词的旧管线相比,关键机制差异是把上下文约束后置到标注格上整行竞争选优,实际意义是无需外部切词器即可在无空格文本上运行并减少跨音节误切。在十类书面标记回环评测任务下,基数词的准确率为100.0%,高于小数类的准确率91.0%。其适用边界是科学计数法、罗马数字与字母代码等尚未覆盖,且整音节同形仍受限需外部词典消歧,失败条件集中于拼写变体与词尾同形数词。该工作无神经训练成本,推理开销在单核笔记本上中位延迟逆归一化为8.6毫秒、正向归一化为3.4毫秒,时间随长度线性增长。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 不等源语音说完就开口:因果对齐如何决定何时等待、何时发声

原论文 Fig. 1:Overview of the data generation pipeline.

英文题目:All In Good Time: Causality-Aware Framework for LLM-Based Simultaneous Speech-to-Speech Translation

标签:#语音翻译 | #多模态学习 | #流式处理 | #大语言模型 | #多语言

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Amir Hussein:Johns Hopkins University, NVIDIA
  • Enas Albasiri:Johns Hopkins University, NVIDIA
  • Travis M. Bartley:Johns Hopkins University, NVIDIA
  • Nourchene Ferchichi:Johns Hopkins University, NVIDIA
  • Ke Hu:Johns Hopkins University, NVIDIA
  • Harishchandra Dubey:Johns Hopkins University, NVIDIA
  • Myungjong Kim:Johns Hopkins University, NVIDIA
  • Zhehuai Chen:Johns Hopkins University, NVIDIA
  • Oluwatobi Olabiyi:Johns Hopkins University, NVIDIA
  • Sanjeev Khudanpur:Johns Hopkins University, NVIDIA

📌 核心摘要

同时语音到语音翻译需在源语音未结束时实时输出保留音色和韵律的目标语音,难点在于缺乏因果对齐训练数据、固定等待策略无法处理语序差异、词法翻译与声学合成共享表征互相干扰。该工作先用蒙特利尔强制对齐器(Montreal Forced Aligner,MFA)获取源语音词级时间戳,再用Awesome-align加多语言BERT得到源转写与目标译文词对齐,经单调化取枢轴构造源左聚合与目标右聚合的因果块;再用解耦架构以流式FastConformer编码器加大语言模型(Large Language Model,LLM)做词法翻译,以流式NanoCodec加说话人嵌入做声学合成;最后以因果平均滞后区分必需等待与冗余延迟。与固定切分相比,因果自适应切分仅在源证据齐备后发射目标词。在CVSS-T西班牙语到英语测试集上,2.5B参数系统文本翻译达到35.2 BLEU,因果延迟相对Hibiki-Zero降低38.8%。该结论限于西班牙语、德语、法语到英语的朗读式短句,未验证长对话、重叠打断与多说话人场景。原文未披露训练时长与推理吞吐成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 冻住生成器只练两条侧路:琴卷保复调音高,微调 CLAP 锁参考音色

原论文 Figure 1:System overview. We freeze Stable Audio 3 Medium, its autoencoder, and its text control (gray)…

英文题目:MuseTimbre: Zero-Shot Timbre Transfer by Controlling a Frozen Music Generator

标签:#音乐生成 | #Adapter | #0 样本 | #音乐

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yuan-Chiao Cheng:Music Informatics Group;Georgia Institute of Technology;Atlanta, GA, USA
  • Zhiyao Duan:Audio Information Research (AIR) Lab;University of Rochester;Rochester, NY, USA

📌 核心摘要

乐器音色迁移需保留复调源演奏的音高组织并替换为另一乐器参考录音的音色,难点在于源录音中音高与音色纠缠且文本标签无法刻画同一乐器内的细腻差别。MuseTimbre冻结预训练音乐生成器Stable Audio 3 Medium,先由多音高估计器Basic Pitch提取源音频的音符与起音二值钢琴卷并经一维卷积编码后以解耦交叉注意力注入,其次由微调后的LAION-CLAP音乐音频分支将参考音频压缩为512维全局嵌入并以自适应层归一化调制各层特征,最后以整流流速度回归目标联合训练两路控制。与冻结编码器加专用生成器或文本指定音色等已有路线相比,该设计以显式音高通路处理复调,以可学习的全局音色通路实现跨内容音色泛化。在PHENICX-Anechoic、MAESTRO v3测试划分、GOAT与Bach10构成的304对跨数据集跨乐器评测中,系统取得57.6%的音色命中率与0.316的帧F1,音色大幅领先而音高保持接近最强基线。该结论仅适用于谐波乐器5秒短片段迁移,依赖转录器与标签器精度,极端复调与强失真音色外推尚未验证。原文披露单张RTX 5090上25步Euler采样约1秒可生成5秒44.1kHz音频,但未披露完整训练耗时与部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 把嘴唇运动拆成三个方向:用记忆检索与拓扑组合做语音驱动三维人脸

原论文 Figure 1:How do we model physically grounded and articulatory-consistent facial motion from speech?

英文题目:Seeing Speech: Learning Visible Articulatory Dynamics for Speech-Driven 3D Facial Animation

标签:#音视频生成 | #检索增强 | #语音 | #发声与构音

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Hyung Kyu Kim:Chung-Ang University;Seoul, South Korea
  • Byungchan Hwang:Chung-Ang University;Seoul, South Korea
  • Hak Gu Kim:Chung-Ang University;Seoul, South Korea

📌 核心摘要

语音驱动3D面部动画需由语音声学输入生成顶点级面部运动输出,难点在于声学到运动的一对多映射与唇颌多方向协调约束下的语音一致性保持。该框架先由语音构音记忆负责语音到构音的映射,其以声学查询检索键值记忆中的扩张张开前突三向运动特征,并以内容特征交叉注意力精化得到方向性位移输出。接着拓扑感知构音合成负责运动到表面的组合,其接收三向位移并经图卷积注入网格邻域协调,再经时序卷积建模短时依赖并投影为拓扑感知残差。随后逐顶点门控调制负责区域自适应,其依据唇颌与面颊等不同可变形性对残差加权,从而得到表面一致的最终顶点运动。相比整体顶点回归与固定混合权重方法,该设计将可解释的方向性先验与网格局部一致性显式解耦,使中间表示对应可见构音并保留时序动态意义。在VOCASET测试集下,本方法的FVE指标为0.771,低于StreamingTalker的FVE指标0.782。其适用边界在于仅建模无头部位移的唇颌可见构音,未包含齿舌内口结构与眨眼等上脸随机动态。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 交换一个属性就分不清:音乐文本模型的词袋式表征

英文题目:Don’t CLAP: Are Music-Text Models Bag-of-Words?

标签:#音乐文本检索 | #基准设计 | #基准测试 | #音乐

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yuan-Chiao Cheng:机构信息未在 arXiv HTML 中可靠披露
  • Alexander Lerch:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

任务输入为10秒真实音乐录音与两条词集合完全相同、仅乐器属性绑定相反的英文短描述,输出为音频与哪条描述相似度更高,实际难点在于词袋重叠即可蒙混过关而谁具有何种属性的细粒度错误难以暴露,且语言先验会掩盖听觉证据。该方法先由单标注员裁剪双乐器片段并标注音色形容、主奏伴奏分工与首次进入顺序三维之一,再用严格模板与自然改写生成原描述与交换描述并保持用词一致。接着以对比模型的音频文本余弦相似度与大音频语言模型的是否匹配问答进行判定,同时设置无音频选择基线,随后用一致性、先验平衡准确率与对称混音对照剥离先验并检验文本嵌入距离。与已有CLAP整体相似度评价不同,其关键机制差异在于固定词袋只扰动绑定关系并构造先验相消的对称音频对,实际意义是直接检验嵌入是否保留属性归属。在800对描述上4个对比模型平均交换准确率仅0.431至0.519且不能跨三属性高于随机,大音频语言模型Qwen2-Audio-7B-Instruct平均0.681但主要跟随无音频选择。在MASB-Order基准下,MS-CLAP的准确率为0.538,高于LAION-CLAP的准确率0.508。结论是CLAP类分数对细粒度音乐语义不敏感,适用边界为双乐器英文短描述与三类属性,未验证长段落、多乐器与生成式评价,原文未披露训练与部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 内容表示的容量与目标如何决定说话人解耦:同一合成器下的统一测量

原论文 Figure 1:Diagram of the evaluation methodology.

英文题目:A Comprehensive Study of Content Representations for Speech Synthesis

标签:#语音合成 | #评测协议 | #向量量化 | #说话人验证 | #语音

评分:7.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Diego Torres:机构信息未在 arXiv HTML 中可靠披露
  • Axel Roebel:机构信息未在 arXiv HTML 中可靠披露
  • Nicolas Obin:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该研究解决语音内容表征 Content Representation 缺乏可比生成式评估的问题,输入为原始波形经待测编码器得到的内容编码,输出为仅以该编码为条件的重建语音,目标是在不提供说话人标识或参考音频的前提下度量内容保真与身份韵律泄露。方法为无参考生成式探针:全部表征统一到 50 Hz,每个表征独立训练一个同构声学解码器,以流匹配 Flow Matching 生成梅尔频谱,再经 Vocos 声码器合成 24 kHz 波形,最后用自动语音识别、说话人验证与基频工具对比原始与生成音频。相对以往允许解码器同时看到内容与说话人参考的语音转换评估,该设计消除了身份旁路混杂,使生成音频中的说话人相似必然穿过待测表征。在 LibriTTS test.clean 上,256 码本向量量化自动语音识别 VQ-ASR 将说话人验证等错误率 EER 推至约 46.6%,接近 50% 随机猜测,性别探针精度回落至约 53.0%,接近 52.9% 数据集基线,代价是差分词错误率 dWER 从连续 HuBERT 的约 0.5% 上升至约 2.7%。该结论限于干净朗读英语与同一 67M 解码器容量下的下界度量,快速口语与跨语言外推尚未验证。原文未披露训练推理成本与延迟吞吐。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 实时语音智能体为何不能只看一个数字:架构约束、时机恢复与落地状态的联合刻画

英文题目:Evaluating Real-Time Voice Agents: From Component Quality to Grounded Outcomes

标签:#全双工语音交互 | #系统综述 | #轮次切换 | #评测协议 | #模型评估

评分:7.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:综述 | arXiv 原文

👥 作者与机构

  • Shivam Negi:机构信息未在 arXiv HTML 中可靠披露
  • Arpit Rawat:机构信息未在 arXiv HTML 中可靠披露
  • Rashi Jain:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理实时语音智能体如何从能说话推进到能办事的评估问题,输入为连续双工音频交互,输出为按时接话、受扰恢复与外部状态一致的任务结果,难点在于延迟、打断重叠与工具调用后果无法用单一转写或问答分数刻画。作者先以种子文献加arXiv检索与程序化PDF校验构建38篇语料,再按产生语音、决定说话时机与判定交互成败划分为6类并逐篇提炼问题机制证据,最后综合为架构受部署约束、评估转向状态验证与多人假设瓦解三项主张并提出TRG报告标准。与已有语音语言模型综述只谈架构训练不同,该工作把级联流水线、轮次投射与智能体评测纳入同一框架,指出双工行为可由控制策略实现而不必依赖双工架构。在自托管延迟评测设置下,流式级联的TTFA指标为755 ms,低于本地Qwen3-Omni的TTFA指标146 s。结论仅适用于英语可读文本语料与近年双工文献,对非英语、硬件差异与长期部署外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 谁说了什么:音视大模型用时间与位置编号完成三模态绑定

原论文 Figure 20:Illustration of trimodal symbolic binding mechanisms in VAAR task.

英文题目:Who Says What: Symbolic Trimodal Binding Mechanisms in Audio-Visual LLMs

标签:#音视频问答 | #统计分析 | #音视频 | #可解释性

评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jihoo Jung:KAIST
  • Youngjoon Jang:VGG, University of Oxford
  • Joon Son Chung:KAIST

📌 核心摘要

多说话人单镜头视频的谁说了什么任务要求同时输入视频帧序列与音频流及文本问句,输出说话人身份与话语内容的跨模态对应,其难点是多人同框与话语交错导致音视频归属混淆。所提链条先由受控合成视频构造声学锚定视觉检索与视觉锚定音频检索任务,再用表征相似性分析定位时间标识与位置标识的层级分布,接着用因果中介补丁验证三阶段符号绑定,最后将主动说话人检测Active Speaker Detection框叠加为视觉提示并做轻量微调以修复瓶颈。与直接语义关联不同,该工作提出语音按时序编号而图像按空间编号,再经锚标识检索到目标标识选择再到特征检索完成绑定。在DailyOmni上Qwen2.5-Omni 7B经提示加微调后准确率达到71.09%,较基线64.33%提升约6.76个百分点,证明修复目标标识选择可泛化到通用音视频基准。结论限于单镜头多说话人英语式短词场景,对多镜头切换、重叠语音与噪声环境尚未充分验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 不留浮点的 Conformer:I-Parakeet 如何在手机 NPU 上跑起 0.6B 语音识别

英文题目:I-Parakeet: Integer-Only Conformer ASR on Mobile NPU

标签:#语音识别 | #模型量化 | #端侧运行 | #高效推理 | #语音

评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Taichi Nishimura:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为80维对数梅尔谱图Log-Mel Spectrogram,输出为联结时序分类Connectionist Temporal Classification(CTC)转写,难点是0.6B参数Conformer的归一化、Softmax与非线性仍需浮点回退而无法完全卸载到移动端神经网络处理器Neural Processing Unit(NPU)。方法链分三步:先将内容分支与位置分支按各自量化尺度重归一到统一分数网格并把相对位移实现为整数索引搬移,再用极小化极大准则直接拟合Swish输出的多项式近似,最后对批量归一化Batch Normalization(BN)输出与预编码器分别采用宽网格与分位数定标。相对已有整数推理仅拟合Sigmoid或Tanh且忽视双分支异尺度的做法,该工作把误差目标对准最终激活输出并保留全整数数据流。在LibriSpeech test-other上整数整机系统相对浮点基线损失约1.21个百分点并实现远低于实时的延迟,证明现代Conformer可摆脱浮点推理。该结论目前仅在特定手机与静态图分段编译下验证,长语音、噪声与多语言外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 从保音质到选对人:给个性化增强加上嘴部线索的低延迟视听提取

英文题目:Adapting Personalized Speech Enhancement for Low-Latency Audio-Visual Target-Speaker Extraction

标签:#目标说话人提取 | #迁移学习 | #音视频 | #严格因果 | #主观评测

评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Rayhan Rashed:机构信息未在 arXiv HTML 中可靠披露
  • Senja Filipi:机构信息未在 arXiv HTML 中可靠披露
  • Ross Cutler:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

在线音视频目标说话人提取需从混合语音中重建指定人声,同时应对目标独讲、混讲和目标缺席三种会议状态。个性化语音质量增强(Personalized Voice Quality Enhancement,PVQE)听感好,但在LRS3双人混合上输出更接近干扰人的比例达46%,即出现目标混淆(Target Confusion)。本文提出音视频个性化语音质量增强(Audio-Visual PVQE,AV-PVQE),冻结注册(Enrollment)编码器得到176维固定声纹向量,用音视频自监督模型(AV-HuBERT)卷积编码器提取嘴部特征并经投影与声纹做门控残差融合,送入PVQE原有说话人条件端后联合微调重建网络,全程只用当前及历史帧,算法与缓冲延迟为20 ms。与从零训练的提取器不同,该方法复用已具备去噪去混响能力的增强权重,仅新增门控融合层进行适配。这种设计使视觉嘴动负责选对目标,声纹残差负责保真,从而兼顾选择可靠性和听感质量。在LRS3上目标偏好率从54.17%升至98.38%,在MTM会议上相对在线自回归基线AVASE的尺度不变信噪比改善量(Scale-Invariant Signal-to-Noise Ratio improvement,SI-SNRi)领先6.58 dB,在AMI个性化P.835总体质量上领先0.57 MOS。该结论限于英语访谈与会议录音,原文未验证噪声、回声和混响抑制是否同步保留,未报告设备端实测耗时。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 固定声码器之后,检测证据还剩多少在声学模型里

原论文 Figure 1:Isolating which TTS stage supplies the detection evidence, with the source corpus and channel…

英文题目:Tracing and Relearning Detection Evidence in Text-to-Speech Systems

标签:#音频深度伪造检测 | #生成对抗网络 | #文本到语音 | #领域适应 | #语音

评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Eunji Shin:机构信息未在 arXiv HTML 中可靠披露
  • Kyudan Jung:机构信息未在 arXiv HTML 中可靠披露
  • Jihwan Kim:机构信息未在 arXiv HTML 中可靠披露
  • Minwoo Lee:机构信息未在 arXiv HTML 中可靠披露
  • Jaegul Choo:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频深度伪造检测(audio deepfake detection)要区分真实录音与文本到语音(text-to-speech,TTS)合成,但基准等错误率(equal error rate,EER)混杂了声学模型、声码器、语料和信道因素,无法定位证据来源。本文固定 BigVGAN 声码器,先对比重采样源、真实梅尔频谱(mel spectrogram)重建与 F5-TTS 生成的分离度以追踪证据阶段,再用对抗微调只更新声学模型并用固定检测器度量 EER 变化,最后将检测器在微调输出上适配以检验是证据消失还是证据不可见。关键机制差异在于判别器以真实梅尔重建为真、以生成梅尔经同一声码器输出为假,从而剥离声码器身份并让梯度经可微声码器回传声学模型。在 LibriSpeech 上微调使 XLS-R SLS 的 EER 从 15.46% 升至 19.42%,而在 VCTK 上适配后该微调输出 EER 可降至 0.10% 量级且向未见基线输出迁移。结论仅适用于所测 F5-TTS 加 BigVGAN 流水线与三款固定检测器,未验证其他声码器、其他 TTS 架构与野外信道迁移。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. 在真实轮转对话里做在线提取:用预测的说话活动给分离器指路

原论文 Figure 1:Online AV-TSE under third-party interference.

英文题目:Dialogue-Based Streaming Audio-Visual Target Speaker Extraction with Predictive Dialogue Information

标签:#音视频语音分离 | #迁移学习 | #轮次切换 | #流式处理 | #音视频

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Shuhan Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Wenxuan Wu:机构信息未在 arXiv HTML 中可靠披露
  • Haizhou Li:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

在线音视频目标说话人提取以混合语音与目标人脸轨迹为输入,输出目标波形,难点是流式模型看不到未来,在自然停顿、话轮交接和目标静默段易把对话伙伴或第三方串话漏进输出。方法先用语音大模型改造的目标说话人语音活动预测从重叠混合直接预测未来2秒目标与伙伴活动,输出25Hz预测表征与256类联合状态。接着把当前块之前最近2秒预测表征按0.2秒池化为至多10个令牌,经投影与位置编码后由当前音频瓶颈特征经多头注意力检索并融合。最后融合后特征与历史自注册记忆和同步主动说话人检测特征共同进入音视频融合与个人语音活动检测门控分离器,以两遍训练约束目标存在与缺失段。相对只用停顿能量韵律的声学预测,新机制引入问答投射与话轮完整性等语义级轮转知识并实现混合输入下的目标条件预测,因而更互补历史信息并抑制无关干扰泄漏。在IEMOCAP-Dialog3Mix评测下,全上下文USEV的TP SI-SNR为10.03 dB,高于无上下文USEV基线的TP SI-SNR 9.04 dB。该结论限于双人对话加单路无关干扰的短窗评测,在80%以上重叠段不再获益且未验证移动视角与多干扰泛化。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 不用人工给例子也能分离:用递归生成音频查询来发现乐器干声

英文题目:Music Source Separation via Stem Discovery

标签:#音乐源分离 | #流匹配 | #音乐 | #Transformer | #主观评测

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • V. Valtteri Kallinen:机构信息未在 arXiv HTML 中可靠披露
  • Eloi Moliner:机构信息未在 arXiv HTML 中可靠披露
  • Lauri Juvela:机构信息未在 arXiv HTML 中可靠披露
  • Vesa Välimäki:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音乐源分离需从单路混合音频中恢复数量与类别均未知的乐器分轨,固定词表难以覆盖长尾乐器而人工提供音频或文本查询又难以规模化。本文提出盲分离框架MuS3D,先由干茎嵌入生成器以混合音频与已生成查询为条件经条件流匹配递归生成下一个查询嵌入与残差嵌入,再将每个查询嵌入送入查询型分离器提取波形,并以残差嵌入的停止阈值判断终止。生成器采用12层DiT对128维PaSST嵌入建模,分离器验证了偏置调制的BS-Locoformer判别路线与基于SAM-Audio微调的DiT-Sep生成路线,两路均复用同一自动发现的查询集合。与依赖人工示例或细粒度文本描述的查询分离相比,该框架以可自动生成的音频查询为接口,避免了为每首混音提供匹配示例及语言模型细粒度识别失败的问题。在MoisesDB组VDBGP评测设置下,MuS3D(DiT-Sep)的Judge得分为4.7±0.45,高于MusicFlamingo加SAM-Audio的Judge得分4.2±1.24。干茎发现在组级别精度更高而召回仍有缺口,且生成查询与真值查询的Judge得分持平而MERT-MSE至多增加0.01,表明误差主要来自检出而非分离。该结论的适用边界受限于10秒片段内正确检出的子集,整曲跨段一致性与漏检召回尚未验证,且采样生成加分离两阶段带来推理开销的计算量负担。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 不用渲染候选声音,如何在参数诱导的音频几何中搜索合成器参数

原论文 Figure 1:Synth-JEPA training and inference.

英文题目:Synth-JEPA: Joint Embedding Prediction for Renderer-Free Synthesizer Parameter Search

标签:#音频生成 | #自监督学习 | #多模态学习 | #主观评测

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ben Hayes:机构信息未在 arXiv HTML 中可靠披露
  • Haokun Tian:机构信息未在 arXiv HTML 中可靠披露
  • Stefan Lattner:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

合成器声音匹配需从目标音频反推含连续与离散控制的合成器参数,逆映射病态且通用音频表示难以优化,直接搜索又需逐候选渲染。Synth-JEPA从配对参数与渲染音频学习相互预测的音频表示与参数表示,音频编码器与参数编码器经双向跨域预测器对齐,并以SIGReg正则防坍缩,使音频空间几何由参数对应关系塑造。推理时目标音频仅编码一次,候选参数经参数编码器加预测器直接在嵌入空间以均方误差打分,先用JADE进化搜索粗选,再用Adam仅对连续参数精修,全程搜索无需调用合成器。在域内Surge XT预设评测设置下,Synth-JEPA(SIGReg)的MSS指标为8.44,低于EMA Teacher的MSS指标11.52。其边界在于训练仅见均匀先验合成器声音,在NSynth尚保持最优或次优,在FSD50K宽分布上多尺度频谱距离落后于对数梅尔代理。该结论的适用边界是仅在上述三套目标上验证,尚未验证其他合成器与更宽录音分布下的外推。训练成本为批量64训练1M步,推理开销在RTX 3090硬件上按单目标计时报告。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 边听边写再删录音:用听音空隙把声学缓存换成文字记忆

原论文 Figure 1:Overview of acoustic-to-text KV compression: native streaming (top) and the proposed method…

英文题目:Acoustic-to-Text KV Compression for Full-Duplex Speech Models

标签:#全双工语音交互 | #模型压缩 | #知识蒸馏 | #LoRA | #流式处理

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yejin Lee:机构信息未在 arXiv HTML 中可靠披露
  • Seungbeom Kim:机构信息未在 arXiv HTML 中可靠披露
  • Yongha Lee:机构信息未在 arXiv HTML 中可靠披露
  • Kyuhong Shim:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

全双工语音模型需边听边说并长期累积声学键值缓存,语音表示比文本占用更多序列位置,输入结束后才压缩无法削减流式峰值。方法链分三步:先在每秒双工单元的听音空闲内用转录侧通道增量生成文本片段并留作上下文,再以词级强制对齐监督训练该通道并用冻结教师做原生位置蒸馏以约束听说行为,最后在超预算时逐出旧声学状态而保留文本与近窗。与保留压缩语音表示的已有压缩相比,该机制差异在于把记忆显式语言化并与流式逐出联动,兼顾可查询性与实时性。在LongSpeech十分钟会话评测任务下,4K预算下所提声文压缩方法的峰值指标为4.02K,低于同适配无逐出基线模型的峰值指标11.35K,降幅对应原文报告的64.6%。该结论限于MiniCPM-o 4.5单基座与英语长语音转录、时序问答和摘要任务,未验证其他全双工架构与噪声多说话人外推。原文未披露训练硬件与总成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 数字声称能否对上仪器:AcoustiClaim 按参考可读位置分层验算

原论文 Figure 1:One recording decoded twice by our system, on the two-talker mixture and on its clean twin.

英文题目:AcoustiClaim: A Numeric Claim Benchmark with Instrument Ground Truth

标签:#语音属性识别 | #基准设计 | #基准测试 | #模型评估

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Sheng-Tse Lin:机构信息未在 arXiv HTML 中可靠披露
  • Siyuan Zhai:机构信息未在 arXiv HTML 中可靠披露
  • Chien-Liang Kuo:机构信息未在 arXiv HTML 中可靠披露
  • Massa Baali:机构信息未在 arXiv HTML 中可靠披露
  • Bhiksha Raj:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为截断至 10 s 的未归一化原始波形,输出为自由文本中的数值型声学声明,难点在于人类意见分与裁判模型都无法判定信噪比(Signal-to-Noise Ratio,SNR)或抖动(Jitter)等数值是否忠于信号。先由解析器以自由文本为输入负责按量名与单位抽取10个仪器量并输出声明与仪器真值配对及覆盖率与选择风险,再将该配对结果送入分层语料构造负责按参考可读位置分档并输出参考标签决定每个量在混合或干净孪生分支上被评分。最后将分层后的待评声明送入参考系统负责用冻结编码器加解码器输出数值与对数方差并经校准阈值输出选择性陈述,其与已有意见分或裁判模型评分的关键差异在于直接以仪器为真值并可拒答,实际意义是把数值幻觉转为可验证的选择性测量。在 Libri2Mix 双人混合与 AMI 远场会议上的评测显示,207 个单元中 49 个不同取值不足 5 个,158 个可排序单元中仅 8 个斯皮尔曼相关(Spearman Correlation)超过 0.3,且除 3 个外误差均不低于常数预测基线。在Libri2Mix双人混合语料评测下,参考系统的信噪比斯皮尔曼相关为+0.972,高于匹配岭基线的斯皮尔曼相关+0.944。结论仅适用于所定义的 10 个仪器量与两种语料,外推至混响会议语速或真实病理嗓音尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 不碰大模型权重,如何把声音写进它的短期记忆

原论文 Figure 1:The conventional “monolithic” architecture and the proposed “symbiotic” architecture, which can…

英文题目:Symbiotic Architecture for Post-Hoc Audio Extension of Frozen Language Models

标签:#音频理解 | #前缀微调 | #音频大模型 | #高效推理

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yotaro Kubo:机构信息未在 arXiv HTML 中可靠披露
  • Qi Sun:机构信息未在 arXiv HTML 中可靠披露
  • Yujin Tang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频语言模型需将长音频序列预填充为键值缓存再生成文本,传统单体架构用冻结或微调的大语言模型自身完成该转换,导致音频预填充成本随骨干宽度增长并伴随灾难性遗忘。本文提出共生架构,先由WavLM-large编码器提取音频表示,再经卷积注入器直接生成各层键向量与值向量并写入冻结Qwen3-0.6B的短期记忆,最后由冻结大语言模型基于注入记忆完成转写与问答。相比仅调输入嵌入的编码器方案,该机制提供逐层可控上下文而不改权重,相比单体微调则保留文本能力并解耦注入成本。注入器以堆叠LConv卷积建模局部上下文并经降采样映射到键值空间,再经尺度匹配对齐骨干分布并以噪声位置旋转增强长序列鲁棒性。在LibriSpeech测试集下,Symbiotic的WER为2.07%,低于Encoder-only的WER 2.33%。该结论限于Qwen3-0.6B紧凑骨干与英文朗读语音为主的训练分布,对更大骨干、噪声远场与长时通用音频的外推尚未验证。原文披露了H100上批量为4的预填充耗时对比,但未披露完整训练算力与端到端部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 树莓派上不联网也能说话:LUMO 如何把识别、生成与合成装进 8 GB 内存

原论文 Fig. 1:Overall architecture of the proposed LUMO offline voice assistant system running on Raspberry Pi 5.

英文题目:LUMO (Lightweight Unified Multilingual Orchestrator): A Privacy Preserving Offline Voice Assistant

标签:#语音对话系统 | #模型量化 | #多语言 | #端侧运行 | #隐私保护

评分:6.8/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Md. Mehedi Hasan Naeem:机构信息未在 arXiv HTML 中可靠披露
  • Mst. Kamrunnahar Ruma:机构信息未在 arXiv HTML 中可靠披露
  • Nafiza Anjum:机构信息未在 arXiv HTML 中可靠披露
  • Shakila Sultana:机构信息未在 arXiv HTML 中可靠披露
  • Md. Sujan Ali:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

离线语音助手需在无网络条件下完成语音输入到语义应答再到语音输出的闭环,其难点在于弱算力终端难以同时保证识别鲁棒性、开放域理解与低延迟合成。LUMO(Lightweight Unified Multilingual Orchestrator)以模块化流水线组织该链路:语音活动检测(Voice Activity Detection,VAD)筛选含话语音段并送入离线识别,随后转写文本进入本地量化语言模型生成回复,最后由离线合成模块转为语音播放。与依赖云端或规则意图的已有边缘助手不同,该系统将生成式推理完全保留在端侧,从而兼顾隐私与开放对话能力。在10人录制的英孟双语短指令集上,办公室中等噪声下英语词错误率(Word Error Rate,WER)为6.8%,安静房间为4.1%,高噪声恶化至14.2%,孟加拉语为9.9%。在噪声条件对比评测任务下,高噪声公共环境的词错误率为14.2%,高于安静房间的词错误率4.1%。用户停话到语音起始的端到端延迟为3.2秒,其中语言模型推理占1.8秒,占比56.3%。该结论仅适用于3至10词短指令、低噪声、单轮语音交互,未验证长对话、多轮记忆与物联网联动。系统在Raspberry Pi 5上峰值功耗约9.0瓦,持续推理温度低于70摄氏度,但长期稳定依赖主动散热与USB固态存储加速。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 声路径一变就失配:把控制与辨识耦合在一起学更新

原论文 Figure 1:Block diagram of feedforward ANC with FxLMS-based control filter adaptation.

英文题目:Coupled Meta-Adaptive Filtering for Active Noise Control Under Time-Varying Acoustic Paths

标签:#主动降噪 | #元学习 | #自适应滤波 | #RNN

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Boxiang Wang:Smart Nation TRANS Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore, 639798, Singapore
  • Zhengding Luo:Smart Nation TRANS Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore, 639798, Singapore
  • Ziyi Yang:Smart Nation TRANS Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore, 639798, Singapore
  • Dongyuan Shi:Center of Intelligent Acoustics and Immersive Communications, School of Artificial Intelligence, Northwestern Polytechnical University, Xi’an, 710072, China
  • Xuexian Liu:College of Energy Engineering, Zhejiang University, Hangzhou, 310027, China
  • Woon-Seng Gan:Smart Nation TRANS Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore, 639798, Singapore

📌 核心摘要

主动噪声控制需以前馈参考信号生成抵消声并最小化误差麦克风残差,难点是头动使初级路径与次级路径同时时变,固定次级路径估计会使物理相关优化器特征失配而失稳。方法先以时域无延迟双速率结构逐采样生成控制声并按帧做频域自适应,输出控制滤波器增量进入下一帧。接着元门控联合路径辨识器从参考、控制与误差信号联合预测初级与次级路径门控增量,同步更新两条路径估计以分离残差来源。随后控制器以最新次级路径估计重构滤波参考等物理特征,再由元优化器更新控制滤波器,形成辨识支撑控制的闭环。与固定标称模型和需辅助噪声的在线次级路径建模基线相比,该耦合免除了探测噪声并在路径突变后持续学习更新机制而非仅复用初值。在90个未见头动场景共180次突变评测设置下,CoMeta-AF-ANC的突变后0-3 s平均降噪量指标为7.9±3.5 dB,高于FxLMS的降噪量指标1.7±2.8 dB。其边界是离散测点切换模拟、单通道线性路径与有限噪声类型,连续大范围运动与强非线性尚未验证。原文未披露训练硬件与训练时长。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 通话算数才算数:把语音智能体的成功固定为可复算的通过率

英文题目:Inquesto Score: A reliability Protocol For Voice Agents

标签:#语音对话系统 | #评测协议 | #公平性 | #鲁棒性

评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Massa Baali:机构信息未在 arXiv HTML 中可靠披露
  • Bhiksha Raj:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音智能体的输入是经电话窄带与噪声退化的caller音频流与后端账户状态,输出是语音回复与工具调用构成的交互轨迹,难点在于transcript不可见的抢话、延迟与冒名授权决定了交互是否真正成功。Inquesto得分先由场景谓词与工具轨迹判定目标达成并由固定的Gemma-2-9B-Instruct法官确认语义结果,该判定输出进入下一步的失败合并。接着从音频时间轴直接测量抢话与延迟、从轨迹与法官判定语义与状态失败,并按S1至S5严重度定级,其事件集合进入通过判定。最后仅当目标达成且无S3及以上事件时记为干净成功,并在固定306呼叫总体上计算通过率且报告Wilson区间与行为、鲁棒、身份与说话人群体诊断切片而不并入评分。与拼接异质指标的复合基准不同,该协议用单一可解释通过率表达契约并将诊断与评分分离,避免严重失败被高分维度稀释。在固定306呼叫的v0.1协议评测下,Qwen2.5-7B/1100ms配置的得分为45,高于Qwen2.5-7B/400ms配置的得分24。结论适用边界受限于v0.1账单域与合成呼叫人群体,尚未验证真实呼叫者、第二领域与克隆攻击下的外推。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 只查可疑词片段:用同一语音大模型先定位领域词错误再做上下文重识别

原论文 Figure 1:Overview of the proposed training-free contextual ASR framework with error-aware selective…

英文题目:Training-Free Contextual ASR via SpeechLLM-Based Error-Aware Selective Retrieval

标签:#语音识别 | #检索增强 | #语音 | #语音大模型

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Natsuo Yamashita:机构信息未在 arXiv HTML 中可靠披露
  • Ai Nemoto:机构信息未在 arXiv HTML 中可靠披露
  • Ryosuke Koichi:机构信息未在 arXiv HTML 中可靠披露
  • Masaaki Yamamoto:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

上下文语音识别需在音频输入下输出含低频领域术语的转写,难点在于直接灌入大词典会引入大量无关候选,导致过度偏置与检索开销激增。第一步由同一预训练语音大模型经音频文本上下文学习单次联合推理,同时生成初次转写假设并定位既领域相关又疑似误识的至多双词错误片段,其输出作为硬门控决定是否触发检索。第二步仅以定位片段为独立查询,经声学邻居嵌入计算与外部固定词典术语的音似度并取跨查询最大分排序,选出前K候选,若无片段则跳过后续流程并保留初次假设。第三步将原音频、完整初次转写与检索候选一并送回同一模型做二次条件重识别,以候选作偏置信息、以初次转写作文本上下文,全程无任务特定参数更新。在医疗语音 MedSyn 7906条采样上,Top-10条件下词错率(Word Error Rate, WER)由7.30%降至5.67%,词典术语错误率(B-WER)由41.43%降至28.05%,单句查询由13.37条降至0.99条,R@10由53.2%升至61.8%,MRR@10由31.9%升至47.9%。空中管制 ATCOSIM 1901条与金融 Earnings 772条趋势一致,B-WER分别由46.40%降至30.65%、由50.93%降至45.66%,但 Earnings 因领域词占比仅5.04%整体 WER 增益较小。结论依赖固定词典、特定模型 Qwen3-Omni-30B-A3B-Instruct 与 Top-10设置,Top-50引入低排名噪声反而变差,跨模型与开放词典外推未验证,延迟与部署成本未披露。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 单锚对齐不够用:用冻结音频文本流形同时约束脑编码器

原论文 Fig. 1:Overview of BAT-CLIP. A trainable brain encoder f_\\theta, initialized from brain foundation model…

英文题目:BAT-CLIP: Trimodal Alignment of Brain, Audio and Text

标签:#言语神经解码 | #对比学习 | #脑信号 | #多模态学习

评分:6.6/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Suhyun Kim:机构信息未在 arXiv HTML 中可靠披露
  • Jinmo Han:机构信息未在 arXiv HTML 中可靠披露
  • Danny Dongyeop Han:机构信息未在 arXiv HTML 中可靠披露
  • Ahhyun Lucy Lee:机构信息未在 arXiv HTML 中可靠披露
  • Jewoon Lee:机构信息未在 arXiv HTML 中可靠披露
  • Yonghyeon Gwon:机构信息未在 arXiv HTML 中可靠披露
  • Zach Paris:机构信息未在 arXiv HTML 中可靠披露
  • Chun Kee Chung:机构信息未在 arXiv HTML 中可靠披露
  • Saewoong Bahk:机构信息未在 arXiv HTML 中可靠披露
  • Nam Soo Kim:机构信息未在 arXiv HTML 中可靠披露
  • Seong Jae Hwang:机构信息未在 arXiv HTML 中可靠披露
  • Jiook Cha:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

自然听故事任务要求从颅内脑电iEEG窗口中解码词法语义与声学内容,难点在于配对数据仅约30分钟且神经信号个体差异大。方法链分三步推进:可训练脑编码器先以自监督脑基础模型DIVER-1为初始化并输出神经表征,再由冻结的AudioCLIP音频编码器与文本编码器提供稳定的联合锚点,最后双路对称对比损失把脑嵌入同时拉向音频嵌入与文本嵌入。与单音频或单文本锚定的双模态CLIP相比,双锚点约束迫使同一脑表征兼顾时序声学结构与句子级语义可分性。在Podcast基准9被试平均的线性探针下,三模态模型BAT-CLIP在Whisper隐变量匹配准确率上达到0.7162,相对全微调卷积基线的0.6634提升约8.09%,在词性、GPT惊奇度、词嵌入三项上亦为对齐变体中最优。该结论仅限于被动听播客的颅内记录与词句级分类探针,未验证开放词表生成与跨被试跨模态泛化。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 固定隐私参数为何不够:用异构识别器分歧在线估计语音残留

原论文 Figure 1:CLEAR: Privacy-transformed audio is processed by heterogeneous ASR systems, and disagreement…

英文题目:CLEAR: Online Speech Content Leakage Estimation through Cross-ASR Disagreement

标签:#语音可懂度评估 | #模型集成 | #隐私保护 | #在线推理

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Bhawana Chhaglani:机构信息未在 arXiv HTML 中可靠披露
  • Tanvi Kandepuneni:机构信息未在 arXiv HTML 中可靠披露
  • Jeremy Gummeson:机构信息未在 arXiv HTML 中可靠披露
  • Prashant Shenoy:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

信号级语音隐私需在保留声学线索供下游感知时抑制语言内容可恢复性,输入为隐私变换后音频、输出为运行时泄露估计与可能泄露词,难点是部署时无原始音频与参考文本使词错率类指标无法计算且固定参数在不同语句与说话人上泄露差异极大。CLEAR先对变换后音频并行运行多个异构识别器并归一化假设得到文本假设集合,该集合进入两两序列相似度计算以得到平均分歧与空假设率,同时取至少两个识别器共现词形成泄露词集。最后经单调校准将分歧映射为对抗可恢复性估计,并以该估计作为反馈信号调节隐私变换强度与向用户提示残留暴露。与依赖单模型置信度或离线参考文本的已有评估不同,该机制以独立归纳偏置间的错误发散刻画不可恢复性,以跨模型一致恢复作为泄露证据,从而提供可解释的运行时隐私控制依据。在低通滤波三种截止频率场景下,700Hz条件的平均PER为0.576,低于300Hz条件的平均PER0.827。三识别器子集处理约2秒语音的推理延迟为0.295秒,对应实时率为0.15,而分歧计算本身不足0.15毫秒。该结论的适用边界受限于短英语朗读语音与有限变换类型,长语音、对话、自发语音与更强自适应攻击下的外推尚未验证。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 要忘掉一个人,却还要记得他何时开口:推理时按注册语音关掉内容流

原论文 Figure 1:Overview of TSU-ASR and the proposed ECG module that reduces information in the content stream…

英文题目:Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition

标签:#语音识别 | #Adapter | #说话人分离标注 | #隐私保护 | #会议转录

评分:6.4/10 | 创新 1.6/2 | 技术严谨 0.9/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Bo Su:机构信息未在 arXiv HTML 中可靠披露
  • Yueru Yan:机构信息未在 arXiv HTML 中可靠披露
  • Thai Le:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

目标说话人遗忘识别以多说话人录音与拒转说话人注册音频为输入,要求输出保留说话人标签与时间戳的完整转写但删除遗忘者文本,难点在于重叠语音下同帧包含保留与遗忘内容且遗忘集合在推理时动态指定。方法先以冻结双流语音编码器分别抽取内容流与说话人流特征并由注册音频均值池化得到目标嵌入。接着由双层感知机根据帧特征与嵌入拼接及余弦相似度输出帧级匹配分并取多目标最大值。最后以该分数调制内容流后与未改动的说话人流共同送入大语言模型解码为可扩展标记语言转写。相比训练样本遗忘类机器遗忘,该机制在推理流上按说话人条件抑制语义而不破坏声纹分支,支持未见说话人免训练切换。在AliMeeting评测任务下,附ECG模型的CLR-all指标为27.3%,低于无ECG基线的CLR-all指标73.6%。该适用边界集中在短分段离线场景,失败条件包括重叠段与纯遗忘段的残留泄露。该结论限于0.5 s至80 s短分段离线评测且重叠与纯遗忘段仍有显著泄露,未验证长会议与实时流式外推。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 不用模拟后端也能训练前后端:随机化中间引导让真人对话接管串联语音对话

原论文 Figure 1:Schematic training-time guidance streams: p_i, simulator-LLM-generated responses; r_i, randomly…

英文题目:Learning Natural Conversational Behavior in Tandem Speech-to-Speech Models with Randomized Guidance

标签:#全双工语音交互 | #SFT | #轮次切换 | #语音 | #大语言模型

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Manato Yaguchi:机构信息未在 arXiv HTML 中可靠披露
  • Yotaro Kubo:机构信息未在 arXiv HTML 中可靠披露
  • Hikaru Asano:机构信息未在 arXiv HTML 中可靠披露
  • So Kuroki:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

面向全双工语音到语音交互需同时保证回答质量与自然轮转,输入为用户进行中的语音流,输出为即时语音回复,难点是普通对话录音只记录最终回复而缺失后端在用户说话期间应给出的中间引导流。为此先保留目标转写作为末次目标引导以提供信息性监督,再从训练语料其他对话中随机采样回答文本填充中间引导位置以模拟潜在无关更新。接着将信息性与随机引导混合成训练时引导流直接送入语音前端,使前端在生成回复音频时学习选择性利用有用信息而忽略无关更新。最后保持推理时异步大语言模型后端不变,直接将该前端用于合成对话与真实播客语料训练,免去逐样本模拟器大语言模型生成。与KAME原有逐点模拟后端语义渐进收敛的机制不同,随机中间引导把关键视为区分信息性与无关更新的负采样训练,因而可直接由带转写对话语料构建大规模训练数据而具有实际可扩展意义。在30问口语MT-Bench基准任务下,随机引导方法的MT-Bench得分为6.09,高于LLM模拟基线的MT-Bench得分5.54。真实3.8k小时训练后平滑轮转与自然度提升但中断处理仍受限,其中断处理成功率偏低在大规模开放域外推上尚未验证,构成适用边界。原文未披露训练硬件、优化器、解码参数与成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 不把呼吸当静音:BreathGRU 为何要显式建模呼吸事件

英文题目:BreathGRU: A Novel Semi-Supervised Bidirectional Gated Recurrent Unit Framework for Speech and Breath Segmentation for Respiratory Audio

标签:#音频事件检测 | #RNN | #半监督学习 | #语音生物标志物

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Sania Fatima Sayed:机构信息未在 arXiv HTML 中可靠披露
  • John W. Holloway:机构信息未在 arXiv HTML 中可靠披露
  • Reyer Zwiggelaar:机构信息未在 arXiv HTML 中可靠披露
  • Faisal I. Rezwan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为16 kHz哮喘患者朗读录音,输出为语音与呼吸事件的起止边界,难点在于呼吸能量低、频谱宽、过渡边界模糊且含喘鸣,易被通用VAD误判为静音。方法链分四步:声学特征提取将每帧编码为59维谱与动态特征并做Z-score标准化后送入双向门控循环单元融合前后文得到语境表示,帧级分类头输出语音与呼吸后验并经熵加权伪标签利用无标注数据迭代优化,时长约束分段维特比联合后验、转移与对数正态时长先验输出平滑事件序列。与仅区分语音与非语音的预训练VAD不同,该框架显式学习呼吸声学表示并强制呼吸生理时长连续性,因而减少漏检并改善边界定位。在手工标注哮喘朗读录音评测下,BreathGRU的呼吸事件召回指标为0.83,高于Silero的呼吸事件召回指标0.67。该结论限于朗读式英语哮喘录音,Coswara 计数与 TED Talk 仅做无真值目视观察,尚未在咳嗽、自然对话、大规模多中心数据上定量验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


28. 不等听完再翻:用最近帧注意力决定何时开口的同传策略

原论文 Figure 1:READ Decision: High recent attention score (\\lambda_recent^t=0.55>\\alpha,\\alpha=0.2) indicates…

英文题目:Attention-Based Adaptive Policies for Simultaneous Speech-to-Text Translation

标签:#语音翻译 | #注意力机制 | #流式处理 | #语音 | #跨语言

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Filip Tăşădan:机构信息未在 arXiv HTML 中可靠披露
  • Ema Tomanová:机构信息未在 arXiv HTML 中可靠披露
  • Ondrej Lopuch:机构信息未在 arXiv HTML 中可靠披露
  • Paweł Bilko:机构信息未在 arXiv HTML 中可靠披露
  • Anders Søgaard:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

同时语音到文本翻译需在音频流未结束时增量输出译文,核心是要在信息不足导致的误译与等待导致的延迟之间谨慎权衡READ与WRITE时机。音频按320ms块累积经编码器编码后,解码器先做第一遍自回归推理生成下一词元。再以同一音频与追加该词元的序列做第二遍推理,从末层交叉注意力提取该词元对最新8帧的注意力权重和。RFAP将该权重和与阈值比较,高则READ等待更多上下文,低则WRITE输出;DCAP再计算相邻块间该权重和的变化率,非负即在发现阶段提前WRITE,否则沿用阈值在完成阶段输出。与EDAtt看整段历史累积对齐不同,本文只看下一词元对最新块的聚焦,从而避免为等稳定而长期囤积语音块。在CVSS-C法英测试集下,RFAP的BLEU为23.97,高于EDAtt的BLEU 19.75。适用边界为短句朗读式合成语音与 320ms 固定块长,长尾口语、代码切换与高混响场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


29. 平均分好看、最难的部署点却失效:用跨库证据锚稳住阿尔茨海默语音筛查

原论文 Figure 1:Direction conflict prevalence across marker scopes.

英文题目:Why Alzheimer’s Speech Screening Fails to Generalize: Bridging the Deployment Gap via Cross-Corpus Evidence Anchoring

标签:#病理语音评估 | #模型集成 | #语音 | #语音生物标志物 | #鲁棒性

评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zijian Lu:Nanjing University of Posts and Telecommunications, Nanjing, China
  • Sizhe Liu:University of Science and Technology of China, Hefei, China
  • Yin Zhang:University of Science and Technology of China, Hefei, China
  • Jixuan Deng:University of Science and Technology of China, Hefei, China
  • Xinrong Lin:Shouyi Technology, Hefei, China
  • Xinchen Yuan:University of Science and Technology of China, Hefei, China
  • Chicheng Jin:University of Science and Technology of China, Hefei, China
  • Yiping Zuo:Nanjing University of Posts and Telecommunications, Nanjing, China
  • Yuanchao Li:University of Cambridge, Cambridge, United Kingdom

📌 核心摘要

阿尔茨海默病语音筛查输入为自发语音转录与声学时序特征,输出为健康对照与认知风险的二分类风险分,难点是任务提示、语言、话筒与切分策略变化会导致标志方向反转与深度模型局部崩溃。该工作先以留一语料交叉验证 Leave-One-Corpus-Out / LOCO 审计 70 个可解释标志的跨域方向一致性,再在源域内按训练域效用筛选 4 个证据锚点 Evidence Anchor 训练轻量分类器得到锚点分,接着将锚点分与冻结多语言文本编码器 XLM-R / XLM-RoBERTa 文本分做加权融合输出说话人级风险。与单纯依赖深度语义或组分布鲁棒优化 Group Distributionally Robust Optimization / GroupDRO 重加权源域损失不同,该机制用稀疏可审计通道为高容量语义流托底,两者在折叠内相关性很低因而互补。在 4 语料 LOCO 下平衡融合平均说话人曲线下面积 Area Under the ROC Curve / AUC 达 0.785,锚点加重融合将最差域 AUC 抬至 0.615,显著高于深度单流与 GroupDRO 的最差域表现。结论仅适用于中英图描述与半结构化临床语音的四语料模拟,对新语言、方言、真实噪声门诊与纵向追踪的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


30. 先建干净房间空间再对齐噪声:三阶段房间脉冲响应嵌入及其增强条件化

英文题目:Room Impulse Response Embeddings for Speech Enhancement in Noisy and Reverberant Environments

标签:#语音增强 | #对比学习 | #去混响 | #知识蒸馏

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Adrian Meise:机构信息未在 arXiv HTML 中可靠披露
  • Reinhold Haeb-Umbach:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为单通道噪声混响语音,输出为抑制加性噪声与晚期混响后的增强语音及可条件化增强器的房间表示,难点在于噪声会导致房间嵌入发生偏移与弥散而丢失房间可分性。若先去噪再编码则假设混响对去噪系统透明,但实际并不成立,去噪伪影会污染编码器并使其依赖特定去噪系统。方法采用三阶段课程:第一阶段在纯混响语音上以对比任务学习RIR编码器,使相同RIR的不同话语聚拢而不同RIR分离以剥离说话人信息。第二阶段在噪声混响数据上继续对比训练,正样本使用不同噪声而负样本以概率0.7复用相同噪声,迫使模型同时忽略说话人与噪声。第三阶段冻结第一阶段教师从纯混响分支抽取目标嵌入,令第二阶段学生从对应噪声混响输入以均方误差拟合教师嵌入并保留对比约束,使噪声鲁棒空间对齐回纯净房间空间;与先去噪后编码不同,该链条以纯净房间空间为锚点直接对齐,增强端则以特征调制FiLM影响深滤波器系数估计。在BUT-ReverbDB实测RIR加DEMAND噪声构成的未见测试集上,两步深滤波模型经特征调制(Feature-wise Linear Modulation, FiLM)条件化后,噪声混响STOI从0.61升至0.64,SRMR从7.24升至8.20,强Conformer识别器词错率从42.08%降至35.15%。该结论限于单通道静态房间与英语朗读类语音,未验证多通道、移动声源与真实远场录音的外推。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


31. 最近却不中意:用声音与语境二分把专家否决送进共享检索栈

原论文 Figure 2.:Cosine similarity distribution by curator judgment on Round-1 (N=1,149 judgments with a clear…

英文题目:Nearest but Not Dearest: Shared Curator-Feedback Infrastructure for Content-Only Search and Recommendation

标签:#音乐推荐 | #人类参与评测 | #音乐检索 | #多模态学习 | #音乐

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Matt Sandler:Feed.fm, San Francisco, California, USA

📌 核心摘要

该系统面向无行为信号的内容仅检索音乐发现,输入为语义文本提示、氛围标签、种子曲目或艺人,输出为同一许可曲库中的Top-k邻居,难点是余弦最近邻在声学上相近却被策展人判为不合适。方法链分三步:先由策展人对种子检索结果做二值判断并标注单一失败码,再按声音可解与非声学语境把失败码路由到不同层,最后在共享栈的候选生成层与表征层分别修正并服务全部入口。具体而言语境失败进入候选生成层的约束过滤器做元数据谓词拦截,声音失败进入表征层的嵌入重加权头做投影修正,前步的路由输出直接决定后步哪一层吸收哪类反馈。与依赖联合交互日志的统一搜索与推荐路线不同,该工作不消费听众行为信号,而以下游共享基础设施实现跨范式复用。在400个种子每轮1200条判断的生产评测下,约束过滤器加嵌入重加权头联合干预的拒绝率指标为28.83%,低于基线LAION-CLAP系统的拒绝率指标38.17%。作者明确限定这是单系统、单编码器、种子路径上的生产个案,未验证未见种子、文本路径与听众收益。成本上约束过滤器为数天级目录工作,嵌入重加权头为数周级模型工作,两者贡献量级接近而单价差异显著。部署上端到端查询延迟平均85ms、p95为201ms,其适用边界受限于单目录与种子路径评估。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


32. 域变了声纹条件该加多重:非对称引导在冻结模型下校准目标说话人识别

原论文 Figure 1:Overview of the proposed framework. (a) A shared Whisper model is trained for TS-ASR with target…

英文题目:Asymmetric Classifier-Free Guidance for Target-Speaker ASR

标签:#目标说话人提取 | #测试时自适应 | #语音 | #鲁棒性

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yiwen Guan:机构信息未在 arXiv HTML 中可靠披露
  • Jacob Whitehill:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

目标说话人自动语音识别(Target-Speaker ASR,TS-ASR)需从双人混合语音中依据注册音频(enrollment)转写指定说话人,重叠率与噪声变化会改变目标证据强度并使固定条件作用失配。本文先以共享 Whisper-small 骨干联合学习目标转写与序列化多说话人转写,使有无注册时的两路预测均有明确任务。推理时在每步以无条件对数与条件对数之差进行无分类器引导(Classifier-Free Guidance,CFG)解码,全局刻度在目标域开发集上选定并冻结识别模型。轻量预测器再根据编码器特征在全局刻度附近做三选一句级微调,仅在置信度和预期词错率改善同时达标时偏离中心。与条件解码相比,完整系统在 LSM-controlled OV30 上将测试集词错率(Word Error Rate,WER)从 36.22%降至 34.18%,相对下降 5.6%,在 OV50 10dB 上相对条件基线 43.87%降至 34.30%,相对下降约 21.8%。该结论限于双说话人英文朗读混合与受控重叠加噪漂移,对更多说话人、自然会议及强混响尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


33. 时空互补与被试一致:SICMD 如何同时解感知语音的模态与跨人难题

原论文 Figure 1:Framework of SICMD. MS, IS, and CS refer to Multi-Subject, Intra-Subject, and Cross-Subject,…

英文题目:Subject-Invariant Cross-Modal Decoding of Perceived Speech from Brain Recordings

标签:#言语神经解码 | #多模态学习 | #脑信号 | #迁移学习

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Aoke Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Jing Chen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该研究处理以脑磁图与功能磁共振成像为输入、检索对应感知语音片段的跨被试解码任务,输出为与wav2vec2语音表征对齐的检索排序,实际难点在于前者空间分辨率低而后者时间分辨率低,且被试间神经响应差异大导致单被试模型难以迁移。方法链由三步组成:基于位置编码的空间注意力先将不同被试MEG通道映射到统一参考空间,其输出经1x1卷积与被试层进入基于ConvConcatNet的MEG脑编码器,同时fMRI经多层感知机编码器提取空间语义信息;随后两路高层表征做异步跨模态融合,并以CLIP损失对齐语音表征;目标被试层先经CorrCA提取源被试一致成分初始化,再在目标被试上微调。与分别做模态融合或被试映射的基线不同,该工作把模态互补与被试一致性建模放在同一框架,使时空互补表征直接服务于可迁移的被试不变解码。在12被试中文连续听觉语料的留一被试任务下,SICMD的Top-1准确率为43.5%,高于fMMF的Top-1准确率32.9%。该结论适用边界受限于有配对MEG与fMRI的受控听觉感知检索场景,尚未验证无fMRI、开放词汇生成或跨数据集外推的失败条件。个性化微调阶段的训练成本平均仅需629.3个训练步,显著低于多被试预训练与单被试训练所需的训练步数,硬件为单张NVIDIA RTX 3090 GPU。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


34. 从少量标注泛化情感:用文本锚点约束 CLAP 去逼近效价-唤醒空间

英文题目:Audio emotion recognition for atypical hearing

标签:#语音情感识别 | #LoRA | #环境声 | #少样本

评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ulysse Roussel:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理环境声情感识别任务,输入为6秒单声道非音乐非人声声音,输出为罗素环形模型下的效价与唤醒连续坐标,难点在于标注稀缺、常规谱时增强会改变情感感知且跨库泛化差。方法先以36个情感锚点文本校准文本编码器,使语言空间贴合环形几何并改善锚点布局。接着冻结文本侧并微调音频编码器,将声音投影到锚点附近以学习情感对齐。最后用对锚点的余弦相似加权得到效价唤醒预测,并以外部分布验证泛化。与直接回归坐标的方法不同,该机制把预测约束为可解释的锚点相似分布,保留情感空间拓扑结构并复用双模态先验。在EmoSoundscapes跨域测试集下,Full-Pipeline的Sp(V)指标为0.705,高于Zero-shot CLAP的Sp(V)指标0.622。该结论目前仅适用于常态听者聚合标签与单声道非空间化声音,未验证对高敏感自闭症个体的迁移与个体差异建模。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。