共分析 30 篇论文
⚡ 今日概览
✅ 筛选入选 30 篇 → 🔬 深度分析完成
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #语音识别 | 6 篇 | ██████ |
| #语音增强 | 4 篇 | ████ |
| #语音合成 | 3 篇 | ███ |
| #语音质量评估 | 3 篇 | ███ |
| #语音交互 | 2 篇 | ██ |
| #声源定位 | 1 篇 | █ |
| #语音情感识别 | 1 篇 | █ |
| #语音编码 | 1 篇 | █ |
📊 论文评分排行榜(30 篇,按分数降序)
📋 论文列表
🥇 实增益掩蔽的天花板是投影,离开直线却赢不回平方误差
英文题目:Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation
标签:#音乐源分离 | #生成模型 | #理论分析 | #基准测试
评分:8.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前25% | 文档类型:理论研究 | arXiv 原文
👥 作者与机构
- Maxime Baelde:organization=Independent researcher, city=Lille, country=France
📌 核心摘要
论文刻画单通道时频实增益掩蔽的正交投影上限,并用一个高斯混合后验均值估计器研究先验、读出与相位对称性:长窗留出设置下估计器距实测类上界 11.44 dB,校准分析中的约 70% 是分贝缺口之比,不是全部缺口或误差能量都由后验方差解释,更不是所有生成分离器的性能上限。
🔗 开源资源
代码相关资源:https://github.com/mbaelde/masking-ceiling — 暂时无法访问
代码相关资源:https://github.com/mbaelde/generative-audio-source-models — 暂时无法访问
第三方资源:https://github.com/mbaelde/masking-ceiling — 暂时无法访问
第三方资源:https://github.com/mbaelde/generative-audio-source-models — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 真假混在一起时:让大模型先分轨再判真伪的 ToolDF
英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection
标签:#音频伪造检测 | #多模态模型 | #语音伪造检测 | #参数高效微调
评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Taewoo Kim:Multi-Modal Research Center, KETI, South Korea;Department of Artificial Intelligence, Korea University, South Korea
- Young Han Lee:Multi-Modal Research Center, KETI, South Korea
- Nam In Park:机构信息未在 arXiv HTML 中可靠披露
- Chanwoo Kim:Department of Artificial Intelligence, Korea University, South Korea
📌 核心摘要
针对一段音频里同时含真实与伪造、跨时间与跨声源的混合真实性检测,ToolDF 用音频大模型做编排器按结构调用分离与四个领域专家并执行早失败汇总,在复合类型上取得最高的 C-Avg. 81.89,代价是依赖外部工具的可靠性。
🔗 开源资源
代码相关资源:https://github.com/rlataewoo/tooldf — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Captioner — 暂时无法访问
第三方资源:https://github.com/wiseman/py-webrtcvad — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 失配时只听一条语音:用干净先验把增强输出推向高密度区
英文题目:Test-time adaptation for speech enhancement with an autoregressive speech prior
标签:#语音增强 | #测试时自适应 | #自回归模型 | #语音编码 | #鲁棒性
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Sofiene Kammoun:CentraleSupélec, IETR (UMR CNRS 6164), France
- Simon Leglaive:CentraleSupélec, IETR (UMR CNRS 6164), France
- Xavier Alameda-Pineda:Inria at Univ. Grenoble Alpes, CNRS, LJK, France
- Timo Gerkmann:Signal Processing Group, University of Hamburg, Germany
📌 核心摘要
针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。
🔗 开源资源
代码相关资源:https://sofienekammoun.github.io/TAAP-SE/ — 链接可访问(HTTP 200)
演示资源:https://sofienekammoun.github.io/TAAP-SE/ — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/facebook/wav2vec2-base-960h — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 加了编解码器训练就掉音质:CRAW 用注意力、掩蔽与纠错把两者拉回平衡
标签:#音频水印 | #对抗训练 | #语音伪造检测 | #Transformer | #鲁棒性
评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.5/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- David Chernin:机构信息未在 arXiv HTML 中可靠披露
- Ethan Fetaya:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
CRAW 针对神经编解码器与去噪重合成导致后处理水印失效的问题,用加宽失真训练加注意力池化加推理时感知掩蔽加重复纠错码,在保持 PESQ 约 4.0 的同时把编解码器与去噪下的检测 F1 拉回 0.8 以上,代价是掩蔽带来约 150 ms 的额外推理延迟。
🔗 开源资源
代码相关资源:https://github.com/DavidC1212/craw — 暂时无法访问
演示资源:https://davidc1212.github.io/craw-audio-samples/ — 链接可访问(HTTP 200)
第三方资源:https://github.com/audiolabs/torch-pesq — 暂时无法访问
第三方资源:https://github.com/modelscope/ClearerVoice-Studio — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 热启动之后再听一次:用隐状态夹角找出语义词并只在那里纠错
标签:#语音识别 | #语音大模型 | #大语言模型 | #参数高效微调 | #高效推理
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Chan-Jan Hsu:机构信息未在 arXiv HTML 中可靠披露
- Jaeyeon Kim:机构信息未在 arXiv HTML 中可靠披露
- Chao-Han Huck Yang:NVIDIA
- Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露
- Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露
- Carlos Busso:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
论文在 LoRA 适配的 ASR-LLM 中复用基座 LLM,以对应层隐状态的余弦相似度和范数比定位需语义纠错的词;单遍混合解码的平均实体错误率为 18.38%,有效搜索宽度约为贪心的 1.4 倍,双遍精修则把波束基线的 18.29% 降到 17.69%,但其总计算成本与墙钟时间未量化。
🔗 开源资源
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 从听见一个词到认出一个词:LibriBrain100 如何把词分类与跨人泛化变成可比的竞赛
标签:#语音识别 | #自监督学习 | #数据集 | #基准测试 | #低资源
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Francesco Mantegna:PNPL, Department of Engineering Science, University of Oxford, UK
- Gereon Elvers:PNPL, Department of Engineering Science, University of Oxford, UK
- Dulhan Jayalath:PNPL, Department of Engineering Science, University of Oxford, UK
- Gilad Landau:PNPL, Department of Engineering Science, University of Oxford, UK
- Tasha Kim:PNPL, Department of Engineering Science, University of Oxford, UK
- Miran Özdogan:PNPL, Department of Engineering Science, University of Oxford, UK
- Luisa Kurth:PNPL, Department of Engineering Science, University of Oxford, UK
- Teyun Kwon:PNPL, Department of Engineering Science, University of Oxford, UK
- SungJun Cho:PNPL, Department of Engineering Science, University of Oxford, UK;OHBA, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK
- Benjamin Ballyk:PNPL, Department of Engineering Science, University of Oxford, UK
- Alex Fung:PNPL, Department of Engineering Science, University of Oxford, UK;FMRIB, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK
- Anna Greer:PNPL, Department of Engineering Science, University of Oxford, UK
- Pratik Somaiya:PNPL, Department of Engineering Science, University of Oxford, UK
- Christian Herff:Maastricht University, The Netherlands
- Yorguin Mantilla Ramos:UNIQUE, Université de Montréal, Canada
- Hamza Abdelhedi:UNIQUE, Université de Montréal, Canada
- Karim Jerbi:UNIQUE, Université de Montréal, Canada;Mila–Quebec AI Institute, Canada
- Greg Farquhar:Google DeepMind, UKJoint first authors
- Brendan Shillingford:Google DeepMind, UKJoint first authors
- Mark Woolrich:OHBA, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK
- Oiwi Parker Jones:PNPL, Department of Engineering Science, University of Oxford, UK
📌 核心摘要
论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。
🔗 开源资源
代码相关资源:https://github.com/neural-processing-lab/MEG-XL — 暂时无法访问
代码相关资源:https://github.com/neural-processing-lab/pnpl — 暂时无法访问
代码相关资源:https://github.com/ — 暂时无法访问
代码相关资源:https://huggingface.co — 暂时无法访问
模型相关资源:https://github.com/neural-processing-lab/MEG-XL — 暂时无法访问
复现相关资源:https://libribrain.com/editions/2026/ — 链接可访问(HTTP 200)
第三方资源:https://github.com/neural-processing-lab/MEG-XL — 暂时无法访问
第三方资源:https://github.com/neural-processing-lab/pnpl — 暂时无法访问
第三方资源:https://libribrain.com/links/discord → https://libribrain.com/links/discord/ — 链接可访问(HTTP 200)
第三方资源:https://libribrain.com/editions/2026/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 不看未来也能补高频:StreamWSR 的因果波形超分
英文题目:StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution
标签:#语音超分 | #生成对抗网络 | #流式处理 | #高效推理 | #端到端
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yuan Tian:机构信息未在 arXiv HTML 中可靠披露
- Yang Ai:机构信息未在 arXiv HTML 中可靠披露
- Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露
- Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。
🔗 开源资源
- 演示资源:https://tian1507.github.io/StreamWSR/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 说了是谁还不够:全双工语音智能体能否在正确时刻做对地板动作
英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估
评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Puneet Mathur:University of Maryland College Park, USA
- Dinesh Manocha:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 不对齐文本、直接生成双声道:Text-Audiobox 如何做配音与对话
英文题目:Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
标签:#语音合成 | #流匹配 | #语音克隆 | #多语言
评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Sanyuan Chen:FAIR at Meta
- Min-Jae Hwang:FAIR at Meta
- Sho Inoue:FAIR at Meta
- Anna Sun:FAIR at Meta
- Bokai Yu:FAIR at Meta
- David Kant:FAIR at Meta
- Dongmin Hyun:FAIR at Meta
- Dorian Desblancs:FAIR at Meta
- Gregory Antonovsky:FAIR at Meta
- Oleg Repin:FAIR at Meta
- Peng-Jen Chen:FAIR at Meta
- Xutai Ma:FAIR at Meta
- Zehai Tu:FAIR at Meta
- Juan Pino:FAIR at Meta
- Wei-Ning Hsu:FAIR at Meta
📌 核心摘要
针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。
🔗 开源资源
第三方资源:https://huggingface.co/audeering/wav2vec2-large-robust-12-ft-emotion-msp-dim — 暂时无法访问
第三方资源:https://huggingface.co/Qwen/Qwen2-Audio-7B-Instruct — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 既要一字不差又要好看易读:双形式语音识别如何决定数字该不该变
英文题目:Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition
标签:#语音识别 | #多任务学习 | #提示学习 | #大语言模型
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Fengrun Zhang:机构信息未在 arXiv HTML 中可靠披露
- Li Fu:机构信息未在 arXiv HTML 中可靠披露
- Wangjin Zhou:机构信息未在 arXiv HTML 中可靠披露
- Lu Fan:机构信息未在 arXiv HTML 中可靠披露
- Youzheng Wu:机构信息未在 arXiv HTML 中可靠披露
- Xiaodong He:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
针对中文语音识别中口语忠实转写与书面可读转写难以兼顾的问题,论文用成对监督加提示词选形式训练一个共享模型,并以数字关键词加权的序列优化和分开考核必须改与禁止改的协议证明其在必须规范化上达到 4.64% I-CER 与 94.85% 关键词 F1、在禁止改上达到 95.18% 保留率,而无数字控制集上未引入虚假数字。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 并行相加代替串行求余:PACodec 如何用小码本做低码率语音编码
英文题目:PACodec: A Low-bitrate Neural Speech Codec with Parallel Additive Vector Quantization
标签:#语音编码 | #生成对抗网络 | #语音转换
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Fei Liu:机构信息未在 arXiv HTML 中可靠披露
- Yang Ai:机构信息未在 arXiv HTML 中可靠披露
- Xiao-Hang Jiang:机构信息未在 arXiv HTML 中可靠披露
- Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。
🔗 开源资源
- 演示资源:https://anonymity225.github.io/PACodec/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 连续编码表示上的分块解码:在一次前向与逐帧之间调节增强代价
英文题目:Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations
标签:#语音增强 | #自回归模型 | #语音编码 | #高效推理
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yoto Fujita:CentraleSupélec, IETR (UMR CNRS 6164), France;Univ. Grenoble Alpes, CNRS, Grenoble-INP, GIPSA-lab, France
- Simon Leglaive:CentraleSupélec, IETR (UMR CNRS 6164), France
- Laurent Girin:Univ. Grenoble Alpes, CNRS, Grenoble-INP, GIPSA-lab, France
📌 核心摘要
论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。
🔗 开源资源
代码相关资源:https://yotofujita.github.io/marse → https://yotofujita.github.io/marse/ — 链接可访问(HTTP 200)
演示资源:https://yotofujita.github.io/marse → https://yotofujita.github.io/marse/ — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/facebook/wav2vec2-base-960h — 暂时无法访问
第三方资源:https://huggingface.co/JorisCos — 暂时无法访问
第三方资源:https://yotofujita.github.io/marse → https://yotofujita.github.io/marse/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 轮次向真实语音学,语义向可配文本学:有限状态机全双工的解耦数据路线
标签:#语音交互 | #大语言模型 | #流式处理 | #实时处理
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yihang Li:Kyoto University
- Chenhui Chu:Kyoto University
📌 核心摘要
针对合成文本同时学轮次与语义不可靠的问题,该工作用真实人与人语音学轮次、用可改写的人与智能体文本保语义,配合规则化事件转磁带与来源感知校准损失,在等量 token 下把轮次 F1 从约 0.34 提升到约 0.65 并把语义恢复到接近基座上限,代价是暂停处理仍弱于保守系统且单带离散化会丢信息。
🔗 开源资源
代码相关资源:https://github.com/Liyht/def-fsm — 暂时无法访问
模型相关资源:https://github.com/Liyht/def-fsm — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/RyokoAI/ShareGPT52K — 暂时无法访问
第三方资源:https://github.com/SYSTRAN/faster-whisper — 暂时无法访问
第三方资源:https://github.com/hexgrad/kokoro — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 十六种方言同一套音频:辨别与转写为何难同步提升
英文题目:Summary of the ChinaVoices Challenge 2026: Data, Tasks, Baseline, and Methods
标签:#语音识别 | #参数高效微调 | #低资源 | #基准测试
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yujie Liao:机构信息未在 arXiv HTML 中可靠披露
- Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
- Shuiyuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Liumeng Xue:School of Intelligence Science and Technology, Nanjing University
- Hexin Liu:Nanyang Technological University
- Xian Shi:Independent Researcher
- Jie Hu:Beijing Huiting Technology Co., Ltd.
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该挑战用同一批十六类方言音频同时考辨别与转写,统一基线仅 53.62% 辨别准确率与 18.10% 转写错误率,最强受限系统做到 83.19% 与 11.08%,而困难方言与混淆方向显示两任务相关但不可互相替代。
🔗 开源资源
代码相关资源:https://github.com/ASLP-lab/ChinaVoices-Challenge — 暂时无法访问
复现相关资源:https://github.com/ASLP-lab/ChinaVoices-Challenge — 暂时无法访问
复现相关资源:https://aslp-lab.github.io/ChinaVoices-Challenge/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 注意力三角:当音频-视频边把鹦鹉的话转给海盗
标签:#音视频生成 | #扩散模型 | #可解释性
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Sagi Polaczek:Tel Aviv University, Tel Aviv, Israel
- Noa Kraicer:Tel Aviv University, Tel Aviv, Israel
- Gal Metzer:Tel Aviv University, Tel Aviv, Israel
- Zhuo Ning:Simon Fraser University, Burnaby, Canada
- Ali Mahdavi-Amiri:Simon Fraser University, Burnaby, Canada
- Daniel Cohen-Or:Tel Aviv University, Tel Aviv, Israel
- Raja Giryes:Tel Aviv University, Tel Aviv, Israel
📌 核心摘要
论文研究文本到音频视频联合生成中的语义泄漏与声源归属错误,提出只在推理时对文本-视频、文本-音频、音频-视频三条交叉注意力边加偏置的转向方法,在 100 个挑战提示上把 Qwen 声源归属分从 0.1216 提高到 0.1349,代价是约 2.5 倍推理开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 只抄最后一层表示:预量化潜变量蒸馏压缩流式音频前端
英文题目:Compressing Streaming Neural Audio Encoders via Latent-Space Distillation
标签:#语音识别 | #知识蒸馏 | #模型压缩 | #流式处理 | #多语言
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Prasanth Yadla:Apple
- Mohammad Samragh:Apple
- Dongseong Hwang:Apple
- Mingbin Xu:Apple
- Yuanyuan Zhang:Apple
- Chung-Cheng Chiu:Apple
- Yongqiang Wang:Apple
- Yuan Liu:Apple
- Zhen Huang:Apple
- Xiaodan Zhuang:Apple
📌 核心摘要
该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 15 秒参考合成整库:固定音色泰语 TTS 的质量与覆盖取舍
英文题目:Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech
标签:#语音合成 | #知识蒸馏 | #低资源 | #多语言
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Kunat Pipatanakul:机构信息未在 arXiv HTML 中可靠披露
- Potsawee Manakul:机构信息未在 arXiv HTML 中可靠披露
- Warit Sirichotedumrong:机构信息未在 arXiv HTML 中可靠披露
- Sittipong Sripaisarnmongkol:机构信息未在 arXiv HTML 中可靠披露
- Pakorn Nathong:机构信息未在 arXiv HTML 中可靠披露
- Phatrasek Jirabovonvisut:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。
🔗 开源资源
代码相关资源:https://github.com/wayu-research/thai-tts-eval — 暂时无法访问
模型相关资源:https://huggingface.co/hexgrad/Kokoro-82M — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/typhoon-ai/thai-dialect-isan-dataset — 暂时无法访问
复现相关资源:https://huggingface.co/hexgrad/Kokoro-82M — 暂时无法访问
第三方资源:https://huggingface.co/k2-fsa/OmniVoice — 暂时无法访问
第三方资源:https://huggingface.co/hexgrad/Kokoro-82M — 暂时无法访问
第三方资源:https://huggingface.co/openai/whisper-large-v3 — 暂时无法访问
第三方资源:https://huggingface.co/typhoon-ai/typhoon-whisper-large-v3 — 暂时无法访问
第三方资源:https://huggingface.co/typhoon-ai/typhoon-whisper-large-v3-ctc — 暂时无法访问
第三方资源:https://huggingface.co/speechbrain/spkrec-ecapa-voxceleb — 暂时无法访问
第三方资源:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash — 暂时无法访问
第三方资源:https://huggingface.co/typhoon-ai/typhoon-isan-asr-whisper — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 集中改四秒不等于识别器给全曲:MIDI-SAG 和弦条件传播的配对校准
英文题目:Local Chord Corruption Is Not Recognizer Replay: Chord-Condition Propagation in MIDI-SAG
标签:#音乐生成 | #生成模型 | #鲁棒性 | #模型评估
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Weiwen Huang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
在固定音轨、种子、上下文与评分窗下,中央 4 秒三全音破坏比完整 CNN-CRF 回放引发更大的伴奏特征偏移,而同时匹配改变支撑与关系构成的合成画像最接近回放响应,但它只缩小条件响应距离,不代表音质提升。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 卡住最强翻译模型:难例众包与逐条验证规则
标签:#语音翻译 | #大语言模型 | #多语言 | #基准测试
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Vilém Zouhar:机构信息未在 arXiv HTML 中可靠披露
- Niyati Bafna:机构信息未在 arXiv HTML 中可靠披露
- Mukund Choudhary:机构信息未在 arXiv HTML 中可靠披露
- Maike Züfle:机构信息未在 arXiv HTML 中可靠披露
- Sara Rajaee:机构信息未在 arXiv HTML 中可靠披露
- Pinzhen Chen:机构信息未在 arXiv HTML 中可靠披露
- Jannis Vamvas:机构信息未在 arXiv HTML 中可靠披露
- Sara Papi:机构信息未在 arXiv HTML 中可靠披露
- Ona de Gibert:机构信息未在 arXiv HTML 中可靠披露
- Bhavitvya Malik:机构信息未在 arXiv HTML 中可靠披露
- Eliya Habba:机构信息未在 arXiv HTML 中可靠披露
- Orfeas Menis Mastromichalakis:机构信息未在 arXiv HTML 中可靠披露
- Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露
- Michelle Wastl:机构信息未在 arXiv HTML 中可靠披露
- Sheriff Issaka:机构信息未在 arXiv HTML 中可靠披露
- Leshem Choshen:机构信息未在 arXiv HTML 中可靠披露
- Stella Biderman:机构信息未在 arXiv HTML 中可靠披露
- Antonis Anastasopoulos:机构信息未在 arXiv HTML 中可靠披露
- Jan Niehues:机构信息未在 arXiv HTML 中可靠披露
- Rico Sennrich:机构信息未在 arXiv HTML 中可靠披露
- Mrinmaya Sachan:机构信息未在 arXiv HTML 中可靠披露
- Ondřej Bojar:机构信息未在 arXiv HTML 中可靠披露
- Kenton Murray:机构信息未在 arXiv HTML 中可靠披露
- Jörg Tiedemann:机构信息未在 arXiv HTML 中可靠披露
- Alham Fikri Aji:机构信息未在 arXiv HTML 中可靠披露
- Philipp Koehn:机构信息未在 arXiv HTML 中可靠披露
- Christof Monz:机构信息未在 arXiv HTML 中可靠披露
- Alexandra Birch:机构信息未在 arXiv HTML 中可靠披露
- Sowmya Vajjala:机构信息未在 arXiv HTML 中可靠披露
- Chalamalasetti Kranti:机构信息未在 arXiv HTML 中可靠披露
- Cristina España-Bonet:机构信息未在 arXiv HTML 中可靠披露
- Nobin Sarwar:机构信息未在 arXiv HTML 中可靠披露
- David Kaczér:机构信息未在 arXiv HTML 中可靠披露
- Shunta Asano:机构信息未在 arXiv HTML 中可靠披露
- Malik Marmonier:机构信息未在 arXiv HTML 中可靠披露
- Daban Q. Jaff:机构信息未在 arXiv HTML 中可靠披露
- Vaisakhi Mishra:机构信息未在 arXiv HTML 中可靠披露
- Hend Al- Khalifa:机构信息未在 arXiv HTML 中可靠披露
- Gabriele Sarti:机构信息未在 arXiv HTML 中可靠披露
- Sourajit Saha:机构信息未在 arXiv HTML 中可靠披露
- Nils Rehlinger:机构信息未在 arXiv HTML 中可靠披露
- Juan Daniel Cuervo Villa:机构信息未在 arXiv HTML 中可靠披露
- Jonathan Tonglet:机构信息未在 arXiv HTML 中可靠披露
- Saugata Purkayastha:机构信息未在 arXiv HTML 中可靠披露
- Dominik Macháček:机构信息未在 arXiv HTML 中可靠披露
- Jagannathan Ramanujam:机构信息未在 arXiv HTML 中可靠披露
- Heejin Do:机构信息未在 arXiv HTML 中可靠披露
- Zuzana Nadova:机构信息未在 arXiv HTML 中可靠披露
- Fred Philippy:机构信息未在 arXiv HTML 中可靠披露
- Fabian Retkowski:机构信息未在 arXiv HTML 中可靠披露
- Maria Lymperaiou:机构信息未在 arXiv HTML 中可靠披露
- Silvia Casola:机构信息未在 arXiv HTML 中可靠披露
- Hanna Yukhymenko:机构信息未在 arXiv HTML 中可靠披露
- Shubhashis Roy Dipta:机构信息未在 arXiv HTML 中可靠披露
- Sangwon Ryu:机构信息未在 arXiv HTML 中可靠披露
- Andrés Jerez:机构信息未在 arXiv HTML 中可靠披露
- Ron Keinan:机构信息未在 arXiv HTML 中可靠披露
- Shuaib Shuaib Yusuf:机构信息未在 arXiv HTML 中可靠披露
- Avantica Vempati:机构信息未在 arXiv HTML 中可靠披露
- Maria Carmen Staiano:机构信息未在 arXiv HTML 中可靠披露
- Sukannya Purkayastha:机构信息未在 arXiv HTML 中可靠披露
- Adrian Cosma:机构信息未在 arXiv HTML 中可靠披露
- Vitalii Babenko:机构信息未在 arXiv HTML 中可靠披露
- Erivan Inan:机构信息未在 arXiv HTML 中可靠披露
- Aviral Nigam:机构信息未在 arXiv HTML 中可靠披露
- Wafa Aissa:机构信息未在 arXiv HTML 中可靠披露
- Fatima Haouari:机构信息未在 arXiv HTML 中可靠披露
- Venkata Prasanth Kumar Gummadi:机构信息未在 arXiv HTML 中可靠披露
- Mehdi Jafarzadeh:机构信息未在 arXiv HTML 中可靠披露
- Valentin Scourneau:机构信息未在 arXiv HTML 中可靠披露
- Lukas Edman:机构信息未在 arXiv HTML 中可靠披露
- Kaiser Sun:机构信息未在 arXiv HTML 中可靠披露
- Shaomu Tan:机构信息未在 arXiv HTML 中可靠披露
- Mohammad Sadegh Gholizadeh:机构信息未在 arXiv HTML 中可靠披露
- Johannes-Rudolf David:机构信息未在 arXiv HTML 中可靠披露
- Dipankar Srirag:机构信息未在 arXiv HTML 中可靠披露
- Javier García Gilabert:机构信息未在 arXiv HTML 中可靠披露
- Ruta Binkyte:机构信息未在 arXiv HTML 中可靠披露
- Manar Ali:机构信息未在 arXiv HTML 中可靠披露
- Ana-Maria Bucur:机构信息未在 arXiv HTML 中可靠披露
- Sabry E. Farrag:机构信息未在 arXiv HTML 中可靠披露
- Youssef Saber:机构信息未在 arXiv HTML 中可靠披露
- Yihong Liu:机构信息未在 arXiv HTML 中可靠披露
- Jean Maillard:机构信息未在 arXiv HTML 中可靠披露
- Cojocaru Nicoleta:机构信息未在 arXiv HTML 中可靠披露
- Xiaochuang Yuan:机构信息未在 arXiv HTML 中可靠披露
- Sina Ahmadi:机构信息未在 arXiv HTML 中可靠披露
- Philipp Mondorf:机构信息未在 arXiv HTML 中可靠披露
- Kaustubh Dhole:机构信息未在 arXiv HTML 中可靠披露
- Roman Wixinger:机构信息未在 arXiv HTML 中可靠披露
- Shenbin Qian:机构信息未在 arXiv HTML 中可靠披露
- Manuel Tuor:机构信息未在 arXiv HTML 中可靠披露
- Sergey Troshin:机构信息未在 arXiv HTML 中可靠披露
- Jonathan Yahav:机构信息未在 arXiv HTML 中可靠披露
- Fida Mohammad Thoker:机构信息未在 arXiv HTML 中可靠披露
- Amir Arsalan Rezapour:机构信息未在 arXiv HTML 中可靠披露
- Lance Calvin Lim Gamboa:机构信息未在 arXiv HTML 中可靠披露
- Manon Reusens:机构信息未在 arXiv HTML 中可靠披露
- Kätriin Kukk:机构信息未在 arXiv HTML 中可靠披露
- Koel Dutta Chowdhury:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 不只收一个 WAV:把浏览器采集与变换留证的录音系统
标签:#语音质量评估 | #端到端 | #医疗音频 | #基准测试
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Augusto Camargo:Institute of Mathematics and Statistics, University of São Paulo, São Paulo, Brazil
📌 核心摘要
VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 耦合失真下不换模型而换管线:StrixAE 用智能体调度专家模型
标签:#语音增强 | #多模态模型 | #强化学习 | #指令微调 | #基准测试
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.6/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Chenglin Wu:Xiamen University
- Junjie Wu:Xiamen University
- Jinhang Chen:Xiamen University
- Mingyang Chen:Xiamen University
- Zixu Lin:Xiamen University
- Jiabian Chen:Fuyao University of Science and TechnologyEqual contribution.
- Xinghao Ding:Xiamen University
- Xiaotong Tu:Xiamen University
📌 核心摘要
针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 说话人一换就失准:用更强的判别器逼编码器减少说话人线索
英文题目:SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
标签:#语音情感识别 | #对抗训练 | #自监督学习 | #说话人验证
评分:6.3/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Eunseo Choi:机构信息未在 arXiv HTML 中可靠披露
- Hyunku Kang:机构信息未在 arXiv HTML 中可靠披露
- Chanwoo Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
针对未见说话人上情感识别易受说话人差异干扰的问题,论文用 wav2vec 2.0 做编码器、ECAPA-TDNN 做说话人判别器并以熵最大化做对抗,在 IEMOCAP 测试集报告 60.63% UA,代价是交替训练更复杂且存在原文内部数字不一致与未验证的跨库边界。
🔗 开源资源
- 代码相关资源:https://github.com/slp-lab-research/siser.git → https://github.com/slp-lab-research/siser — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 生成用短时谱、判别用对数谱:DSME 为何把预测与判别分开
标签:#语音增强 | #生成对抗网络 | #Transformer
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Fei Liu:机构信息未在 arXiv HTML 中可靠披露
- Yang Ai:机构信息未在 arXiv HTML 中可靠披露
- Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。
🔗 开源资源
- 演示资源:https://anonymity225.github.io/DSME/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 同样 2 倍速为何体验不同:按运动、语速和节奏算快放感知质量
英文题目:CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback
标签:#语音质量评估 | #音频质量评估 | #音乐理解
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jiarun Song:机构信息未在 arXiv HTML 中可靠披露
- Yuxin Song:机构信息未在 arXiv HTML 中可靠披露
- Fuzheng Yang:机构信息未在 arXiv HTML 中可靠披露
- Weisi Lin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该文在 1x 到 3x 主观评分基础上,用视频时间信息、语音语速和音乐节拍分别拟合指数衰减并融合成视听模型,在独立新序列上与主观均值高度一致,但意图推断只做到粗粒度辅助。
🔗 开源资源
第三方资源:https://www.kwai.com/ — 链接可访问(HTTP 200)
第三方资源:https://kmplayer.com/home — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 压住衰减曲线才能压住房间:375 bps 下的 RIR 神经压缩
英文题目:Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints
标签:#音频编码 | #端到端 | #空间音频 | #生成对抗网络
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Chen-Yuan Ning:机构信息未在 arXiv HTML 中可靠披露
- Yang Ai:机构信息未在 arXiv HTML 中可靠披露
- Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露
- Xiao-Hang Jiang:机构信息未在 arXiv HTML 中可靠披露
- Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
论文把 RIR 压缩从通用音频重建转向房间结构约束,用 EnCodec 单码本加 EDC 与局部能量加混响语音监督,在 375 bps 上把 T60 误差降到 1.14 s、ViSQOL 做到 4.11,但 46.875 bps 时容量明显不够。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 语义不够:语音平均意见分预测为何还需要声学保真度
英文题目:Is Semantics Enough for Speech Mean Opinion Score Prediction?
标签:#语音质量评估 | #自监督学习 | #模型评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Tianyu Lan:机构信息未在 arXiv HTML 中可靠披露
- Yufei Shi:机构信息未在 arXiv HTML 中可靠披露
- Yang Ai:机构信息未在 arXiv HTML 中可靠披露
- Honghao Sun:机构信息未在 arXiv HTML 中可靠披露
- Huipeng Du:机构信息未在 arXiv HTML 中可靠披露
- Zhenhua Ling:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
论文在 BVCC 训练、在 SOMOS 与 BC2019 零样本评测自监督、纯声学与统一编解码表示;融合语义和声学的部分模型有较好表现,但优劣随冻结或微调、数据集及评分或排序指标而变化,跨语种也有例外,不能据此宣布某一表示类别普遍最优。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 严重程度拉开差距时仍要可用:用严重程度混合微调 Whisper-small 并在 Jetson 上实测
英文题目:Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR
标签:#语音识别 | #领域适应 | #低资源 | #实时处理
评分:5.8/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Susmita Bhattacharjee:Indian Institute of Technology Guwahati, India
- Himashri Deka:Indian Institute of Technology Guwahati, India
- H.S. Shekhawat:Indian Institute of Technology Guwahati, India
- S.R.M. Prasanna:Indian Institute of Technology Dharwad, India
📌 核心摘要
针对唇腭裂语音随严重程度差异大的识别难题,论文用不同严重程度组合微调 Whisper-small 并在 Jetson 上实测,NOMIMOSE 把合并词错误率从 62.46% 降到 22.72%,NOMIMO 把合并音素错误率降到 18.44%,CLP-only 拿到最接近零的公平性得分 -22.85,而微调模型保持 0.167-0.171 实时系数和约 566.32 MB 峰值显存,但重度语音仍然最难。
🔗 开源资源
模型相关资源:https://huggingface.co/openai/whisper-small — 暂时无法访问
第三方资源:https://huggingface.co/openai/whisper-small — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 用成对心形麦克风测声强方向:紧框架阵列为何能做到 50 Hz 到 20 kHz
英文题目:Broadband Acoustic Intensity Direction Estimation with Tight-Frame Cardioid Arrays
标签:#声源定位 | #模型评估 | #基准测试
评分:5.7/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Akira Omoto:Faculty of Design, Kyushu University, Fukuoka 815-8540, Japan
📌 核心摘要
论文用消声室实测脉冲响应验证成对心形传声器的声强测向,在 50 Hz 到 20 kHz 内比较 TF24 与 TF6 和 20mm 与 100mm 间距,最强证据是 20mm 的 TF24 在干扰信号比 -20 dB 和 -30 dB 时全频段中值跟踪误差在 2.5 度以内,代价是大间距高频和强干扰下误差明显增大且存在与波长相关的峰。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 合成之前先对账:说话计划能否证明 delivery 真用了源记录
英文题目:VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis
标签:#语音合成 | #SFT | #基准测试 | #模型评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Mengzhe Geng:National Research Council Canada
📌 核心摘要
论文把合成前 delivery 决策做成带源引用的结构化说话计划,用确定性校验器检查引用合法性与单线索局部性,在 32 种子 100 例 full100 对照中去掉源记录使引用必需分数下降 0.488,而 7B 局部性修复在源键留出下恢复槽位准确率与局部性。
🔗 开源资源
- 代码相关资源:https://github.com/MENGZHEGENG/voxreason — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 打开混响黑盒:从 Schroeder 结构到可核对的分析与移植路径
英文题目:Opening mind by opening architecture: analysis strategies
标签:#音频生成 | #生成模型 | #开源工具 | #可解释性
评分:4.6/10 | 创新 0.5/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.6/1 | 影响力 0.4/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后 50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Francesco Vitucci:Conservatorio “N. Piccinni” - Bari
- Giuseppe Silvi:Conservatorio “N. Piccinni” - Bari
- Daniele Giuseppe Annese:Conservatorio “N. Piccinni” - Bari
- Francesco Scagliola:Conservatorio “N. Piccinni” - Bari
- Anthony Di Furia:Conservatorio “N. Piccinni” - Bari
📌 核心摘要
论文以 Schroeder 历史混响为案例,主张用开放架构重建 comb 与 all-pass 组合,通过 Csound 脉冲响应分析与 par/seq 重建验证理解过程,代价是遇到效率限制而把 C 编译 opcode 留作后续工作。
🔗 开源资源
代码相关资源:https://github.com/s-e-a-m/faust-libraries/blob/master/src/seam.schroeder.lib — 暂时无法访问
代码相关资源:https://github.com/s-e-a-m/csound-libraries — 链接可访问(HTTP 200)
代码相关资源:https://github.com/s-e-a-m/csound-libraries/blob/main/src/schroeder.udo — 暂时无法访问
第三方资源:https://faust.grame.fr/ — 链接可访问(HTTP 200)
第三方资源:https://faustdoc.grame.fr/manual/syntax/ — 链接可访问(HTTP 200)
第三方资源:https://www.wolfram.com/language/ — 链接可访问(HTTP 200)
第三方资源:https://dictionary.cambridge.org/dictionary/english/environment — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。