研究条目

REDnet: Recursive Encoder and Decoder for Speech Separation under Unknown Number of Speakers and Variable Number of Microphones

📄 REDnet: Recursive Encoder and Decoder for Speech Separation under Unknown Number of Speakers and Variable Number of Microphones 标签:#语音分离 #多通道 #端到端 #鲁棒性 8.2/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音分离 | #端到端 | #多通道 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Fulin Wu(Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China) 通讯作者:正文未明确标注通讯作者 作者列表:Fulin Wu、Zhong-Qiu Wang(机构:Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 715 字 阅读 →
研究条目

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

📄 Relative Time Intervals Representation for Word-level Timestamping with Masked Training 标签:#语音识别 #语音大模型 #LoRA #鲁棒性 #长音频处理 8.6/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 🔥 8.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #语音大模型 | #LoRA #鲁棒性 | arxiv 👥 作者与机构 第一作者:Quanwei Tang(Soochow University) 通讯作者:Dong Zhang(dzhang@suda.edu.cn) 作者列表:Quanwei Tang、Zhiyu Tang、Xu Li、Dong Zhang、Shoushan Li、Guodong Zhou(机构:Soochow University;University of Queenland(原文拼写);AISpeech Ltd;Jiangsu Key Lab of Language Computing) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 785 字 阅读 →
研究条目

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

📄 SonarLLM: A Native Sonar–Optical Multimodal Large Language Model for Underwater Perception 标签:#音频理解 #多模态模型 #模型融合 #鲁棒性 8.0/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #多模态模型 | #模型融合 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Cong Su(Faculty of Information Engineering and Automation, Kunming University of Science and Technology;Yunnan Key Laboratory of Artificial Intelligence) 通讯作者:Longxuan Ma 作者列表:Cong Su、Longxuan Ma、Ling Dong、Guofeng Tang、Weijie Yin、Haohui Chen、Zhengtao Yu(机构:Faculty of Information Engineering and Automation, Kunming University of Science and Technology, Kunming, China;Yunnan Key Laboratory of Artificial Intelligence, Kunming, China) ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1102 字 阅读 →
研究条目

Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026

📄 Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026 标签:#音频理解 #语音大模型 #医疗音频 #端到端 #参数高效微调 7.7/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音频理解 | #语音大模型 | #医疗音频 #端到端 | arxiv 👥 作者与机构 第一作者:Enes Yavuz Ugan(ISL, Karlsruhe Institute of Technology) 通讯作者:正文未明确标注;仅列 Enes Yavuz Ugan 的联系邮箱 作者列表:Enes Yavuz Ugan、Fabian Retkowski、Yuka Ko、Thai-Binh Nguyen、Maike Züfle、Jan Niehues、Alexander Waibel(机构:ISL, Karlsruhe Institute of Technology;AI4LT, Karlsruhe Institute of Technology;InterACT, Carnegie Mellon University) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 798 字 阅读 →
研究条目

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

📄 Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework 标签:#音视频理解 #LoRA #多任务学习 #多模态模型 7.4/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #LoRA | #多任务学习 #多模态模型 | arxiv 👥 作者与机构 第一作者:Hanyu Xuan(School of Big Data and Statistics, Anhui University, Hefei 230039, China) 通讯作者:Junjun Mao;Zhiliang Wu 作者列表:Hanyu Xuan、Mengqi Zhang、Junjun Mao、Fei Wang、Kun Li、Guanghui Yue、Zhiliang Wu、Hehe Fan(机构:School of Big Data and Statistics, Anhui University, Hefei 230039, China;Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Hefei 230026, China;College of Information Technology, United Arab Emirates University, Abu Dhabi 15551, United Arab Emirates;School of Biomedical Engineering, Shenzhen University, Shenzhen 518060, China;College of Computing and Data Science, Nanyang Technological University, Singapore 639798, Singapore;School of Artificial Intelligence, Zhejiang University, Hangzhou 310007, China) ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1097 字 阅读 →
研究条目

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

📄 The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge 标签:#音视频语音分离 #基准测试 #鲁棒性 #数据集 #开源工具 8.8/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.8/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频语音分离 | #基准测试 | #鲁棒性 #数据集 | arxiv 👥 作者与机构 第一作者:Kai Li(Tsinghua University) 通讯作者:正文仅以星号标注核心贡献者,未明确通讯作者 作者列表:Kai Li、Wenze Ren、Junjie Li、Cheng Yu、Peijun Yang、Chien-yu Huang、Haibin Wu、Szu-Wei Fu、Wen-Chin Huang、Hsin-Min Wang、Xiaolin Hu、Ming Li、DeLiang Wang、Yu Tsao(机构:Tsinghua University、National Taiwan University、The Hong Kong Polytechnic University、Ohio State University、Wuhan University、Carnegie Mellon University、Meta、NVIDIA、Nagoya University、Academia Sinica、The Chinese University of Hong Kong, Shenzhen) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 765 字 阅读 →
研究条目

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

📄 Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes 标签:#空间音频 #音视频生成 #声源定位 #多通道 #CNN 6.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #CNN | #音视频生成 #声源定位 | arxiv 👥 作者与机构 第一作者:Qingyu Luo(Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) 通讯作者:论文未单独标注通讯作者;作者邮箱均为 University of Surrey 域名 作者列表:Qingyu Luo、Peng Zhang、Wenwu Wang、Philip J. B. Jackson(机构:Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 850 字 阅读 →
研究条目

Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery

📄 Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery 标签:#音频理解 #Transformer #自监督学习 #低资源 8.1/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #Transformer | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Hayat Rajani(Computer Vision and Robotics Research Institute (ViCOROB), University of Girona, Spain) 通讯作者:Hayat Rajani 作者列表:Hayat Rajani、Nuno Gracias、Rafael Garcia(机构:Computer Vision and Robotics Research Institute (ViCOROB), University of Girona, Spain) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 758 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-26

语音/音乐/音频论文速递 2026-08-26 共分析 26 篇论文 ⚡ 今日概览 ✅ 筛选入选 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 7 篇 ███████ #空间音频 3 篇 ███ #语音交互 2 篇 ██ #语音合成 2 篇 ██ #音乐生成 2 篇 ██ #音视频理解 2 篇 ██ #声源定位 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions… 9.6 前10% 方法研究 #语音合成 🥈 LAION-BVD: A 10-Million-Hour Open Video Dataset for… 9.4 前10% 数据集与基准 #音视频理解 🥉 The ISCSLP 2026 Real-World Audio-Visual Speech… 8.8 前25% 数据集与基准 #音视频语音分离 4. EM-KalmanNet: Learned Expectation-Maximization for… 8.8 前25% 方法研究 #声源定位 5. EXAM\(^2\): \(\underline{Ex}tending\) \(\underline{A}udio\)… 8.7 前25% 数据集与基准 #音频理解 6. FireRedAudio: A General-Purpose Audio Language Model… 8.7 前25% 模型报告 #音频理解 7. Arbitrary Polygon Oscillator: Generalizing Polygonal… 8.7 前25% 方法研究 #音乐生成 8. Relative Time Intervals Representation for Word-level… 8.6 前25% 方法研究 #语音识别 9. REDnet: Recursive Encoder and Decoder for Speech… 8.2 前25% 方法研究 #语音分离 10. From local kernels to global form: modeling the… 8.2 前25% 理论研究 #音乐理解 11. Lost in Speech: Trilingual Spoken Hallucination… 8.2 前25% 数据集与基准 #音频理解 12. Weakly Supervised Seafloor Segmentation for Seagrass… 8.1 前25% 方法研究 #音频理解 13. SonarLLM: A Native Sonar–Optical Multimodal Large… 8.0 前25% 方法研究 #音频理解 14. CoSTALA: Compositional Spatio-Temporal Audio-Language… 7.9 前25% 方法研究 #空间音频 15. Don’t Just Listen, Try Planning: Graph-based Retrieval… 7.8 前25% 方法研究 #音频理解 16. On the Robustness of Audio Deepfake Detection under… 7.7 前25% 方法研究 #音频伪造检测 17. Speech-to-SOAP: End-to-End Summarization of Medical… 7.7 前25% 系统技术报告 #音频理解 18. Array-Agnostic Ambisonics Encoding via Diffusion… 7.5 前25% 方法研究 #空间音频 19. OmniJudge or OmniBias? Diagnosing Multimodal Judges… 7.4 前50% 数据集与基准 #音频质量评估 20. Task-disentangled Low-Rank Adaptation for Versatile… 7.4 前50% 方法研究 #音视频理解 21. Anatomy of a Scam Call: What 10,000 real scam and spam… 7.3 前50% 应用研究 #语音交互 22. Preference Optimization for Non-Verbal Vocalization… 7.1 前50% 方法研究 #语音合成 23. One Timeline, Many Renderings: A Wolfram Language… 7.0 前50% 系统技术报告 #音乐生成 24. Visually-Guided Spatial Audio Generation for… 6.9 前50% 方法研究 #空间音频 25. Benchmarking LLM Judges for Voice-Agent Evaluation… 6.6 前50% 数据集与基准 #语音交互 26. Investigating voiced and unvoiced regions of speech… 6.4 前50% 方法研究 #语音伪造检测 📋 论文列表 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis 9.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ...

 · 更新于 2026-09-05 · 约 22 分钟 · 4543 字 阅读 →
研究条目

A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels

📄 A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels 标签:#声源定位 #生成模型 #理论分析 #高效推理 9.8/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.8/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #生成模型 | #理论分析 #高效推理 | arxiv 👥 作者与机构 第一作者:Ashwani Koul(Linköping University, Linköping, Sweden) 通讯作者:正文未明确标注 作者列表:Ashwani Koul、Gustaf Hendeby、Isaac Skog(机构:Linköping University;KTH;FOI-Swedish Defence Research Agency, Sweden) ...

 · 更新于 2026-09-05 · 约 2 分钟 · 400 字 阅读 →
研究条目

A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer

📄 A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer 标签:#语音交互 #SFT #LoRA #数据清洗 9.7/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 9.7/10 | 前10% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #SFT | #LoRA #数据清洗 | arxiv 👥 作者与机构 第一作者:Wonsup Shin(Flitto) 通讯作者:正文未明确标注 作者列表:Wonsup Shin、Jingu Kim(机构:Flitto) 💡 毒舌点评 这项工作最值得读的不是新增的 SFT 数据生产线,而是不讨巧的结论:judge 和专家都认为 QA 更好,固定配方训练后的 MCQA 却没有显著平均收益。2×2 消融、跨家族网格、Whisper 替换和全参 sanity check 让这一结论比单一最佳分数可靠。落地时应把论文当作阶段投资与评测匹配的证据,而不是把“质量精炼”视为默认增益按钮;更换语言、领域、模型家族或开放式端点后都需要重新验证。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 858 字 阅读 →
研究条目

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

📄 A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation 标签:#回声消除 #模型压缩 #高效推理 #实时处理 #理论分析 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #回声消除 | #模型压缩 | #高效推理 #实时处理 | arxiv 👥 作者与机构 第一作者:Ruibin Hou(The College of Computer Science and Technology, Inner Mongolia Minzu University, Tongliao, 028000, Inner Mongolia, China) 通讯作者:正文未明确标注 作者列表:Ruibin Hou、Chenggang Zhang、Yufeng Diao(机构:The College of Computer Science and Technology, Inner Mongolia Minzu University, Tongliao, 028000, Inner Mongolia, China) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 635 字 阅读 →
研究条目

Adaptive Hierarchical Representation Alliance for Multimodal Learning

📄 Adaptive Hierarchical Representation Alliance for Multimodal Learning 标签:#语音情感识别 #多模态模型 #模型融合 #鲁棒性 8.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #多模态模型 | #模型融合 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Chunlei Meng(College of Intelligent Robotics and Advanced Manufacturing, Fudan University) 通讯作者:Chunlei Meng、Chun Ouyang 作者列表:Chunlei Meng、Pengbin Feng、Jacqueline J. Pang、Chih-Ting Liao、Rong Fu、Zhaolu Kang、Zhongxue Gan、Chun Ouyang(机构:Fudan University;University of Southern California;J.P. Morgan Chase;University of New South Wales;Independent Researcher;Peking University) ...

 · 更新于 2026-09-05 · 约 2 分钟 · 399 字 阅读 →
研究条目

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

📄 AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection 标签:#音频伪造检测 #自监督学习 #基准测试 #鲁棒性 #模型评估 9.6/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 9.6/10 | 前10% | 文档类型:数据集与基准 | 评分置信度:中 | #音频伪造检测 | #自监督学习 | #基准测试 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Yuankun Xie(Communication University of China, Beijing, China;同时隶属 Ant Group) 通讯作者:正文未明确标注 作者列表:Yuankun Xie、Haonan Cheng、Jiayi Zhou、Xiaoxuan Guo、Tao Wang、Changhao Zhang、Jian Liu、Weiqiang Wang、Ruibo Fu、Xiaopeng Wang、Hengyan Huang、Xiaoying Huang、Long Ye、Guangtao Zhai(机构:Communication University of China, Beijing, China;Ant Group;Machine Intelligence, Ant Group, Shanghai, China;Institute of Automation, Chinese Academy of Sciences, Beijing, China;Beijing Institute of Technology, Beijing, China;Shanghai Jiao Tong University, Shanghai, China) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 506 字 阅读 →
研究条目

AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS

📄 AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS 标签:#音频水印 #生成模型 #CNN #鲁棒性 7.9/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频水印 | #生成模型 | #CNN #鲁棒性 | arxiv 👥 作者与机构 第一作者:Timothy Tin-Long Tse(National Research Council Canada,加拿大) 通讯作者:正文未明确标注 作者列表:Timothy Tin-Long Tse、Jian Zhu、Aidan Pine、Mengzhe Geng(机构:National Research Council Canada,加拿大;University of British Columbia,加拿大) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 430 字 阅读 →
研究条目

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

📄 AudioWorldSim: Realistic Binaural Audio Datasets For World Models 标签:#空间音频 #生成模型 #数据集 #多通道 9.7/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.7/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #空间音频 | #生成模型 | #数据集 #多通道 | arxiv 👥 作者与机构 第一作者:Luis Vitor Zerkowski(VISGRAF;IMPA) 通讯作者:正文未明确标注 作者列表:Luis Vitor Zerkowski、Luiz Velho(机构:VISGRAF;IMPA) 💡 毒舌点评 这是少见的把声学 bug 根因、特征尺寸、吞吐和失败率都写清楚的工具论文。同源卷积与 IR 补零修复的不是美化指标,而是会污染世界模型训练的真实不连续。最需要克制的是把开放生成器说成开放数据集或已验证的世界模型方案:5% 后端失败、材质禁用、场景许可和缺少下游实验仍是硬边界。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 435 字 阅读 →
研究条目

Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors

📄 Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors 标签:#音频理解 #大语言模型 #语音识别 #音频检索 #鲁棒性 9.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 9.1/10 | 前10% | 文档类型:应用研究 | 评分置信度:中 | #音频理解 | #大语言模型 | #语音识别 #音频检索 | arxiv 👥 作者与机构 第一作者:Zhenghua Bao(Continuum AI) 通讯作者:正文未明确标注 作者列表:Zhenghua Bao(机构:Continuum AI) 💡 毒舌点评 这是少见地把语音错误真正传到多跳检索末端、再逐层做归因的工作。它最有价值的发现不是复杂 RAG 绝对更差,而是更高 oracle ceiling 同时伴随更大 ASR gap。合成口音让机制控制清楚,却限制公平性外推。未来系统若只优化 WER、忽视实体置信度和改写链,仍会重复这里揭示的失败;公开流水线使这项诊断具备较好的复用价值。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 580 字 阅读 →
研究条目

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

📄 Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care 标签:#语音合成 #扩散模型 #数据集 #语音克隆 #低资源 7.6/10 | 创新 1.1/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.6/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #语音合成 | #扩散模型 | #数据集 #语音克隆 | arxiv 👥 作者与机构 第一作者:Kawshik Kumar Paul(Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) 通讯作者:正文未明确标注 作者列表:Kawshik Kumar Paul、Md. Nafiul Alam Fuji(机构:Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) ...

 · 更新于 2026-09-05 · 约 2 分钟 · 426 字 阅读 →
研究条目

Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings

📄 Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings 标签:#语音识别 #对比学习 #迁移学习 #多模态模型 8.3/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #对比学习 | #迁移学习 #多模态模型 | arxiv 👥 作者与机构 第一作者:Aoke Zhang(北京大学智能科学与技术学院言语听觉研究中心、北京大学先进交叉学科研究院 BioMed-X 研究中心) 通讯作者:Jing Chen 作者列表:Aoke Zhang、Bo Wang、Xihong Wu、Heping Cheng、Jing Chen(机构:北京大学智能科学与技术学院言语听觉研究中心;北京大学先进交叉学科研究院 BioMed-X 研究中心;通用人工智能全国重点实验室) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 547 字 阅读 →
研究条目

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

📄 DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization 标签:#语音质量评估 #自监督学习 #多任务学习 #模型评估 8.2/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音质量评估 | #自监督学习 | #多任务学习 #模型评估 | arxiv 👥 作者与机构 第一作者:Naiyuan Li(Ningbo University,College of Information Science and Engineering) 通讯作者:Diqun Yan 作者列表:Naiyuan Li、Li Dong、Diqun Yan(机构:Ningbo University,College of Information Science and Engineering;Ningbo University of Finance and Economics,College of Artificial Intelligence;浙江省大宗商品数字供应链与人工智能协同创新中心) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 506 字 阅读 →