论文解读

不改脸只改声:把保护藏进人耳听不见的掩蔽阴影

语音合成 | 4.3/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11558 字 阅读 →
论文解读

把 2M 维坐标压到一条曲线上:BOGE 如何用物理先验与贝叶斯优化校准水下柔性阵

声源定位 | 5.7/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12536 字 阅读 →
论文解读

给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11082 字 阅读 →
论文解读

口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开

语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 22 分钟 · 11019 字 阅读 →
论文解读

提示词动了,词错误率为什么不动:一次生产级口述史转录的预注册阴性消融

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11646 字 阅读 →
论文解读

干净本身成了开关:当语音增强的理想输出反噬自身

语音增强 | 6.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10275 字 阅读 →
论文解读

别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听

语音伪造检测 | 6.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11536 字 阅读 →
论文解读

听错一句,机器就敢动手:语音误差如何撬开具身智能的安全锁

语音交互 | 5.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8038 字 阅读 →
论文解读

先分清状态,再决定能不能说话:Anian 如何把生成关进安全笼子

语音交互 | 5.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8236 字 阅读 →
论文解读

想找回被替换的原话,先接受水印不能再像哈希那样精确

音频水印 | 6.4/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3888 字 阅读 →
论文解读

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

声源定位 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5988 字 阅读 →
论文解读

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

音频理解 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6093 字 阅读 →
论文解读

On the Robustness of Audio Deepfake Detection under Audio Watermarking

音频伪造检测 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5950 字 阅读 →
论文解读

REDnet: Recursive Encoder and Decoder for Speech Separation under Unknown Number of Speakers and Variable Number of Microphones

语音分离 | 8.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5941 字 阅读 →
论文解读

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6295 字 阅读 →
论文解读

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

音频理解 | 8.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7258 字 阅读 →
论文解读

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

音视频语音分离 | 8.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6292 字 阅读 →
论文解读

Adaptive Hierarchical Representation Alliance for Multimodal Learning

语音情感识别 | 8.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4966 字 阅读 →
论文解读

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

音频伪造检测 | 9.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5822 字 阅读 →
论文解读

AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS

音频水印 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →