论文解读

整场会议的自回归日志:事件式输出更稳,跨段身份仍需显式链接

该工作把完整会议说话人日志写成条件于声学输入的自回归结构化词元生成,对比事件式与帧式表示并引入语音活动与重叠等辅助线索,最强可运行证据是事件式 SAD 到 OD 再到 SD 链经 VBx 链接后在 AMI 上达到 24.40% 日志错误率,代价是原始输出跨段身份混乱且重叠区漏检仍然很高。

 · 更新于 2026-09-24 · 约 18 分钟 · 8820 字 阅读 →
论文解读

前景语音检测:只跟主讲人,靠监督而不是靠更长记忆学会挑人

论文把只检测持续在场主讲人的前景语音检测形式化为免注册逐帧二分类,用前景标签不变加竞争说话人混合的自动监督 recipe 让轻量流式 Mamba 在受控混合与真实远场上压低背景误报,同时在常规检测上保持可用,代价是目标不再占优与强语音形掩蔽下召回下降。

 · 更新于 2026-09-24 · 约 21 分钟 · 10092 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只反转波形不删除人声:分段逆放如何同时保住场景与音质

针对环境录音中可懂语音的隐私问题,论文用语音活动检测加语音分离定位语音后再做分段波形反转,在 CitySpeechMix 上报告词错误率 97.9%、声源分类准确率下降 2.7%、FAD 为 1.40,代价是确定性反转可被二次处理部分恢复,需重排序增强鲁棒性并损失音质。

 · 更新于 2026-09-24 · 约 19 分钟 · 9089 字 阅读 →
论文解读

车里噪音太多判不准语音:用音节级对齐重造训练标签的 SylVAD

针对车内发动机与路噪导致 Silero VAD 误检多、人工标注难的问题,SylVAD 用韩语音节级 MFA 自动构造标签并以噪声加权损失微调,在实车日志上把非语音段误检数从 3243 降到 1475,F1 从 0.9372 提升到 0.9556,代价是依赖文本与对齐分数过滤且推理结构不变。

 · 更新于 2026-09-24 · 约 16 分钟 · 7642 字 阅读 →
论文解读

标注起点系统性偏早时,如何量出语音检测的真实反应速度

论文把带噪标注起点建模为真实起点加偏移并用期望最大化估计数据集级均值来校正起始偏差,同时用对角状态空间模型 S4VAD 实现流式低延迟检测,在合成朗读混合与真实电影语音上报告了更低的起始偏差与延迟分布尾部,但结论依赖参考模型质量与有界独立噪声等假设且本次无可用代码资源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

同一骨干跑通检测与分类:MEGConformer 靠归一化弥合保留集偏移

该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

把混叠的音频表示拆开:AudioSAE 用稀疏自编码器解剖 Whisper 与 HuBERT

该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。

 · 更新于 2026-09-24 · 约 21 分钟 · 10239 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

无语音却有文本:用门控低秩投影在解码器表示层抑制 Whisper 幻觉

针对 Whisper 在无语音输入上生成流畅幻觉文本的问题,论文用无语音校准集估计解码器幻觉子空间并在推理时做低秩投影以提升无语音概率,门控版本在保留语音识别的同时把非语音幻觉率大幅降低。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

关掉麦克风不行,擦掉人声才行:助老监听的隐私防火墙

音频分类 | 5.9/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12221 字 阅读 →
论文解读

先别让模型开口:当语音大模型需要学会拒绝

语音识别 | 8.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7960 字 阅读 →
论文解读

Towards Operational Conversational Intelligence: A Speech Intelligence Framework

说话人日志 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6520 字 阅读 →
论文解读

VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment

语音活动检测 | 7.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6296 字 阅读 →
论文解读

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

语音交互 | 6.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5166 字 阅读 →
论文解读

Transforming Keystroke Noise to Text: Self-Supervised Acoustic Eavesdropping Attacks on Keyboards

语音活动检测 | 6.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7374 字 阅读 →
论文解读

HeadRoom: Lightweight, Edge-deployable Pipeline for Adaptive Notification Routing

音频事件检测 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6561 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-11

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 4 分钟 · 1819 字 阅读 →
论文解读

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

语音活动检测 | 6.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9878 字 阅读 →