论文解读

不抢前端的麦:用委派记号把工具调用交给后端大模型

针对全双工语音模型工具调用弱的问题,论文用前端判何时委派、后端做多轮工具调用再预填回前端复述的办法,在单轮调用召回 92%-97% 与多域语音代理任务上取得可比效果,代价是打断率偏高与合成数据带来的识别与暂停处理退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8644 字 阅读 →
论文解读

先分离重叠与特有,再用共识引导融合:三视图语音情感识别

针对同一话语的频谱图、MFCC 与 HuBERT 既重叠又互补而直接融合会淹没弱线索的问题,TriCGF 先分解为公共与特有分量再用全局共识加门控融合,在 IEMOCAP 上取得 74.19% 加权准确率与 75.17% 非加权准确率、在 EmoDB 上取得 94.36% 与 94.28%,代价是三路编码与门控带来更多训练配置与调参负担。

 · 更新于 2026-09-24 · 约 19 分钟 · 9121 字 阅读 →
论文解读

不动 ASR 模型,如何把田间嘈杂的多人农问转写做准

针对田间噪声、多说话人和农业词汇三类失败,论文用可开关的增强、说话人分离与词表修复包裹未改动的 ASR 模型,在印地语等三语评估上实现云端相对 16% 至 23% 的词错误率下降,多说话人下达 32% 至 42%,代价是增强与修复只在证据支持时生效且 M4 未被测量。

 · 更新于 2026-09-24 · 约 19 分钟 · 9045 字 阅读 →
论文解读

不穷举 220 种融合也能选编码器:用成绩相关性在互补与干扰之间划线

针对多编码器大音频语言模型靠直觉或穷举选编码器的问题,论文提出只用单编码器成绩算类别级与任务级相关性的 CUES 规则,在 XARES-LLM 上 Track A 选出三编码器提升 4.3% 而 Track B 主动只留双编码器提升 6.3%,代价是选择依赖开发集打分且仅在单 135M 骨干上验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10036 字 阅读 →
论文解读

语音大模型越靠近语言端病理线索为何越弱:编码器解码器与生成的分层核对

该工作在西班牙语德语捷克语帕金森语音上对比语音大模型的编码器表示解码器表示与零样本生成,报告编码器优于解码器而生成接近随机,并用样本自适应层聚合代替单层搜索,但跨语言绝对性能仍明显低于多语言混合训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9051 字 阅读 →
论文解读

不增加解码开销的领域适应:把目标域语言模型加进语音识别的参数里

针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。

 · 更新于 2026-09-24 · 约 22 分钟 · 10584 字 阅读 →
论文解读

不覆盖旧参数:为每个域追加冻结专家的全阶增量音频分类

针对域增量下旧音频不可回访且新专家对旧样本缺特征的问题,该文用冻结追加专家加无数据回放与跨域特征补全,在 DCASE 2026 任务 7 上报告 78.4% 微平均与 78.9% 宏平均,代价是专家数与拼接维度随域数线性增长。

 · 更新于 2026-09-24 · 约 17 分钟 · 8131 字 阅读 →
论文解读

全上下文能听准却不能边听边写:缓存感知与解码时浅融合如何让泰语流式识别可用

针对开放泰语识别被离线模型主导而真流式时崩溃的问题,论文用缓存感知编码器恢复流式能力并在解码时做浅融合来引导词汇,在 1 秒前视下把字符错误率降低约 4.5 倍并把关键词召回从 16.6% 提升到 20.7%,额外开销不足 3%。

 · 更新于 2026-09-24 · 约 18 分钟 · 8769 字 阅读 →
论文解读

只听说话方式不看说了什么:手工声学特征叠加 YAMNet 嵌入检测阿尔茨海默病

该研究只用语音音频区分阿尔茨海默病与健康对照,用 Librosa 手工声学均值特征与冻结 YAMNet 的 1024 维嵌入拼接后训练分类器,在 160 条合并数据上以 70% 训练 30% 测试取得 89% 测试准确率,代价是小样本、无人口学控制且未报告延迟与误判细节。

 · 更新于 2026-09-24 · 约 21 分钟 · 10343 字 阅读 →
论文解读

保住细粒度声学线索再借高层语义:CRAF 的不对称残差融合

针对未见伪造攻击泛化难的问题,CRAF 以 SSL 为主、ALLM 为高层引导做残差感知融合,在 ASVspoof 5 上 Kimi-Audio 配置报告评估 EER 为 5.96% 与 minDCF 为 0.1192,但攻击间差异与门控依赖仍是代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10497 字 阅读 →
论文解读

把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?

该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8711 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

薄板混响有数千个挤在一起的模态,双流如何同时看全局与局部衰减

针对一秒脉冲响应要估计数千个密集模态的问题,该工作用音频频谱变换器看全局结构、用动态模态分解提供局部衰减先验,在 1000 条验证上把总相对误差从 1.976 降到 0.867,但增益误差仍高达 0.907 且模态计数偏差仍大。

 · 更新于 2026-09-24 · 约 18 分钟 · 8657 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

少样本下音频语言模型适配:用乘积核同时对齐细节与全局语义

针对音频文本对少、少样本适配易过拟合的问题,MUKA 用 Pengi 细粒度相似与 CLAP 全局相似的乘积核做免训练的核岭回归适配,在 11 个音频数据集 16 样本设置下平均准确率达到 80.90%,但在部分数据集上仍不敌线性探测且依赖超参数迁移。

 · 更新于 2026-09-24 · 约 16 分钟 · 7987 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

转录质量决定翻译上限:WhiNN-ST 用级联与路由选择做低资源语音翻译

该研究针对博杰普尔语到印地语和爱尔兰语到英语的低资源语音翻译,采用先转录后翻译的级联路线,比较不同语音识别前端与直接和经中间语言的翻译路由,最强证据是博杰普尔语开发集上直接翻译取得 BLEU 25.59、chrF++ 42.48、TER 63.83,代价是爱尔兰语需换专用识别模型才达到全覆盖且仍依赖代理诊断而无标准翻译分数。

 · 更新于 2026-09-24 · 约 19 分钟 · 9225 字 阅读 →