不抢前端的麦:用委派记号把工具调用交给后端大模型
针对全双工语音模型工具调用弱的问题,论文用前端判何时委派、后端做多轮工具调用再预填回前端复述的办法,在单轮调用召回 92%-97% 与多域语音代理任务上取得可比效果,代价是打断率偏高与合成数据带来的识别与暂停处理退化。
针对全双工语音模型工具调用弱的问题,论文用前端判何时委派、后端做多轮工具调用再预填回前端复述的办法,在单轮调用召回 92%-97% 与多域语音代理任务上取得可比效果,代价是打断率偏高与合成数据带来的识别与暂停处理退化。
针对同一话语的频谱图、MFCC 与 HuBERT 既重叠又互补而直接融合会淹没弱线索的问题,TriCGF 先分解为公共与特有分量再用全局共识加门控融合,在 IEMOCAP 上取得 74.19% 加权准确率与 75.17% 非加权准确率、在 EmoDB 上取得 94.36% 与 94.28%,代价是三路编码与门控带来更多训练配置与调参负担。
针对田间噪声、多说话人和农业词汇三类失败,论文用可开关的增强、说话人分离与词表修复包裹未改动的 ASR 模型,在印地语等三语评估上实现云端相对 16% 至 23% 的词错误率下降,多说话人下达 32% 至 42%,代价是增强与修复只在证据支持时生效且 M4 未被测量。
针对多编码器大音频语言模型靠直觉或穷举选编码器的问题,论文提出只用单编码器成绩算类别级与任务级相关性的 CUES 规则,在 XARES-LLM 上 Track A 选出三编码器提升 4.3% 而 Track B 主动只留双编码器提升 6.3%,代价是选择依赖开发集打分且仅在单 135M 骨干上验证。
该工作在西班牙语德语捷克语帕金森语音上对比语音大模型的编码器表示解码器表示与零样本生成,报告编码器优于解码器而生成接近随机,并用样本自适应层聚合代替单层搜索,但跨语言绝对性能仍明显低于多语言混合训练。
针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。
针对域增量下旧音频不可回访且新专家对旧样本缺特征的问题,该文用冻结追加专家加无数据回放与跨域特征补全,在 DCASE 2026 任务 7 上报告 78.4% 微平均与 78.9% 宏平均,代价是专家数与拼接维度随域数线性增长。
针对开放泰语识别被离线模型主导而真流式时崩溃的问题,论文用缓存感知编码器恢复流式能力并在解码时做浅融合来引导词汇,在 1 秒前视下把字符错误率降低约 4.5 倍并把关键词召回从 16.6% 提升到 20.7%,额外开销不足 3%。
该研究只用语音音频区分阿尔茨海默病与健康对照,用 Librosa 手工声学均值特征与冻结 YAMNet 的 1024 维嵌入拼接后训练分类器,在 160 条合并数据上以 70% 训练 30% 测试取得 89% 测试准确率,代价是小样本、无人口学控制且未报告延迟与误判细节。
针对未见伪造攻击泛化难的问题,CRAF 以 SSL 为主、ALLM 为高层引导做残差感知融合,在 ASVspoof 5 上 Kimi-Audio 配置报告评估 EER 为 5.96% 与 minDCF 为 0.1192,但攻击间差异与门控依赖仍是代价。
该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
针对一秒脉冲响应要估计数千个密集模态的问题,该工作用音频频谱变换器看全局结构、用动态模态分解提供局部衰减先验,在 1000 条验证上把总相对误差从 1.976 降到 0.867,但增益误差仍高达 0.907 且模态计数偏差仍大。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对音频文本对少、少样本适配易过拟合的问题,MUKA 用 Pengi 细粒度相似与 CLAP 全局相似的乘积核做免训练的核岭回归适配,在 11 个音频数据集 16 样本设置下平均准确率达到 80.90%,但在部分数据集上仍不敌线性探测且依赖超参数迁移。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该研究针对博杰普尔语到印地语和爱尔兰语到英语的低资源语音翻译,采用先转录后翻译的级联路线,比较不同语音识别前端与直接和经中间语言的翻译路由,最强证据是博杰普尔语开发集上直接翻译取得 BLEU 25.59、chrF++ 42.48、TER 63.83,代价是爱尔兰语需换专用识别模型才达到全覆盖且仍依赖代理诊断而无标准翻译分数。