论文解读

边说话边做事:用前后台分离让语音中断不再取消任务

针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。

 · 更新于 2026-09-25 · 约 17 分钟 · 8482 字 阅读 →
论文解读

从感知到干活:Qwen3.8-Omni-Flash 如何把长音视频变成可执行的智能体工作流

论文要解决长音视频生产力任务中感知与长程规划脱节的问题,选择原生多模态共训加百万上下文与按需取证的智能体执行,证据是多说话人识别与长视频推理的大幅提升,代价是通用转写翻译仍有差距且实时交互需非思考模式换取低延迟。

 · 更新于 2026-09-25 · 约 21 分钟 · 10373 字 阅读 →
论文解读

短到长真的教会了模型吗:把排序、组批与损失归一化解开

论文把短到长训练拆成呈现顺序、批次组成与损失归一化三件事来测,在 87M 语音词元模型上发现固定组批后排序本身不降困惑度,首轮分组的增益只出现在按批平均的损失下并随词元均衡归一化而消失,而持续排序反而更差。

 · 更新于 2026-09-25 · 约 7 分钟 · 3371 字 阅读 →
论文解读

不重编音频也能验声:复用编码器状态删掉无据事件提及

针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。

 · 更新于 2026-09-25 · 约 16 分钟 · 7925 字 阅读 →
论文解读

从全脸到嘴部:ROAM-ASD 用联合自注意力应对开放世界的说话人检测

针对野外遮挡噪声下说话人易误判问题,ROAM-ASD 联合音频、全脸与嘴部三流并用联合自注意力加模态丢弃融合,在五个基准上取得 98.8%、87.9% 等 mAP,代价是需要人脸跟踪与嘴部关键点定位。

 · 更新于 2026-09-25 · 约 20 分钟 · 9534 字 阅读 →
论文解读

同形异读被折叠时:用注音绑定把读音留存在监督目标里

针对日语音形多对多导致正字法监督折叠词位读音的问题,论文把目标细化为 span 绑定的 ruby 序列并用 Qwen3-ASR 加 mora 级 CTC 联合训练,在五项基准上以加权 Kana CER 3.75% 改善读音直读而字形转写未退化,但自发语音与罕见词形仍是主要瓶颈。

 · 更新于 2026-09-25 · 约 20 分钟 · 9862 字 阅读 →
论文解读

从单句朗读到整场演戏:SceneTTS-Bench 如何量角色稳定、演技与节奏

针对戏剧配音中角色跨轮音色漂移、高潮台词演绎不足与长句分段节奏断裂三类场景级失效,SceneTTS-Bench 用统一输入协议与 SCS、UAR、RDR 三条自动诊断链在 160 场双语剧本上测出四套系统的互补短板,且场景级排序与句级可懂度排序明显背离。

 · 更新于 2026-09-25 · 约 21 分钟 · 10476 字 阅读 →
论文解读

不看配对样本,如何学到从退化到干净的随机输运

SE-MSB 用扩散薛定谔桥在干净与退化语音分布之间学习双向随机输运,并以端到端 Mamba 波形模型实现,在去混响与混合退化上报告可比拟配对方法的效果,同时保持少步采样与低计算量。

 · 更新于 2026-09-25 · 约 18 分钟 · 8882 字 阅读 →
论文解读

只改几个词更难抓:SPADE 用 12 种语言考验部分伪造定位的跨模型泛化

SPADE 针对长语音中局部篡改的检测与定位问题,用大模型改写文本加合成与编辑两类生成器构建 12 语言数据,并在定位模型上报告跨生成器、跨语言、跨声学环境三类泛化证据,主要代价是未见生成器下接近随机猜测且噪声下显著退化。

 · 更新于 2026-09-25 · 约 18 分钟 · 8525 字 阅读 →
论文解读

边想边说:用异步进度语音盖住推理静音的口语模型

针对串行先想后说导致长时间无声等待的问题,该工作用推理主路加轻量报幕支路的异步结构,在保持串行推理问答精度基本相当的同时,把用户可感知的静音大幅压低,代价是需要额外的报幕生成与动态调度。

 · 更新于 2026-09-25 · 约 18 分钟 · 9015 字 阅读 →
论文解读

修音准节奏又不换嗓:整流流如何把遮罩补全做成风格保持的美化

针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。

 · 更新于 2026-09-25 · 约 17 分钟 · 8144 字 阅读 →
论文解读

文字分高不等于还在听波形:一次 Qwen2-Audio 量化的三路核对

论文以 Qwen2-Audio 为案例分离词汇输出、转录不足的波形依赖行为与打包实现测量,显示 6 比特翻译选中分配在冻结重放上 chrF 提升但情绪识别下降,而反例与对照说明文本分不能替代波形使用证据。

 · 更新于 2026-09-25 · 约 15 分钟 · 7118 字 阅读 →
论文解读

两人对话先分清谁在说,再听懂整场在说什么:第二届 MLC-SLM 的多任务设定

该挑战用约 2100 小时 14 语言双人对话同时考 diarization 加识别与整场理解,基线显示长时说话人对齐与语义推理是主要瓶颈,而参赛系统靠域内 diarization 适配与音频依赖监督把误差与准确率推到新水平。

 · 更新于 2026-09-25 · 约 20 分钟 · 9734 字 阅读 →
论文解读

谁来定义酷儿语音数据:从众包采集到共同设计的策展转向

本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。

 · 更新于 2026-09-25 · 约 21 分钟 · 10463 字 阅读 →
论文解读

先转写再翻译为何在训练时作弊:用联合奖励把生成的前缀拉回推理分布

针对转写链式思维在有监督微调中用参考转写做前缀而推理用自生成转写的不一致,论文用 GRPO 同时奖励自生成转写和以其为条件的翻译,在相同 CoVoST 2 训练样本下 CoT GRPO 在两套测试上 BLEU 领先并把 WER 相对降低 8.8% 和 7.2%,代价是需要多样本 rollout 和显式调 ASR 权重。

 · 更新于 2026-09-25 · 约 7 分钟 · 3185 字 阅读 →
论文解读

删掉画面还要删掉声音:文本与已编辑视频如何共同指定要压制的声源

针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。

 · 更新于 2026-09-25 · 约 17 分钟 · 8034 字 阅读 →
论文解读

录音很多不等于见过很多海域:被动声监测中空间异质性如何抬高验证分数

论文用 908072 段 AIS 标注录音说明部署间先验差超 200 倍、随机窗口验证比未见站点验证高出配对 0.049 的 ROC-AUC,因而主张按站点分组验证并扩大独立空间采样,空间专家模型仍只是待验证假设。

 · 更新于 2026-09-25 · 约 22 分钟 · 10750 字 阅读 →
论文解读

纠缠托底差距:用三轴合成网格审计并解耦音频表征的人口公平性

该文用 120 文本×24 声音画像×10 风格的合成正交网格审计 10 个开源音频编码器与 2 个闭源语音问答系统,以主夹角泄漏解释探针差距并用正交残差对比适配器降低泄漏与差距,代价是需要合成感知属性假设与额外适配训练。

 · 更新于 2026-09-25 · 约 17 分钟 · 8493 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 112 分钟 · 55814 字 阅读 →
论文解读

把可懂度比较搬进声道:九维收缩变量为何能替掉上千维自监督特征

针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。

 · 更新于 2026-09-25 · 约 21 分钟 · 10088 字 阅读 →