论文解读

边听边说还要调工具:NemotronLabs VoiceChat 如何把全双工对话与函数调用装进一个流式系统

针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。

 · 更新于 2026-09-25 · 约 25 分钟 · 12382 字 阅读 →
论文解读

不只听懂说了什么:用 22 个副语言特征和两阶段课程统一说话方式与声学环境理解

针对音频大模型能转写却听不懂说话方式与声学环境的问题,论文用 22 维特征定义、120 万音频问答对与先单属性后多属性的两阶段课程训练 ParA-LLM,在 ParA-Bench 总体上报告 43.53% 准确率并在外部语音基准上同步提升,代价是声学单项仍弱于 GPT-4o-Audio 且绝对准确率仍远低于人类。

 · 更新于 2026-09-25 · 约 17 分钟 · 8324 字 阅读 →
论文解读

不训练生成器,只做部分编辑:PACE 在冻结表征里权衡口音与保留

PACE 针对非平行口音转换,用冻结 WavLM 上的口音预测子空间更新加检索融合实现推理时可调的转换强度,默认点以 16.0% 词错误率和 39.0% 分类器准确率优于复现基线,代价是说话人相似度降到 0.583。

 · 更新于 2026-09-25 · 约 17 分钟 · 8397 字 阅读 →
论文解读

少看一点反而写得更好:用一个旋钮控制流式解码器能看多少

论文研究视频字幕与语音转写在流式条件下如何决定每写一个词可见多少源,用单参数幂律窗口替代固定等待,在三个公开集上以 29M 解码器在低延迟处保持质量并给出结构化不偷看证明,代价是长度估计与单轮运行噪声仍需复核。

 · 更新于 2026-09-25 · 约 16 分钟 · 7597 字 阅读 →
论文解读

听懂东南亚语音:SEABED 用六类可听推理把答对和讲对分开查

SEABED 针对印尼语、泰语和马来语真实语音构造必须听音频才能推理的问答,用准确率加推理接地审计测六个音频大模型,最好的 Gemini 3.5 Flash 也只答对约一半,且区域模型的正确回答中多达四分之一缺少音频依据。

 · 更新于 2026-09-25 · 约 22 分钟 · 10910 字 阅读 →
论文解读

先分证据再定修复模式:稀疏、突发与密集专家的时序路由

该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。

 · 更新于 2026-09-25 · 约 21 分钟 · 10120 字 阅读 →
论文解读

整场会议的自回归日志:事件式输出更稳,跨段身份仍需显式链接

该工作把完整会议说话人日志写成条件于声学输入的自回归结构化词元生成,对比事件式与帧式表示并引入语音活动与重叠等辅助线索,最强可运行证据是事件式 SAD 到 OD 再到 SD 链经 VBx 链接后在 AMI 上达到 24.40% 日志错误率,代价是原始输出跨段身份混乱且重叠区漏检仍然很高。

 · 更新于 2026-09-25 · 约 18 分钟 · 8820 字 阅读 →
论文解读

把回声方向看成概率密度:球谐域切片 Wasserstein 如何搬运声源与反射

论文把空间房间脉冲响应的聚合回声方向建模为球谐非负密度,用平方和半定规划做极大似然估计与逆变换采样,再以球面切片 Wasserstein 位移插值直线路径上的声源与反射密度,实验显示 Wasserstein 插值在整条路径上切片距离最小,但代价是切片离散化与非负约束带来的两步优化。

 · 更新于 2026-09-25 · 约 18 分钟 · 9014 字 阅读 →
论文解读

真采样对为何还不够:用真实标注训练采样识别并拆分数据与配方的贡献

该文针对采样识别中人工合成对难以模仿真实制作变换的问题,提出在真实采样对上全监督训练的 SIE 模型与训练配方,并在三个基准上报告优于前最优的结果,同时用对照实验说明数据替换与架构配方各自的贡献与代价。

 · 更新于 2026-09-25 · 约 20 分钟 · 9874 字 阅读 →
论文解读

先分清谁在说话、再转写说什么:Transsion 级联式多语说话人归属转写系统解读

针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。

 · 更新于 2026-09-25 · 约 18 分钟 · 8539 字 阅读 →
论文解读

证据越远越难用:Vox-Infinity 按所需历史时长检验语音长上下文

Vox-Infinity 沿轮数与每轮时长拉长语音历史并以最早证据到提问的跨度分组,在七个语音语言模型上报告随证据变远准确率下降的近因效应,以及文本历史保语义而音频历史保韵律的互补代价。

 · 更新于 2026-09-25 · 约 15 分钟 · 7278 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 54 分钟 · 26987 字 阅读 →
论文解读

只听静音也能分类:临床语音数据集里的捷径从何而来

该研究在抑郁、构音障碍、帕金森和口吃五个语音数据集上只用首秒或静音段做分类,发现其加权 F1 常与全音频持平甚至更高,说明录音条件等非言语线索可能贡献了预测性能,但未定位确切混杂源。

 · 更新于 2026-09-25 · 约 19 分钟 · 9426 字 阅读 →
论文解读

在低秩优化器里加旧任务曲率:CGaLore 如何让 ASR 基座模型记得住又学得进

针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。

 · 更新于 2026-09-25 · 约 19 分钟 · 9335 字 阅读 →
论文解读

只用生成误差学作曲家风格:Composer2Vec 的时间轴从哪里来

论文用 124 位作曲家的旋律续写任务训练条件 Transformer,只以作曲家身份为监督,学到的 124×128 嵌入的第一主成分与出生年强相关并通过打乱检验,最强的向量算术例子同时暴露了旋律表征覆盖不了配器音色的代价。

 · 更新于 2026-09-25 · 约 20 分钟 · 9671 字 阅读 →
论文解读

伪标签不可靠时,如何用左右可靠笔触给不确定片段加权

针对序列级塔布拉鼓点转录标注稀缺问题,该工作用教师模型生成伪标签、S-CEM 估计每个鼓点可信度、CMW-ATC 在不确定片段上按马尔可夫转移加权候选序列,在三组评测上把序列错误率降到 18.3、33.3 和 12.7,但仍需序列级标注和固定转移矩阵。

 · 更新于 2026-09-25 · 约 19 分钟 · 9066 字 阅读 →
论文解读

跨语言帕金森严重程度分级:预训练语音嵌入能迁移什么,又在哪里混淆

该研究用四种语音基础模型嵌入加四种浅层分类器做健康对照、轻度、重度三分类,在意大利语、英语、哥伦比亚西班牙语之间做零样本与每类 49 个目标片段的 k 样本适配,发现 k 样本一致提升目标语言 F1 且源语言基本稳定,但重度与轻度边界和预处理线索损失仍是主要代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8858 字 阅读 →
论文解读

训练后指纹还算数吗:跟踪同一 TTS 血统从预训练到 SFT 与 RL 的取证漂移

GenTraceBench 把同一 TTS 谱系内预训练与 SFT、DPO、GRPO 适配后的配对检查点固定文本和说话人重合成来测取证稳定性,报告显示 RL 对齐平均归因变化小而部分 SFT 与预训练数据更换带来大幅漂移,且多样本注册只能缓解方差型漂移而不能纠正均值偏移。

 · 更新于 2026-09-25 · 约 17 分钟 · 8311 字 阅读 →
论文解读

不用判别器猜分数:并行建模谐波与可微感知损失如何分工

针对带噪语音中浊音谐波易被抹掉且 PESQ 不可微的问题,HAMMER 用时间-频率并行注意力-Mamba 加自相关前馈建模周期性,并用软化 PESQ 加可微 LLR 直接优化,在 VoiceBank+DEMAND 上报告 3.69 PESQ 和 4.41 COVL,推理时对比度拉伸可到 3.79 PESQ 但背景分随之下降。

 · 更新于 2026-09-25 · 约 19 分钟 · 9261 字 阅读 →
论文解读

只给一次提醒意图,让音频大模型自己决定何时开口:中断与静默建模

论文把连续音频监护形式化为四态打断或静默决策,用两个特殊词嵌入解码,在 ESC-50 上报告 99.6% 中断 F1 与 100.0% 去重召回,在未训练的 Epic-Sounds 上保持 96.7% 起始召回,代价是嘈杂域静默召回仅 10.1% 与平均 3.5 秒流式延迟。

 · 更新于 2026-09-25 · 约 18 分钟 · 8551 字 阅读 →