论文解读

能比出声音差别,却判不准是否换人:SpeakerSleuth 揭示的阈值与模态失衡

论文以多轮对话中同一说话人是否保持声学一致为问题,用检测、定位、判别三任务与 1818 个人审实例检验 12 个大音频语言模型与 6 种嵌入基线,最强证据是判别可达 81.5% 而检测仅 64.7% 且加文本上下文后不一致检出崩塌,代价是绝对判断阈值不稳与文本压过声学。

 · 更新于 2026-09-24 · 约 17 分钟 · 8418 字 阅读 →
论文解读

从离线到同传再到打分:IWSLT 2026 如何把语音翻译的任务、系统与评价钉在一起

IWSLT 2026 围绕离线、低资源、压缩、字幕、同传、语音生成与质量估计组织十个赛道,用统一数据条件、自动指标加听音频人工打分检验级联与端到端路线,最强证据是压缩后 4 比特模型与全精度接近、额外上下文平均提升 2.75 个 COMET 点,而语音质量估计在片段级仍远低于人工一致性。

 · 更新于 2026-09-24 · 约 21 分钟 · 10109 字 阅读 →
论文解读

说了就忘:多轮对话中语音风格为何守不住

论文把多轮语音风格保持定义为首轮指令后的逐轮指令遵循率,用同一话题与同一模拟用户测五类模型,报告首轮尚可但后续迅速退化,并显示显式回忆能部分缓解但需额外轮次代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8201 字 阅读 →
论文解读

AudioJudge:拼接与拆分提示如何让大音频模型做语音评测

该文研究用大音频模型直接做成对语音评测是否可行,发现基础提示在副语言细粒度判断上接近随机猜测,而测试音频拼接加 4 样本上下文与多方面集成可在系统排名上达到 0.91 左右的人类偏好相关,但冗长与位置偏置仍需处理。

 · 更新于 2026-09-24 · 约 17 分钟 · 8027 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

视觉对话不够吸引人:用合成语音补情感,再用交错建模学互动

针对视觉对话回复正确但不吸引人的问题,该研究用情感感知语音合成补齐音频上下文并以交错文本音频序列建模,配合三项预热任务与多模态参与度评估,在两个数据集上报告了语法与参与度两方面的提升,但合成音频的计算代价与真实人声泛化仍待验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9867 字 阅读 →
论文解读

Tri-PvP:用感知与命题的正交冲突把模态偏置从证据形式偏置中剥离

为解决全模态大模型在图文声三路互斥时把模态偏置与证据形式偏置混为一谈的问题,Tri-PvP 以 8000 样本的四条件匹配反事实与五模型对照揭示视觉主导且视听在感知与命题上不对称,并以早期线性可分与对比解码仅部分缓解且引入文本残余为代价验证偏置的表征根源。

 · 更新于 2026-09-24 · 约 25 分钟 · 12503 字 阅读 →
论文解读

猜对不算懂:用选项重排伪集成让音乐问答模型学会拒答

针对音乐音频语言模型在四选一问答中被迫作答而无法表达不知道的问题,论文用同一 TinyMU 检查点经答案不变扰动构造伪集成,主证据是四种选项排序平均将准确率从 55.7% 提升到 59.2% 并将误差保留曲线面积从 0.293 降到 0.261,代价是每次提问需要 4 次前向传播且无需重新训练。

 · 更新于 2026-09-24 · 约 17 分钟 · 8287 字 阅读 →
论文解读

用成对心形麦克风测声强方向:紧框架阵列为何能做到 50 Hz 到 20 kHz

论文用消声室实测脉冲响应验证成对心形传声器的声强测向,在 50 Hz 到 20 kHz 内比较 TF24 与 TF6 和 20mm 与 100mm 间距,最强证据是 20mm 的 TF24 在干扰信号比 -20 dB 和 -30 dB 时全频段中值跟踪误差在 2.5 度以内,代价是大间距高频和强干扰下误差明显增大且存在与波长相关的峰。

 · 更新于 2026-09-24 · 约 20 分钟 · 9881 字 阅读 →
论文解读

说了是谁还不够:全双工语音智能体能否在正确时刻做对地板动作

论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8224 字 阅读 →
论文解读

语义不够:语音平均意见分预测为何还需要声学保真度

论文在 BVCC 训练、在 SOMOS 与 BC2019 零样本评测自监督、纯声学与统一编解码表示;融合语义和声学的部分模型有较好表现,但优劣随冻结或微调、数据集及评分或排序指标而变化,跨语种也有例外,不能据此宣布某一表示类别普遍最优。

 · 更新于 2026-09-24 · 约 19 分钟 · 9134 字 阅读 →
论文解读

集中改四秒不等于识别器给全曲:MIDI-SAG 和弦条件传播的配对校准

在固定音轨、种子、上下文与评分窗下,中央 4 秒三全音破坏比完整 CNN-CRF 回放引发更大的伴奏特征偏移,而同时匹配改变支撑与关系构成的合成画像最接近回放响应,但它只缩小条件响应距离,不代表音质提升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7968 字 阅读 →
论文解读

合成之前先对账:说话计划能否证明 delivery 真用了源记录

论文把合成前 delivery 决策做成带源引用的结构化说话计划,用确定性校验器检查引用合法性与单线索局部性,在 32 种子 100 例 full100 对照中去掉源记录使引用必需分数下降 0.488,而 7B 局部性修复在源键留出下恢复槽位准确率与局部性。

 · 更新于 2026-09-24 · 约 20 分钟 · 9581 字 阅读 →
论文解读

百分之百的正确,也可能只说出了百分之五:语音脑机接口需要一把共同的尺子

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11347 字 阅读 →
论文解读

听错了才是听懂了?当大音频模型遇上人类幻听

音频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10268 字 阅读 →
论文解读

评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现

多模态模型 | 8.3/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10864 字 阅读 →
论文解读

听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气

语音情感识别 | 6.0/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14405 字 阅读 →
论文解读

把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉

音乐检索 | 7.3/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12385 字 阅读 →
论文解读

从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间

音频分离 | 5.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5061 字 阅读 →
论文解读

相位不再复用:当 Transformer 学会看懂复数谱图

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11532 字 阅读 →