论文解读

泰卢固语先出声再作答:VākQA 如何把语音、转写与评测分开检验

针对泰卢固语语音事实问答缺少基准与评测不可靠问题,VākQA 用 2001 对真人 quiz 语音与双语转写先校准自动评测再测问答,发现 Gemini 作答与做裁判均领先但仍受语言、模态与级联误差影响且文化域最敏感。

 · 更新于 2026-09-24 · 约 20 分钟 · 9667 字 阅读 →
论文解读

同一句话为何有时该让、有时该留:ECHO 用配对上下文检验全双工让轮

ECHO 把插入文本固定而重写前文对话来区分打断与非打断重叠,用必须两成员全对的配对指标报告了三系统重度让出偏置与仅 MiniCPM-o 4.5 相对均衡,代价是合成语音与受控声学带来的生态效度损失。

 · 更新于 2026-09-24 · 约 22 分钟 · 11022 字 阅读 →
论文解读

同一段语音,不同理解:用固定音频区分语义推断与直接给词

HearInContext 用共享合成语音配对隐式与显式上下文研究同音歧义消解,报告 Qwen3-ASR-1.7B 隐式目标词召回中英分别提升 11.0 和 11.5 个百分点而通用识别误差变化低于 0.1 个百分点,代价是训练配比不当会损害无关上下文鲁棒性。

 · 更新于 2026-09-24 · 约 17 分钟 · 8083 字 阅读 →
论文解读

演得久就会露馅:RoleBreak 测语音角色扮演的长程一致性与声音情感

RoleBreak 用 310 个角色与 6688 个多轮语音轮次同时测语义角色保持与声音情感表达,发现最强系统仍在平均 10.4 轮出现人格失败且全部系统情感分低于 14.7,而把语言模型从 2B 放大到 27B 能推迟语义失败却几乎不改善声音情感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8657 字 阅读 →
论文解读

对齐与开销分开算:TTM-Bench 如何让异构文本音乐系统可比

针对文本到音乐系统条件格式与访问方式不同难以直接比较的问题,TTM-Bench 用共享音乐规格加系统适配表达分别度量音乐内容对齐与计算效率,案例研究显示内容对齐更高并不系统性对应更低的计算需求。

 · 更新于 2026-09-24 · 约 18 分钟 · 8901 字 阅读 →
论文解读

标注预算只有 500 段时,主动学习如何在生物声学中选出值得标注的样本

BioDCASE 用固定 PerchV2 嵌入和两层分类头比较了 14 种批量主动采样策略,最强方法以四子集平均学习曲线下面积 0.507 超过随机采样的 0.401,但增益在 HSN 高达 67.1% 而在 ATBFL 仅 8.0%,且更小批量带来两倍计算代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8856 字 阅读 →
论文解读

同一首歌,不同找法:用指令把音乐检索的七种关系拆开诊断

该研究把参考音频加自然语言指令作为融合查询,用构造时就定义好的七种风格歌词旋律音色关系诊断表示的默认偏好,最强证据是五类模型在七个任务上最高点估计互相反转且声学编码器与文本对齐编码器互补,而轻量文本条件融合未能一致提升主干。

 · 更新于 2026-09-24 · 约 19 分钟 · 9047 字 阅读 →
论文解读

不看画质看物理:PIVOT 用可测量的声视约束验算生成视频

针对生成式音视频越来越难靠伪影区分的问题,PIVOT 把检测改写为先估计时序物理量再逐条验算事件相关物理定律的核查流程,在 PhysForensics-Bench 上以 70.30% 与 72.16% 的双生成器准确率超过直接大模型目检,但其代价是依赖几何与声学估计质量并在弱观测事件上明显退化。

 · 更新于 2026-09-24 · 约 25 分钟 · 12250 字 阅读 →
论文解读

比较分最难,口音比说话人难:VoiceMOS 2026 三赛道技术解读

VoiceMOS 2026 把语音评估拆成增强语音的绝对分与比较分、情感合成的自然度与情绪匹配、编解码合成的说话人与口音相似度 3 类任务,用 18 支队伍的提交显示多数队伍超过基线,而比较分与口音相似度仍最难,优胜系统普遍用预训练特征加听众建模加集成换取排序一致性。

 · 更新于 2026-09-24 · 约 18 分钟 · 8939 字 阅读 →
论文解读

记住同一条船:UniqueShip 用船舶身份隔离重测水下舰船分类

针对随机切分让同一艘船同时出现在训练与测试导致虚高的问题,UniqueShip 按 MMSI 隔离船舶、按天隔离背景构建 2460 小时船舶音频与 4218 艘船的基准,最强 Swin 加 Mel 基线在无泄漏下准确率为 0.665,而引入泄漏可抬高 0.08-0.21,且船数翻倍增益 2.4-2.6 点约为时长翻倍 0.8-1.3 点的两到三倍。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-15

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 38 分钟 · 18639 字 阅读 →
论文解读

边说边改还是停下让路:全双工智能体如何接住重叠话语

该研究把听者重叠贡献分为回馈、协作与打断,把说话人行为分为不变继续、回合内适应与让出,用 300 个人工确认线索对比录音人与 PersonaPlex 的配对延续,最强证据是 66 个协作对中录音人 68.2% 适应而模型仅 34.8%,代价是其余行为分流为不变继续与让出且评估依赖转录打分与受限复现条件。

 · 更新于 2026-09-24 · 约 21 分钟 · 10146 字 阅读 →
论文解读

多人对话里该说还是该静:MP-Bench 把轮次感知拆成可核对的行为题

MP-Bench 用合成四人语音与显式、隐式、消极三类轮次条件测语音智能体,12 个系统的最强证据是带完美说话人标签的文本上限接近满分而实时语音系统在游戏轮次上徘徊于随机水平,代价是完全受控合成、无重叠与单决策点评估。

 · 更新于 2026-09-24 · 约 23 分钟 · 11162 字 阅读 →
论文解读

长音频里按文字找片段:对齐要准,时间也要准

音频时刻检索要求在数分钟录音中按自由文本返回起止时间,基线用 MS-CLAP 加 QD-DETR 在开发测试集上 Recall1@0.7 为 13.56%,前三名以更强特征与检测网络加分数校准或多分辨率集成达到 48.59%,代价是更复杂的特征组合与后处理。

 · 更新于 2026-09-24 · 约 19 分钟 · 9399 字 阅读 →
论文解读

从人脸二分类到十一场景四层追问:AVFakeBench 如何考住音视频大模型

该研究针对真实世界音视频伪造超越人脸、混用编辑与合成的问题,构建含 3000 片段与 12000 问答的 AVFakeBench 并评测 11 个音视频大模型与 2 个专用检测器,报告显示大模型在二分类上更稳但在细粒度分类与解释上大幅下滑且存在视觉偏向与编辑盲区。

 · 更新于 2026-09-24 · 约 18 分钟 · 8895 字 阅读 →
论文解读

用婴儿两年的所见所闻,能否从零训练出会看会说的视觉基础模型

论文以 6 至 32 个月婴儿视角的纵向音视频为唯一感官来源,构建视频话语、图像话语与多轮交错三种预训练数据并从零训练紧凑视觉语言模型,再以新发布临床工具为依据建成十任务基准,证据显示小模型可在部分认知任务上接近大模型但域外泛化与未见任务仍明显受限。

 · 更新于 2026-09-24 · 约 21 分钟 · 10371 字 阅读 →
论文解读

集成显卡跑不动小模型、却能加速大卷积:Snapdragon 流式神经音频的实测边界

该工作在骁龙开发板上实测五种神经音频模型的中央处理器与集成图形处理器推理,问题是流式回调期限下集成显卡何时有效,选择是统一用高通推理栈对比最优中央处理器引擎,最强证据是二维卷积声码器在最小块上图形处理器已全面领先,主要代价是小模型与循环模型的调用开销反而拖慢并需要借用大缓冲换并行。

 · 更新于 2026-09-24 · 约 20 分钟 · 9555 字 阅读 →
论文解读

只听其声不够:用单因素反事实考视频生音频的物理因果

论文提出只变一个物理因素的时间对齐视频对与单视频模式测试来审计视频生音频模型,用方向一致性与敲击对齐度量揭示文本提升语义却损害同步、像素物理推理普遍偏弱的代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10082 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →