论文解读

低资源希腊语合成靠确定性提示词稳住说话人:多语先验加两阶段适配

针对希腊语干净单说话人数据稀缺导致音色漂移的问题,论文用 WhisperX 清洗与切分搭建希腊语适配数据,再对 880M 参数 Parler-TTS 做多说话人全量微调加 3.5 小时单说话人 LoRA,并以确定性提示词替代大模型生成提示词,最优配置报告 WER 10.7%、MOS-I 4.00、MOS-C 4.24,但频谱保真与目标说话人相似度仍有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8144 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

认不出带口音的英语:码切换语音识别先补口音英语再谈排序

针对码切换话语中带矩阵语言口音的英语检出接近零的问题,论文用 80 条口音匹配英语做 LoRA 微调 MMS-LID 并引入 LangRank 排序评估,在印地-英语等四对语言上提升英语检出同时保持单语性能,代价是仍与 Oracle 有差距且依赖已知矩阵语言选口音。

 · 更新于 2026-09-24 · 约 18 分钟 · 8676 字 阅读 →
论文解读

多语言共用低秩空间为何冲突:MoLoRA 用共享与路由专家分开建模

针对多语言端到端语音翻译中共用单组低秩更新导致语言间干扰的问题,MoLoRA 把多个低秩适配模块当作专家并辅以多粒度语音融合,在 MuST-C 八语言平均 32.2 与 CoVoST-2 三语言平均 36.3 的 BLEU 下超过同量级单 LoRA,代价是路由与负载均衡等额外机制和调参成本。

 · 更新于 2026-09-24 · 约 21 分钟 · 10072 字 阅读 →
论文解读

让大语言模型直接听出谁在何时说话:联合转写与切分的原生 diarisation 方案

该提案要把语音感知大语言模型从只做转写扩展到原生联合完成自动语音识别与说话人切分,做法是冻结大语言模型主干、分两阶段训练音频编码器与适配器并加入上下文提示,证据是所列开源切分数据的时长与语言分布以及词错率与切分错率的明确定义,代价是切分标注数据少且尚未给出可运行系统的定量主结果。

 · 更新于 2026-09-24 · 约 19 分钟 · 9173 字 阅读 →
论文解读

按时刻定点而不是按整片贴标签:SafeLens 如何把语音、字幕和画面拼成可申诉的审核证据

SafeLens 针对短视频中仇恨内容只在少数时刻出现而整片标签会引入时间噪声的问题,用先切分语义片段再融合语音转写、屏幕文字和画面描述并由微调策略大模型输出标签加置信度加一句话理由加伤害类别的结构化判断,演示证据显示其能在同一视频内区分出 93% 与 73% 等不同置信度的多个片段,但原文未报告可复算的检出率与对照基线所以只能作为工作流演示而非性能结论。

 · 更新于 2026-09-24 · 约 18 分钟 · 8965 字 阅读 →
论文解读

用部分更新加偏好反馈保住口型,再用掩码引导实现免训练多人说话

该工作以 Wan2.1 为基座,先用 LoRA 适配长视频,再只更新音频交叉注意力并用自动构造的 DPO 偏好对提升口型与表情,最后在推理侧用空间掩码加权的 Mask-CFG 实现三人以上多人音频驱动,最强证据是 HDTF 与 CelebV-HQ 上的 FID 与 FVD 领先,代价是三阶段大算力训练与推理时多路条件前向的额外开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9028 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-11

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34318 字 阅读 →
论文解读

把海豚叫声当连续向量做渐进式对齐:高斯核替代离散打分的多序列比对

针对海豚发声时长伸缩与连续频谱难以直接比较的问题,论文将 ClustalW 的离散替换得分改为高斯核平均相似度并配合微调 Whisper 的 128 维嵌入做渐进式多序列比对,在成体攻击与幼体游戏攻击两类精细策展数据上以间隙结构与列方差等指标验证了对齐能恢复同步化爆脉冲等时序母题,但代价是领域适配与早停阈值仍需人工校准且过度拉伸会稀释时间分辨率。

 · 更新于 2026-09-24 · 约 29 分钟 · 14278 字 阅读 →
论文解读

用可控的音素光栅把重叠说出来:KABURI-TTS 如何做双通道对话合成

针对双人对话中后通道、打断与重叠难以可控生成的问题,KABURI-TTS 以每说话人的音素光栅与由此导出的语音活动为条件在双通道上渲染对话语音,人在真实对话数据上的主观评测与语音活动统计显示其交互自然度与重叠频次优于强基线,但仍未达到真人对话上限且依赖外部光栅构造的质量。

 · 更新于 2026-09-24 · 约 25 分钟 · 12192 字 阅读 →
论文解读

从歌曲证据到可执行分镜:MVWeaver 为何用层次规划加歌曲到视觉的桥接来做长篇音乐视频

针对全曲音乐视频需要把歌曲语义与音乐结构转成连贯视觉发展的难题,MVWeaver 用层次化规划把总概念逐级展开为可渲染镜头,并用从真实歌曲-MV 对中学习到的歌曲到视觉桥接来条件化规划,证据显示其在歌曲贴合与长程连贯上优于同条件基线,但增益依赖桥接监督与层次资产复用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10949 字 阅读 →
论文解读

把波形峰值关进语义空间:MAPS 如何在非线性功放下同时做对齐与 PAPR 抑制

针对多用户 OFDM 下多模态 Token 经 Modified Rapp 功放非线性失真导致任务精度与能效下降的问题,MAPS 用两阶段训练在嵌入空间联合优化跨模态对齐与均衡 PAPR 抑制,在 IBO=3 dB 时相对同条件基线获得约 64.5% AVQA 精度提升与约 64.4% 任务导向能效提升,代价是引入方差均衡与锚定重构等额外约束以稳定训练。

 · 更新于 2026-09-24 · 约 22 分钟 · 10894 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 93 分钟 · 46170 字 阅读 →
论文解读

轮到谁说话,标签说了算:因果监督如何拆掉流式端点的假权衡

论文把回合结束判断搬进识别器,用语义完整加已观测静音的因果标注训练小 LoRA,在部署一致回放上以 0.97 边界召回、0.39 s 中位延迟、每语音分钟 0.3 次误触发超越全部静音超时,代价是统一多任务后精度回落与离线词错率小幅上升。

 · 更新于 2026-09-24 · 约 18 分钟 · 8771 字 阅读 →
论文解读

从听见写入选项到用选项做决定:音频大模型中声学证据的两阶段路径

在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。

 · 更新于 2026-09-24 · 约 24 分钟 · 11722 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 72 分钟 · 35908 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 87 分钟 · 43538 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26637 字 阅读 →
论文解读

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

语音识别 | 8.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6295 字 阅读 →
论文解读

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6968 字 阅读 →