论文解读

不训练新模型:在编解码器令牌上借音色、保节奏

问题是用现成神经音频编解码器做可演奏的音色迁移,方法是不训练新生成器而检索调色板令牌颗粒并做连续性约束的序列选择与分组替换,最强证据是调色板扩展下中位实时系数仍低于实时,而代价是分块渲染与完整上下文不等价且缺乏听感验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10168 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把台词说得像那个人:ActorMind 用看听想说四步做语音角色扮演

针对文本角色扮演忽略语音自发性和人物声音一致性的问题,ActorMind 用眼耳脑口四智能体的现成推理流程组织语音合成,在 Friends 第一季构建的 7653 句基准上以 RP-MOS 取得平均 3.56 分的报告结果,但其评估依赖小规模主观打分且未训练模型参数。

 · 更新于 2026-09-24 · 约 20 分钟 · 9662 字 阅读 →
论文解读

不用翻译腔造平行对话:以大纲约束换取四语可比的健康问答语音数据

针对多语平行口语对话稀缺且翻译腔重的问题,论文用 WHO 知识库加对话行为大纲加母语者即兴实现的方法造出 6 千对话与 163 小时语音,基准显示英语检索与过滤持续领先而阿拉伯语最低,代价是内容未经临床验证且语音到文本检索几乎失效。

 · 更新于 2026-09-24 · 约 18 分钟 · 8614 字 阅读 →
论文解读

长会议听不懂也找不着:用多维图加计划智能体做可定位问答

针对长会议中声学线索缺失与上下文碎片化问题,论文把会议建成多维异构图并用计划执行反思智能体检索生成,在 LongAudioQA 三套数据上以语义准确率为证据取得领先,但迭代规划带来更高推理开销且依赖上游识别与说话人分离质量。

 · 更新于 2026-09-24 · 约 22 分钟 · 10529 字 阅读 →
论文解读

先把长语音变短再回答:用类文本表示搭桥的端到端语音检索器 CLSR

针对长语音问答中大音频语言模型难以直接处理十几分钟以上上下文的问题,论文提出先把语音转成类文本表示再做对比检索的 CLSR,用四个数据集的召回对照和长文问答的抽取验证支撑该路线,并以联合训练三项损失与冻结文本编码器为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9797 字 阅读 →
论文解读

在野外伪造面前,专用检测器失灵时比较推理如何兜底

针对录音室训练的专用检测器在野外自发语音上泛化崩塌的问题,论文提出免训练的比较引导上下文学习框架,用成对证据生成与对账过滤幻觉,并用分布外路由把难样本交给音频语言模型,在三个野外数据集上报告了高于基线的宏平均 F1,但以录音室数据性能下降和依赖闭源模型生成证据为代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9138 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

英语音色说法语汉语为何走调:语言标签与词项检索如何稳住跨语种克隆

该工作以 FishAudio-S2-Pro 为基座研究英语参考到法语阿拉伯语汉语的跨语种克隆,用母语文字语言标签减少口音泄漏并以 GRPO 强化微调改善可懂度,再用推理时参考检索做词项匹配以稳住领域词发音,代价是汉语基线一度波动且说话人相似度与自然度总体保持稳定而非大幅提升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7699 字 阅读 →
论文解读

用黑盒发射策略把离线大模型压成同传:Parakeet 加 Qwen 的级联取舍

该工作用 Parakeet 做流式识别、Qwen 3.5 做流式翻译并以黑盒前缀策略控制提交时机,在 MCIF 长语音上以高延迟配置换质量、低延迟用掩码重翻译补足,并用词表增强与检索示例做上下文轨道,代价是更宽松策略会带来可测的质量回落与闪烁。

 · 更新于 2026-09-24 · 约 19 分钟 · 9109 字 阅读 →
论文解读

长音频查不完:先规划模态与时间,再用结构化查询取小证据

针对 10 分钟到 540 分钟音频中说话内容、说话人、情感与声音事件交织推理难的问题,PlanRAG-Audio 先把音频离线转成时间对齐的结构化库,再按问题规划检索并只取相关片段生成答案,以检索把推理代价与原始长度解耦,代价是受上游感知精度约束并需承担离线预处理开销。

 · 更新于 2026-09-24 · 约 22 分钟 · 10857 字 阅读 →
论文解读

缺音频不靠想象:从真实语义库中检索再净化

针对推理时音频或视觉缺失的音视问答,论文提出先检索真实特征再做上下文净化的 R2ScP 路线,报告在 Music-AVQA 平均 71.54% 与 AVQA 平均 76.35% 的准确率,代价是对检索库质量敏感且只处理推理阶段缺失。

 · 更新于 2026-09-24 · 约 21 分钟 · 10253 字 阅读 →
论文解读

盲评多说话人长对话问答:微调记忆、上下文纠偏与语音锚定检索的三条路线

针对无预切分、无说话人标签的 21 语言多说话人长对话选择题任务,论文对比了 Voxtral-Mini-3B 的 LoRA 微调、冻结 Voxtral-24B 的多模态上下文学习纠偏、以及免训练语音锚定检索三条路线,最强证据是上下文学习在第二阶段评测取得 0.81 准确率,代价是微调在小数据上过拟合回落与检索前端依赖转写和切分质量。

 · 更新于 2026-09-24 · 约 20 分钟 · 9961 字 阅读 →
论文解读

不更新参数如何让阿拉伯方言识别变准:提示、前缀与代理重排的三条推理时通路

针对阿拉伯语标准语与多方言零样本识别落差,论文用解码器提示、编码器加解码器前缀和 CTC 代理引导 n-best 重选三种免训练上下文接入,在十个条件下取得 MSA 相对 22.29% 等词错率下降,代价是首遍解码、检索与合成带来的额外延迟与对辅助信号质量的依赖。

 · 更新于 2026-09-24 · 约 22 分钟 · 10589 字 阅读 →
论文解读

从快速重复音节到可解释的重度判断:CLINIC-GENIE 如何把分类、归因和病历类比装进一条管线

针对卒中后构音障碍的交替与顺序轮替发音任务,CLINIC 用临床可解释声学特征联合频谱与自监督语音表示做三级严重度分类并用 Shapley 值归因,GENIE 再用检索到的相似病例生成韩文四维度解释,报告显示平衡准确率 0.952 且重度召回 1.000,专家保真度 4.94,但重度样本少且仅覆盖任务化语音。

 · 更新于 2026-09-24 · 约 22 分钟 · 10523 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

先按人找声音,再按位置修声音:用空间相关增强 HRTF 个性化

针对未见被试在稀疏测量下难以个性化 HRTF 的问题,该工作用图网络分别做基于被试检索的个性化和基于位置检索的上采样,再用前者输出微调后者,报告在 SONICOM 上 3 个方向时把 LSD 从 4.33 dB 降到 3.60 dB,代价是需要先测少量方向并做两阶段预训练加微调。

 · 更新于 2026-09-24 · 约 23 分钟 · 11100 字 阅读 →
论文解读

听到更多却用更少:为对话语音检索并精选一条最相关的历史

针对对话语音中固定取前几句会引入无关冗余、取全量历史又成本过高的问题,论文提出多模态检索加精选方法 MARS,只取一条声学或语义最相关的历史来辅助当前句识别,并在 1.5K 小时训练下报告了优于 179K 小时顶级系统的混合错误率,代价是依赖微调 Whisper 建库与两遍解码的额外检索计算。

 · 更新于 2026-09-24 · 约 21 分钟 · 10079 字 阅读 →
论文解读

直播不是更长的短视频:LiViBench 如何测互动理解与评论利用

针对主播与观众实时互动的直播视频理解问题,论文用多智能体加种子问题的人机协同流程构建含音频语音评论的 3168 视频 3175 题基准,并以两阶段指令微调加视频到评论检索训练 LiVi-LLM-7B,在 LiViBench 上报告 64.4% 的总准确率,代价是仍落后最优闭源模型的直播专有任务与对海量评论的依赖取舍。

 · 更新于 2026-09-24 · 约 19 分钟 · 9418 字 阅读 →