论文解读

先想明白再开口:用数据清洗、蒸馏与偏好对齐修好上下文语音合成

针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9249 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

对齐很粗时更要扣准起音:把 Snapping 做成按音高的全局分配

针对乐谱与真实录音只有粗对齐时标注不够准的问题,该文把逐音符的起音修正做成按音高独立的二分图匹配,并在 MusicNet 训练、多数据集测试中报告了对贪心修正的一致提升,代价是窗口越大越依赖后验质量与一对一约束是否成立。

 · 更新于 2026-09-24 · 约 18 分钟 · 8558 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

大规模与噪声下还要控准基频:VAE-SiFiGAN 用重合成误差筛掉 F0 提取错误

针对 F0 可控声码器在大规模多说话人训练和噪声下是否仍可控的问题,论文用概率潜变量替代确定性特征并以重合成谱误差做数据筛选,报告显示筛选能阻止错误数据拖累训练、上移 F0 时清浊判断更准而下移与高频区仍有挑战、噪声下优于基线,但筛选阈值仍需人工设定。

 · 更新于 2026-09-24 · 约 19 分钟 · 9402 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

会话共现能否留下歌手之外的听感结构:一次可证伪的残差检验

论文把播放会话当句子训练跳元向量并用艺术家质心相减剥离歌手身份,以原始均值 0.2487 降至残差均值 0.0005 后仍有 4577 对跨歌手高相似为存在性证据,但自动播放混杂与重度用户偏差使结论止于信号存在而不及推荐性能。

 · 更新于 2026-09-24 · 约 22 分钟 · 10739 字 阅读 →
论文解读

把质检口语变成可执行依赖图:语音数据质量的多智能体 overnight 流水线

论文把自然语言质检需求编译为依赖感知的有向无环工作流并调用 24 个音频与文本核查工具,在专家一致率 80-90% 的条件下把人工成本时间压到 20% 以下,代价是规划器选型与幻觉和运行时的权衡。

 · 更新于 2026-09-24 · 约 18 分钟 · 8711 字 阅读 →
论文解读

指令 supervision 不稳:先把改写漂移管住,再把覆盖面铺开

论文把 Instruct-TTS 训练不稳归因于标签转指令中超过 40% 的语义漂移,用可控改写扩大覆盖、用大模型校验过滤保真、再用音高语速音量扰动补齐韵律监督,在中文评测上把平均指令遵循率做到 56.4%,代价是组合过滤只保留约 61.5% 候选。

 · 更新于 2026-09-24 · 约 17 分钟 · 8092 字 阅读 →
论文解读

A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer

语音交互 | 9.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5555 字 阅读 →
论文解读

Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE

音视频语音分离 | 6.8/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10746 字 阅读 →
论文解读

From a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and Kalenjin

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4601 字 阅读 →
论文解读

From Continuous Deployment to Queryable Dataset: Terabyte-Scale AIS-Aligned Passive Acoustic Labelling

音频理解 | 6.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6337 字 阅读 →
论文解读

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6524 字 阅读 →
论文解读

Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities

基准测试 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6409 字 阅读 →
论文解读

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

音频分离 | 9.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6048 字 阅读 →
论文解读

Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track

语音合成 | 5.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5445 字 阅读 →
论文解读

UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations

语音识别 | 7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7835 字 阅读 →
论文解读

FSD50K-Solo: Automated Curation of Single-Source Sound Events

数据清洗 | 5.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6839 字 阅读 →
论文解读

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

多模态模型评估 | 5.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9061 字 阅读 →