论文解读

合成错一个词就够了:用 ASR 交叉注意力的清晰度与单调性做词级奖励

针对自回归 TTS 整句打分太粗、难以定位个别错词的问题,论文用冻结 Whisper 交叉注意力算出注意力纯度与对齐单调性两个词级奖励,再做组内相对策略优化,在 CoSyVoice 上把域内 WER 从 5.25 降到 3.21、域外从 8.92 降到 4.54,代价是需要额外采样与 ASR 打分开销且未报告延迟。

 · 更新于 2026-09-24 · 约 18 分钟 · 8632 字 阅读 →
论文解读

整段对话只换一句话:冻结检测器如何给出伪造时间戳

论文把多说话人对话中的手术式伪造注入形式化为时序定位问题,用冻结二分类器加滑窗与迟滞解码器实现零样本定位,在 180 段构造对话上以强骨干达到时序交并比 0.90 左右,但边界位移约 3.5 秒且短时域外生成器注入仍接近全漏检。

 · 更新于 2026-09-24 · 约 16 分钟 · 7725 字 阅读 →
论文解读

冷启动可用与少样本高精度的分野:域不变韵律与自监督表示的跨域语音钓鱼检测对比

在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。

 · 更新于 2026-09-24 · 约 20 分钟 · 9577 字 阅读 →
论文解读

一句里换一种口音:用帧级掩码把全局引导切开

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12956 字 阅读 →
论文解读

主观分数能当奖励吗?当感知预测器遇上可懂度硬约束

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11677 字 阅读 →
论文解读

克隆与匿名本是一体两面:把 27k 小时的 TTS 直接当成隐私滤镜

语音转换 | 8.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8455 字 阅读 →
论文解读

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

空间音频 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6054 字 阅读 →
论文解读

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

音视频语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7543 字 阅读 →
论文解读

Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7842 字 阅读 →
论文解读

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8158 字 阅读 →
论文解读

Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis

语音识别 | 5.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6794 字 阅读 →
论文解读

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

音频生成 | 6.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6421 字 阅读 →
论文解读

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

语音合成 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5681 字 阅读 →
论文解读

DonorRank: Donor Language Selection for Low-Resource Cross-Lingual Speech Recognition

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4656 字 阅读 →
论文解读

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6892 字 阅读 →
论文解读

CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

语音合成 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7332 字 阅读 →
论文解读

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10289 字 阅读 →
论文解读

Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books

音频生成 | 7.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6691 字 阅读 →
论文解读

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

音视频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7118 字 阅读 →
论文解读

Steering dense music retrieval with open-vocabulary concept discovery

音乐检索 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6289 字 阅读 →