每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

信噪比为何失准:从相位距离重写音频生成的度量与损失

论文把信噪比失准归因于瞬时相位距离不可靠,用全向相位导数重写相关项得到 GOMPSNR,并在声码器与编解码器上验证其与听感指标更相关且导出损失能提升重建质量,但线性幅度等组合在小数据上存在过拟合代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9170 字 阅读 →
论文解读

从整图配音到按声源混音:SS2A 的拆分解歧义与再混合

针对全局视觉条件丢失局部发声细节的问题,SS2A 用检测与跨模态翻译感知多模态声源,经单声源对比流形解歧义再用注意力混合生成,论文报告其在图像到音频的相关性与多源配比上占优,代价是依赖检测质量与预训练生成器且需单源数据训练。

 · 更新于 2026-09-24 · 约 20 分钟 · 9992 字 阅读 →
论文解读

前缀里藏着计划:用早期打分引导自回归音频走对语义

针对自回归文本到音频在复杂事件上指令跟随下降的问题,论文用前缀隐式计划探测加 Plan-Critic 早期剪枝做引导解码,在相同 token 预算下把 AudioCaps 总体 CLAP 从 26.67 提升到 36.47,代价是需要额外训练一个轻量打分器并依赖 CLAP 作为代理目标。

 · 更新于 2026-09-24 · 约 16 分钟 · 7909 字 阅读 →
论文解读

不只测好听:TTA-Bench 把准确、可靠与责任放在同一张考卷上

TTA-Bench 针对文本到音频生成提出覆盖准确性、效率、泛化、鲁棒性、公平性、偏见与毒性的七维评测,用 2999 条提示与 118314 条人工标注比较十个主流模型,发现 Tango 2 在准确与泛化上领先但毒性率最高,而效率与公平性上各模型分化明显。

 · 更新于 2026-09-24 · 约 19 分钟 · 9218 字 阅读 →
论文解读

在连续隐空间里一次生成一小段:SCAPES 如何用语义嵌入控制环境声纹理

SCAPES 针对环境声纹理的语义可控合成问题,用连续归一化流在 EnCodec 连续隐空间上按原子段自回归建模,并以 CLAP 语义嵌入和历史原子为条件,在约 34 分钟数据、单张消费级 GPU 约 1 小时训练的条件下实现长时稳定生成,代价是难以处理语音与复调音乐所需的长程结构。

 · 更新于 2026-09-24 · 约 20 分钟 · 9749 字 阅读 →
论文解读

打开混响黑盒:从 Schroeder 结构到可核对的分析与移植路径

论文以 Schroeder 历史混响为案例,主张用开放架构重建 comb 与 all-pass 组合,通过 Csound 脉冲响应分析与 par/seq 重建验证理解过程,代价是遇到效率限制而把 C 编译 opcode 留作后续工作。

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
论文解读

在噪声里听见和弦:一次卷积如何让田野录音带上调性色彩

音乐生成 | 5.9/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10057 字 阅读 →
论文解读

把声学公式写进损失:PhysWave 如何让扩散模型不再猜方向

音频生成 | 6.6/10

 · 更新于 2026-09-24 · 约 28 分钟 · 13764 字 阅读 →
论文解读

当混响不再模仿房间:用声码器思路把噪声织成尾响

音频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9147 字 阅读 →
论文解读

当目标永远无法被完美复刻,我们该如何评判模仿的好坏?

音频生成 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5751 字 阅读 →
论文解读

边播边改:当音视频生成从片段走向持续世界

音频生成 | 8.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8087 字 阅读 →
论文解读

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

音乐生成 | 8.7/10

 · 更新于 2026-09-24 · 约 3 分钟 · 1221 字 阅读 →
论文解读

Vibrato Matching for Modulation Control and Blending in Sound Mixtures

音频生成 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4279 字 阅读 →
论文解读

Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance

音频交互 | 5.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5265 字 阅读 →
论文解读

FM Synthesizer Audio-Parameter Shared Embeddings

音频生成 | 7.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4702 字 阅读 →
论文解读

Sounds Uncertain: Exploring the Affective Aspects of Sonification for Uncertainty Visualization

音频生成 | 6.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4366 字 阅读 →
论文解读

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

音频生成 | 6.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6421 字 阅读 →
论文解读

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

音频生成 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6649 字 阅读 →
论文解读

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

音频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7722 字 阅读 →