论文解读

把截断搬进频域:用 sinc 重采样让振荡器同步不再混叠

音乐生成 | 7.9/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3105 字 阅读 →
论文解读

不估路径,先认出声音:跨终端啸叫为何要改用对象门控

回声消除 | 4.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4302 字 阅读 →
论文解读

把电话声道和业务词汇分开付账:Canary 的两次适配实验

语音识别 | 7.9/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3952 字 阅读 →
论文解读

别等整句说完:把数字人的手势变成一条受因果约束的数据流

音视频交互 | 6.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4260 字 阅读 →
论文解读

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

音乐生成 | 8.7/10

 · 更新于 2026-09-24 · 约 3 分钟 · 1221 字 阅读 →
论文解读

One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output

音乐生成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7660 字 阅读 →
论文解读

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

回声消除 | 7.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5120 字 阅读 →
论文解读

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

语音合成 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4848 字 阅读 →
论文解读

TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems

语音识别 | 9.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5444 字 阅读 →
论文解读

μNet: Ultra-Low-Memory and Low-Complexity Speech Enhancement for Embedded Digital Signal Processors

语音增强 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5258 字 阅读 →
论文解读

A Resource-Efficient CNN-Based EEG Auditory Attention Decoding ASIC

助听器 | 6.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5899 字 阅读 →
论文解读

Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance

音频交互 | 5.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5265 字 阅读 →
论文解读

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3605 字 阅读 →
论文解读

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

音视频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3309 字 阅读 →
论文解读

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

语音交互 | 6.8/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4044 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-19

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19678 字 阅读 →
论文解读

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

音视频语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7543 字 阅读 →
论文解读

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

音频编码 | 3.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6965 字 阅读 →
论文解读

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

音频事件检测 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5752 字 阅读 →
论文解读

Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks

语音增强 | 5.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5815 字 阅读 →