论文解读

On The Design of Efficient Neural Methods for Geometry-Agnostic Multichannel Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4364 字 阅读 →
论文解读

On the Design of Higher-Order Time-Intensity Microphone Arrays for Panoramic Audio Recording and Reproduction

空间音频 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4217 字 阅读 →
论文解读

One Model–Three Tasks: Discovering a Shared Winning Ticket for Low-Complexity Audio Intelligence

音频分类 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3730 字 阅读 →
论文解读

Online Register For Dual-Mode Self-Supervised Speech Models: Mitigating the Lack of Future Context

语音识别 | 6.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5121 字 阅读 →
论文解读

Optimizing Domain-Adaptive Self-Supervised Learning for Clinical Voice-Based Disease Classification

语音生物标志物 | 7.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4984 字 阅读 →
论文解读

Optimizing Speech Language Models for Acoustic Consistency

语音合成 | 8.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4747 字 阅读 →
论文解读

OV-INSTRUCTTTS: Towards Open-Vocabulary Instruct Text-to-Speech

语音合成 | 8.0/10

 · 更新于 2026-09-16 · 约 12 分钟 · 5743 字 阅读 →
论文解读

PAC: Pronunciation-Aware Contextualized Large Language Model-Based Automatic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4114 字 阅读 →
论文解读

PADAM: Perceptual Audio Defect Assessment Model

音频分类 | 7.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4814 字 阅读 →
论文解读

ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-Based Neural Speech Codec

语音增强 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4793 字 阅读 →
论文解读

Parametric Neural Amp Modeling with Active Learning

音频生成 | 8.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3918 字 阅读 →
论文解读

PC-MCL: Patient-Consistent Multi-Cycle Learning with Multi-Label Bias Correction for Respiratory Sound Classification

音频分类 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 5005 字 阅读 →
论文解读

Peeking Into the Future for Contextual Biasing

语音识别 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5086 字 阅读 →
论文解读

Perceptual Loss Optimized HRTF Personalization in Spherical Harmonic Domain

空间音频 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5312 字 阅读 →
论文解读

Perceptual Quality Assessment for Stylized Talking Heads

模型评估 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4192 字 阅读 →
论文解读

PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos

歌唱语音合成 | 4.5/10

 · 更新于 2026-09-16 · 约 3 分钟 · 1471 字 阅读 →
论文解读

Personal Sound Zones with Flexible Bright Zone Control

空间音频 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4206 字 阅读 →
论文解读

PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models

语音对话系统 | 8.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4703 字 阅读 →
论文解读

PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion

语音合成 | 7.0/10

 · 更新于 2026-09-16 · 约 13 分钟 · 6124 字 阅读 →
论文解读

PG-SE: Predictive Acceleration and Correction for Generative Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5158 字 阅读 →