论文解读

MeanFlowSE: One-Step Generative Speech Enhancement via Conditional Mean Flow

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3795 字 阅读 →
论文解读

MeanSE: Efficient Generative Speech Enhancement with Mean Flows

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3917 字 阅读 →
论文解读

MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows

语音转换 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5574 字 阅读 →
论文解读

MeanVoiceFlow: One-Step Nonparallel Voice Conversion with Mean Flows

语音转换 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4492 字 阅读 →
论文解读

Measuring Prosody Diversity in Zero-Shot TTS: A New Metric, Benchmark, and Exploration

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4416 字 阅读 →
论文解读

MECap-R1: Emotion-Aware Policy with Reinforcement Learning for Multimodal Emotion Captioning

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5068 字 阅读 →
论文解读

Medical ASR Enhancement by Domain-Specific Reinforcement Fine-Tuning

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4017 字 阅读 →
论文解读

MELA-TTS: Joint Transformer-Diffusion Model with Representation Alignment for Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5124 字 阅读 →
论文解读

Melos: Sentence-To-Section Training with Multi-Task Learning for LLM-Driven Song Generation

音乐生成 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4737 字 阅读 →
论文解读

Membership Inference Attack against Music Diffusion Models via Generative Manifold Perturbation

音频安全 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4376 字 阅读 →
论文解读

MFF-RVRDI: Multimodal Fusion Framework for Robust Video Recording Device Identification

视频设备识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4466 字 阅读 →
论文解读

MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large Audio-Language Model

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4330 字 阅读 →
论文解读

Microphone-Less Measurement of Three-Dimensional Radiating Impulse Response of Sound Source using Spherical Harmonic-Domain Acousto-Optic Tomography

声源定位 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3643 字 阅读 →
论文解读

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

音乐理解 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4303 字 阅读 →
论文解读

Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3909 字 阅读 →
论文解读

Mind Your [m]S, Cross Your [t]S: a Large-Scale Phonetic Analysis of Speech Reproduction in Modern Speech Generators

语音伪造检测 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4597 字 阅读 →
论文解读

MirrorTalk: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3679 字 阅读 →
论文解读

Mispronunciation Detection and Diagnosis Without Model Training: A Retrieval-Based Approach

语音评估 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4234 字 阅读 →
论文解读

Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4158 字 阅读 →
论文解读

Mitigating Data Replication in Text-to-Audio Generative Diffusion Models Through Anti-Memorization Guidance

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →