论文解读

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 7010 字 阅读 →
论文解读

Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

语音伪造检测 | 1.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5404 字 阅读 →
论文解读

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

语音识别 | 5.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7082 字 阅读 →
论文解读

Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment

语音情感识别 | 5.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7228 字 阅读 →
论文解读

Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

音视频生成 | 6.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6413 字 阅读 →
论文解读

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6575 字 阅读 →
论文解读

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

语音交互 | 8.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6175 字 阅读 →
论文解读

Mixture-Constrained Max Pooling Improves Separation-Based Bird Species Classification

音频分类 | 5.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6284 字 阅读 →
论文解读

MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing

语音伪造检测 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7094 字 阅读 →
论文解读

Noisy Environment Adaptation of Neural Speech Codec via Focal Mask and Noise Feature Separation

语音增强 | 5.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6505 字 阅读 →
论文解读

NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization

语音转换 | 5.9/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2033 字 阅读 →
论文解读

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

音视频问答 | 5.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6882 字 阅读 →
论文解读

Open-Set Source Tracing as Compositional Factors via Structured Prototypes

语音伪造检测 | 6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6596 字 阅读 →
论文解读

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

音视频理解 | 8/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2302 字 阅读 →
论文解读

Physics-Informed Direction-of-Arrival Estimation Over Distributed Edge Devices

声源定位 | 5.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5362 字 阅读 →
论文解读

Physiological Noise Augmentation Improves Non-Invasive Brain-to-Speech

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7173 字 阅读 →
论文解读

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

音频理解 | 6.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7745 字 阅读 →
论文解读

Progressive Refinement: An Iterative Pseudo-Labeling Approach for Mandarin-English Code-Switching ASR

语音识别 | 4.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7305 字 阅读 →
论文解读

ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions

语音合成 | 7.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6226 字 阅读 →
论文解读

Quantum-Inspired Harmonic Decision Models: A Computational Framework for Music Generation

音乐生成 | 2.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5098 字 阅读 →